Torna all'archivio

NLP

Repository GitHub

Pipeline di trascrizioni YouTube

Da link YouTube selezionati a dataset puliti ed esperimenti NLP ripetibili.

Riepilogo

La pipeline scarica le trascrizioni dei video scelti, le pulisce e struttura per produrre dati analizzabili. Supporta esperimenti ripetibili da TF-IDF e regressione logistica fino ai modelli LSTM.

Da video selezionati ad artefatti NLP riutilizzabili

Lista video

I link scelti definiscono le fonti

Raccolta

L'automazione recupera le trascrizioni

Preparazione

La pulizia produce dati analizzabili

Esperimenti

Modelli classici e LSTM classificano il testo

Artefatti

Dati, metriche e modelli restano riutilizzabili

Cosa gestisce il sistema

Trasforma link selezionati in dati puliti, baseline e artefatti riutilizzabili.

Tecnologia

Stack

PythonPlaywrightpandasscikit-learnTF-IDFLogistic RegressionLSTMTensorFlow/KerasCLI

Aree

NLPPipeline di datiAutomazione

Conclusioni

  • Il flusso riproducibile separa raccolta, pulizia e modellazione.
  • Le baseline offrono un riferimento comprensibile per modelli più complessi.
  • Dati e artefatti salvati facilitano gli esperimenti successivi.
Un'esecuzione dati riutilizzabile
12 link12 trascrizioni8.430 righe3 modelli

Vuoi esaminare l'implementazione?

Il repository contiene codice sorgente, istruzioni di configurazione e cronologia dello sviluppo.

Apri il repository