Torna all'archivio
NLP
Repository GitHubPipeline di trascrizioni YouTube
Da link YouTube selezionati a dataset puliti ed esperimenti NLP ripetibili.
Riepilogo
La pipeline scarica le trascrizioni dei video scelti, le pulisce e struttura per produrre dati analizzabili. Supporta esperimenti ripetibili da TF-IDF e regressione logistica fino ai modelli LSTM.
Da video selezionati ad artefatti NLP riutilizzabili
Lista video
I link scelti definiscono le fonti
Raccolta
L'automazione recupera le trascrizioni
Preparazione
La pulizia produce dati analizzabili
Esperimenti
Modelli classici e LSTM classificano il testo
Artefatti
Dati, metriche e modelli restano riutilizzabili
Cosa gestisce il sistema
Trasforma link selezionati in dati puliti, baseline e artefatti riutilizzabili.
Tecnologia
Stack
PythonPlaywrightpandasscikit-learnTF-IDFLogistic RegressionLSTMTensorFlow/KerasCLI
Aree
NLPPipeline di datiAutomazione
Conclusioni
- Il flusso riproducibile separa raccolta, pulizia e modellazione.
- Le baseline offrono un riferimento comprensibile per modelli più complessi.
- Dati e artefatti salvati facilitano gli esperimenti successivi.
12 link12 trascrizioni8.430 righe3 modelli
Vuoi esaminare l'implementazione?
Il repository contiene codice sorgente, istruzioni di configurazione e cronologia dello sviluppo.