NLP
Repository GitHubPipeline pentru transcrieri YouTube
De la linkuri YouTube selectate la seturi de date curate și experimente NLP reproductibile.
Rezumat
Pipeline-ul pornește de la o listă selectată, preia transcrierile, curăță și structurează textul și produce seturi pregătite pentru analiză. Susține baseline-uri TF-IDF și logistic regression, precum și modele LSTM.
De la videoclipuri selectate la artefacte NLP reutilizabile
Listă video
Linkurile selectate definesc colecția sursă
Preluare
Automatizarea obține transcrierile disponibile
Pregătire
Curățarea produce seturi gata de analiză
Experimente
Modelele clasice și LSTM rulează clasificări
Artefacte
Datele, metricile și modelele rămân reutilizabile
Ce gestionează sistemul
Transformă linkuri YouTube selectate în seturi de transcrieri curate, experimente baseline și artefacte reutilizabile.
Tehnologie
Stack
Domenii
Concluzii
- Pipeline-ul repetabil oferă experimentelor NLP o sursă de date reproductibilă.
- Baseline-urile TF-IDF oferă o referință importantă înaintea complexității unui LSTM.
- Disponibilitatea și calitatea transcrierilor rămân constrângeri externe care trebuie păstrate vizibile în date.
Vrei să inspectezi implementarea?
Repository-ul conține codul sursă, instrucțiunile de configurare și istoricul dezvoltării.