Rezumat

Pipeline-ul pornește de la o listă selectată, preia transcrierile, curăță și structurează textul și produce seturi pregătite pentru analiză. Susține baseline-uri TF-IDF și logistic regression, precum și modele LSTM.

De la videoclipuri selectate la artefacte NLP reutilizabile

Listă video

Linkurile selectate definesc colecția sursă

Preluare

Automatizarea obține transcrierile disponibile

Pregătire

Curățarea produce seturi gata de analiză

Experimente

Modelele clasice și LSTM rulează clasificări

Artefacte

Datele, metricile și modelele rămân reutilizabile

Ce gestionează sistemul

Transformă linkuri YouTube selectate în seturi de transcrieri curate, experimente baseline și artefacte reutilizabile.

Tehnologie

Stack

PythonPlaywrightpandasscikit-learnTF-IDFLogistic RegressionLSTMTensorFlow/KerasCLI

Domenii

NLPPipeline-uri de dateAutomatizare

Concluzii

  • Pipeline-ul repetabil oferă experimentelor NLP o sursă de date reproductibilă.
  • Baseline-urile TF-IDF oferă o referință importantă înaintea complexității unui LSTM.
  • Disponibilitatea și calitatea transcrierilor rămân constrângeri externe care trebuie păstrate vizibile în date.
O rulare de date reutilizabilă
12 linkuri12 transcrieri8.430 rânduri3 modele

Vrei să inspectezi implementarea?

Repository-ul conține codul sursă, instrucțiunile de configurare și istoricul dezvoltării.

Deschide repository-ul