NLP
GitHub-RepositoryYouTube-Transkript-Pipeline
Von ausgewählten YouTube-Links zu sauberen Datensätzen und wiederholbaren NLP-Experimenten.
Zusammenfassung
Die Pipeline lädt Transkripte ausgewählter Videos, bereinigt und strukturiert sie und erzeugt analysierbare Datensätze. Sie unterstützt wiederholbare Experimente von TF-IDF und logistischer Regression bis zu LSTM-Modellen.
Von ausgewählten Videos zu wiederverwendbaren NLP-Artefakten
Videoliste
Ausgewählte Links definieren die Quellen
Abruf
Die Automatisierung lädt verfügbare Transkripte
Vorbereitung
Bereinigung erzeugt analysierbare Datensätze
Experimente
Klassische Modelle und LSTMs führen Klassifikationen aus
Artefakte
Daten, Metriken und Modelle bleiben wiederverwendbar
Was das System abdeckt
Überführt kuratierte Links in bereinigte Datensätze, Baselines und wiederverwendbare Artefakte.
Technologie
Stack
Bereiche
Ergebnisse
- Der reproduzierbare Ablauf trennt Datensammlung, Bereinigung und Modellierung.
- Baselines schaffen einen verständlichen Vergleichspunkt für komplexere Modelle.
- Gespeicherte Datensätze und Artefakte unterstützen weitere Experimente.
Möchtest du die Implementierung prüfen?
Das Repository enthält Quellcode, Einrichtungshinweise und Entwicklungshistorie.