Zurück zum Projektarchiv

NLP

GitHub-Repository

YouTube-Transkript-Pipeline

Von ausgewählten YouTube-Links zu sauberen Datensätzen und wiederholbaren NLP-Experimenten.

Zusammenfassung

Die Pipeline lädt Transkripte ausgewählter Videos, bereinigt und strukturiert sie und erzeugt analysierbare Datensätze. Sie unterstützt wiederholbare Experimente von TF-IDF und logistischer Regression bis zu LSTM-Modellen.

Von ausgewählten Videos zu wiederverwendbaren NLP-Artefakten

Videoliste

Ausgewählte Links definieren die Quellen

Abruf

Die Automatisierung lädt verfügbare Transkripte

Vorbereitung

Bereinigung erzeugt analysierbare Datensätze

Experimente

Klassische Modelle und LSTMs führen Klassifikationen aus

Artefakte

Daten, Metriken und Modelle bleiben wiederverwendbar

Was das System abdeckt

Überführt kuratierte Links in bereinigte Datensätze, Baselines und wiederverwendbare Artefakte.

Technologie

Stack

PythonPlaywrightpandasscikit-learnTF-IDFLogistic RegressionLSTMTensorFlow/KerasCLI

Bereiche

NLPDatenpipelinesAutomatisierung

Ergebnisse

  • Der reproduzierbare Ablauf trennt Datensammlung, Bereinigung und Modellierung.
  • Baselines schaffen einen verständlichen Vergleichspunkt für komplexere Modelle.
  • Gespeicherte Datensätze und Artefakte unterstützen weitere Experimente.
Ein wiederverwendbarer Datenlauf
12 Links12 Transkripte8.430 Zeilen3 Modelle

Möchtest du die Implementierung prüfen?

Das Repository enthält Quellcode, Einrichtungshinweise und Entwicklungshistorie.

Repository öffnen