Revenir aux archives

NLP

Dépôt GitHub

Pipeline de transcriptions YouTube

De liens YouTube sélectionnés à des jeux de données propres et des expériences NLP répétables.

Résumé

Le pipeline télécharge les transcriptions de vidéos choisies, les nettoie et les structure pour produire des données analysables. Il permet des expériences répétables allant de TF-IDF et la régression logistique aux modèles LSTM.

Des vidéos sélectionnées aux artefacts NLP réutilisables

Liste de vidéos

Les liens choisis définissent les sources

Collecte

L'automatisation récupère les transcriptions

Préparation

Le nettoyage produit des données analysables

Expériences

Modèles classiques et LSTM classifient les textes

Artefacts

Données, métriques et modèles restent réutilisables

Ce que le système prend en charge

Transforme des liens sélectionnés en données propres, baselines et artefacts réutilisables.

Technologie

Stack

PythonPlaywrightpandasscikit-learnTF-IDFLogistic RegressionLSTMTensorFlow/KerasCLI

Domaines

NLPPipelines de donnéesAutomatisation

Conclusions

  • Le parcours reproductible sépare collecte, nettoyage et modélisation.
  • Les baselines offrent un repère compréhensible pour les modèles plus complexes.
  • Les données et artefacts conservés facilitent les expériences suivantes.
Une exécution de données réutilisable
12 liens12 transcriptions8 430 lignes3 modèles

Vous souhaitez examiner l'implémentation ?

Le dépôt contient le code source, les instructions d'installation et l'historique du développement.

Ouvrir le dépôt