NLP
Dépôt GitHubPipeline de transcriptions YouTube
De liens YouTube sélectionnés à des jeux de données propres et des expériences NLP répétables.
Résumé
Le pipeline télécharge les transcriptions de vidéos choisies, les nettoie et les structure pour produire des données analysables. Il permet des expériences répétables allant de TF-IDF et la régression logistique aux modèles LSTM.
Des vidéos sélectionnées aux artefacts NLP réutilisables
Liste de vidéos
Les liens choisis définissent les sources
Collecte
L'automatisation récupère les transcriptions
Préparation
Le nettoyage produit des données analysables
Expériences
Modèles classiques et LSTM classifient les textes
Artefacts
Données, métriques et modèles restent réutilisables
Ce que le système prend en charge
Transforme des liens sélectionnés en données propres, baselines et artefacts réutilisables.
Technologie
Stack
Domaines
Conclusions
- Le parcours reproductible sépare collecte, nettoyage et modélisation.
- Les baselines offrent un repère compréhensible pour les modèles plus complexes.
- Les données et artefacts conservés facilitent les expériences suivantes.
Vous souhaitez examiner l'implémentation ?
Le dépôt contient le code source, les instructions d'installation et l'historique du développement.