NLP
Repositorio de GitHubPipeline de transcripciones de YouTube
De enlaces seleccionados a conjuntos de datos limpios y experimentos NLP repetibles.
Resumen
El pipeline descarga transcripciones de vídeos seleccionados, las limpia y estructura y genera conjuntos analizables. Admite experimentos repetibles desde TF-IDF y regresión logística hasta modelos LSTM.
De vídeos seleccionados a artefactos NLP reutilizables
Lista de vídeos
Los enlaces seleccionados definen las fuentes
Obtención
La automatización descarga las transcripciones disponibles
Preparación
La limpieza produce datos listos para analizar
Experimentos
Modelos clásicos y LSTM ejecutan clasificaciones
Artefactos
Datos, métricas y modelos permanecen reutilizables
Qué gestiona el sistema
Convierte enlaces seleccionados en datos limpios, baselines y artefactos reutilizables.
Tecnología
Stack
Áreas
Conclusiones
- El flujo reproducible separa recopilación, limpieza y modelado.
- Los baselines ofrecen una referencia comprensible para modelos más complejos.
- Los datos y artefactos guardados permiten continuar los experimentos.
¿Quieres revisar la implementación?
El repositorio contiene el código, las instrucciones de configuración y el historial de desarrollo.