Resumen

El pipeline descarga transcripciones de vídeos seleccionados, las limpia y estructura y genera conjuntos analizables. Admite experimentos repetibles desde TF-IDF y regresión logística hasta modelos LSTM.

De vídeos seleccionados a artefactos NLP reutilizables

Lista de vídeos

Los enlaces seleccionados definen las fuentes

Obtención

La automatización descarga las transcripciones disponibles

Preparación

La limpieza produce datos listos para analizar

Experimentos

Modelos clásicos y LSTM ejecutan clasificaciones

Artefactos

Datos, métricas y modelos permanecen reutilizables

Qué gestiona el sistema

Convierte enlaces seleccionados en datos limpios, baselines y artefactos reutilizables.

Tecnología

Stack

PythonPlaywrightpandasscikit-learnTF-IDFLogistic RegressionLSTMTensorFlow/KerasCLI

Áreas

NLPPipelines de datosAutomatización

Conclusiones

  • El flujo reproducible separa recopilación, limpieza y modelado.
  • Los baselines ofrecen una referencia comprensible para modelos más complejos.
  • Los datos y artefactos guardados permiten continuar los experimentos.
Una ejecución de datos reutilizable
12 enlaces12 transcripciones8.430 filas3 modelos

¿Quieres revisar la implementación?

El repositorio contiene el código, las instrucciones de configuración y el historial de desarrollo.

Abrir repositorio