IA aplicada
Repositorio de GitHubMotor de búsqueda semántica multimodal y RAG
Buscar imágenes y vídeos localmente mediante lenguaje natural, con resultados medibles.
Contexto: Sistema de búsqueda con IA multimodal
Periodo: 2025-10 a Actualidad
Resumen
El sistema FastAPI, React/Vite y CLI combina embeddings CLIP, búsqueda de vecinos con FAISS, reordenación mediante descripciones y explicaciones locales generadas con Ollama.
De una consulta en lenguaje natural a evidencia visual ordenada
Consulta
El usuario describe la imagen o el vídeo buscado
Codificación CLIP
Texto y contenido multimedia comparten el mismo espacio de embeddings
Búsqueda FAISS
El índice encuentra los vecinos relevantes
Reordenación
Descripciones y señales de recuperación ajustan el orden
Resultados
La interfaz muestra contenido ordenado y explicaciones
Qué gestiona el sistema
Ordena imágenes y vídeos para consultas en lenguaje natural.
Utiliza embeddings CLIP y FAISS para texto, imágenes y fotogramas.
Incluye varios flujos de recuperación y búsqueda inversa.
Genera explicaciones de forma local con Ollama.
Benchmark de recuperación medido
Evaluación con COCO Captions, 200 consultas e índices independientes de 1.000 y 5.000 imágenes.
Recall@10
0,88
Índice de 1.000 imágenes
Recall@10
0,57
Índice de 5.000 imágenes
Recall@1 / @5 / @10
0,46 / 0,755 / 0,88
200 consultas de COCO Captions
Latencia media por consulta
6,92ms
Índice de 1.000 imágenes
Tecnología
Stack
Áreas
Benchmark de recuperación
Resultados guardados del benchmark
Cómo cambia la recuperación al crecer el índice
Cambia entre los tamaños evaluados para comparar Recall@K y latencia controlada. La latencia de aplicación procede de otro registro e incluye una parte mayor del flujo completo.Comparación de Recall
200 consultas de evaluaciónRecall@10: 88% de las coincidencias relevantes recuperadas
Contexto de ejecución de la aplicación
209 eventos registrados- Media de búsqueda registrada
- 68,07 ms
- Media de explicación del LLM local
- 13,74 s
La consulta evaluada de 6,9 ms y la búsqueda registrada de 68,07 ms miden recorridos distintos, por lo que conservan etiquetas y contextos temporales separados.
Ver los JSON del benchmark en GitHubConclusiones
- El lenguaje cotidiano se convierte directamente en evidencia visual ordenada.
- Los benchmarks permiten comparar calidad de recuperación y latencia.
- El navegador y la CLI comparten el mismo flujo reproducible.
¿Quieres revisar la implementación?
El repositorio contiene el código, las instrucciones de configuración y el historial de desarrollo.