Volver al archivo de proyectos

IA aplicada

Repositorio de GitHub

Motor de búsqueda semántica multimodal y RAG

Buscar imágenes y vídeos localmente mediante lenguaje natural, con resultados medibles.

Contexto: Sistema de búsqueda con IA multimodal

Periodo: 2025-10 a Actualidad

Resumen

El sistema FastAPI, React/Vite y CLI combina embeddings CLIP, búsqueda de vecinos con FAISS, reordenación mediante descripciones y explicaciones locales generadas con Ollama.

De una consulta en lenguaje natural a evidencia visual ordenada

Consulta

El usuario describe la imagen o el vídeo buscado

Codificación CLIP

Texto y contenido multimedia comparten el mismo espacio de embeddings

Búsqueda FAISS

El índice encuentra los vecinos relevantes

Reordenación

Descripciones y señales de recuperación ajustan el orden

Resultados

La interfaz muestra contenido ordenado y explicaciones

Qué gestiona el sistema

Ordena imágenes y vídeos para consultas en lenguaje natural.

Utiliza embeddings CLIP y FAISS para texto, imágenes y fotogramas.

Incluye varios flujos de recuperación y búsqueda inversa.

Genera explicaciones de forma local con Ollama.

Benchmark de recuperación medido

Evaluación con COCO Captions, 200 consultas e índices independientes de 1.000 y 5.000 imágenes.

Recall@10

0,88

Índice de 1.000 imágenes

Recall@10

0,57

Índice de 5.000 imágenes

Recall@1 / @5 / @10

0,46 / 0,755 / 0,88

200 consultas de COCO Captions

Latencia media por consulta

6,92ms

Índice de 1.000 imágenes

Tecnología

Stack

PythonFastAPIReactViteFAISSHNSWCLIPPyTorchOpenCVOllamaRAGVector embeddings

Áreas

IA aplicadaSistemas de recuperaciónRAGVisión por computadorBúsqueda vectorialIA full-stack

Benchmark de recuperación

Resultados guardados del benchmark

Cómo cambia la recuperación al crecer el índice

Cambia entre los tamaños evaluados para comparar Recall@K y latencia controlada. La latencia de aplicación procede de otro registro e incluye una parte mayor del flujo completo.

Comparación de Recall

200 consultas de evaluación
Recall@146%
Recall@575,5%
Recall@1088%

Recall@10: 88% de las coincidencias relevantes recuperadas

Contexto de ejecución de la aplicación

209 eventos registrados
Media de búsqueda registrada
68,07 ms
Media de explicación del LLM local
13,74 s

La consulta evaluada de 6,9 ms y la búsqueda registrada de 68,07 ms miden recorridos distintos, por lo que conservan etiquetas y contextos temporales separados.

Ver los JSON del benchmark en GitHub

Conclusiones

  • El lenguaje cotidiano se convierte directamente en evidencia visual ordenada.
  • Los benchmarks permiten comparar calidad de recuperación y latencia.
  • El navegador y la CLI comparten el mismo flujo reproducible.

¿Quieres revisar la implementación?

El repositorio contiene el código, las instrucciones de configuración y el historial de desarrollo.

Abrir repositorio