Angewandte KI
GitHub-RepositoryMultimodale semantische Suche und RAG-Engine
Bilder und Videos lokal in natürlicher Sprache durchsuchen, mit messbaren Ergebnissen.
Kontext: Multimodales KI-Suchsystem
Zeitraum: 2025-10 bis Heute
Zusammenfassung
Das FastAPI-, React/Vite- und CLI-System kombiniert CLIP-Embeddings, FAISS-Nachbarsuche, Caption-Reranking und lokale Erklärungen über Ollama.
Von einer natürlichsprachlichen Anfrage zu geordneten visuellen Belegen
Anfrage
Der Nutzer beschreibt das gesuchte Bild oder Video
CLIP-Encoding
Text und Medien gelangen in denselben Embedding-Raum
FAISS-Suche
Der Index findet relevante Nachbarn
Reranking
Beschreibungen und Retrieval-Signale verfeinern die Reihenfolge
Ergebnisse
Die Oberfläche zeigt geordnete Medien und Erklärungen
Was das System abdeckt
Ordnet Bild- und Videoergebnisse zu natürlichsprachlichen Anfragen.
Verwendet CLIP-Embeddings und FAISS für Text, Bilder und Videoframes.
Unterstützt mehrere Retrieval- und Rückwärtssuchabläufe.
Erzeugt Erklärungen lokal mit Ollama.
Gemessener Retrieval-Benchmark
COCO-Caption-Auswertung mit 200 Anfragen und getrennten Indizes für 1.000 und 5.000 Bilder.
Recall@10
0,88
Index mit 1.000 Bildern
Recall@10
0,57
Index mit 5.000 Bildern
Recall@1 / @5 / @10
0,46 / 0,755 / 0,88
200 COCO-Caption-Anfragen
Mittlere Anfragelatenz
6,92ms
Index mit 1.000 Bildern
Technologie
Stack
Bereiche
Retrieval-Benchmark
Gespeicherte Benchmark-Ergebnisse
Wie sich Retrieval mit wachsendem Index verändert
Wechsle zwischen den ausgewerteten Indexgrößen und vergleiche Recall@K sowie kontrollierte Anfragelatenz. Die Anwendungslatenz stammt aus einem separaten Laufzeitprotokoll und umfasst einen größeren Teil des vollständigen Ablaufs.Recall-Vergleich
200 AuswertungsanfragenRecall@10: 88% der relevanten Treffer gefunden
Laufzeitkontext der Anwendung
209 protokollierte Ereignisse- Mittlere protokollierte Suche
- 68,07 ms
- Mittlere Erklärung des lokalen LLM
- 13,74 s
Die Auswertungsanfrage mit 6,9 ms und die protokollierte Suche mit 68,07 ms messen unterschiedliche Pfade und behalten deshalb getrennte Bezeichnungen und Zeitkontexte.
Benchmark-JSON-Dateien auf GitHub ansehenErgebnisse
- Alltagssprache wird direkt in geordnete visuelle Belege übersetzt.
- Benchmarks machen Retrieval-Qualität und Latenz vergleichbar.
- Browser und CLI nutzen denselben reproduzierbaren Ablauf.
Möchtest du die Implementierung prüfen?
Das Repository enthält Quellcode, Einrichtungshinweise und Entwicklungshistorie.