Zurück zum Projektarchiv

Angewandte KI

GitHub-Repository

Multimodale semantische Suche und RAG-Engine

Bilder und Videos lokal in natürlicher Sprache durchsuchen, mit messbaren Ergebnissen.

Kontext: Multimodales KI-Suchsystem

Zeitraum: 2025-10 bis Heute

Zusammenfassung

Das FastAPI-, React/Vite- und CLI-System kombiniert CLIP-Embeddings, FAISS-Nachbarsuche, Caption-Reranking und lokale Erklärungen über Ollama.

Von einer natürlichsprachlichen Anfrage zu geordneten visuellen Belegen

Anfrage

Der Nutzer beschreibt das gesuchte Bild oder Video

CLIP-Encoding

Text und Medien gelangen in denselben Embedding-Raum

FAISS-Suche

Der Index findet relevante Nachbarn

Reranking

Beschreibungen und Retrieval-Signale verfeinern die Reihenfolge

Ergebnisse

Die Oberfläche zeigt geordnete Medien und Erklärungen

Was das System abdeckt

Ordnet Bild- und Videoergebnisse zu natürlichsprachlichen Anfragen.

Verwendet CLIP-Embeddings und FAISS für Text, Bilder und Videoframes.

Unterstützt mehrere Retrieval- und Rückwärtssuchabläufe.

Erzeugt Erklärungen lokal mit Ollama.

Gemessener Retrieval-Benchmark

COCO-Caption-Auswertung mit 200 Anfragen und getrennten Indizes für 1.000 und 5.000 Bilder.

Recall@10

0,88

Index mit 1.000 Bildern

Recall@10

0,57

Index mit 5.000 Bildern

Recall@1 / @5 / @10

0,46 / 0,755 / 0,88

200 COCO-Caption-Anfragen

Mittlere Anfragelatenz

6,92ms

Index mit 1.000 Bildern

Technologie

Stack

PythonFastAPIReactViteFAISSHNSWCLIPPyTorchOpenCVOllamaRAGVector embeddings

Bereiche

Angewandte KIRetrieval-SystemeRAGComputer VisionVektorsucheFull-Stack-KI

Retrieval-Benchmark

Gespeicherte Benchmark-Ergebnisse

Wie sich Retrieval mit wachsendem Index verändert

Wechsle zwischen den ausgewerteten Indexgrößen und vergleiche Recall@K sowie kontrollierte Anfragelatenz. Die Anwendungslatenz stammt aus einem separaten Laufzeitprotokoll und umfasst einen größeren Teil des vollständigen Ablaufs.

Recall-Vergleich

200 Auswertungsanfragen
Recall@146%
Recall@575,5%
Recall@1088%

Recall@10: 88% der relevanten Treffer gefunden

Laufzeitkontext der Anwendung

209 protokollierte Ereignisse
Mittlere protokollierte Suche
68,07 ms
Mittlere Erklärung des lokalen LLM
13,74 s

Die Auswertungsanfrage mit 6,9 ms und die protokollierte Suche mit 68,07 ms messen unterschiedliche Pfade und behalten deshalb getrennte Bezeichnungen und Zeitkontexte.

Benchmark-JSON-Dateien auf GitHub ansehen

Ergebnisse

  • Alltagssprache wird direkt in geordnete visuelle Belege übersetzt.
  • Benchmarks machen Retrieval-Qualität und Latenz vergleichbar.
  • Browser und CLI nutzen denselben reproduzierbaren Ablauf.

Möchtest du die Implementierung prüfen?

Das Repository enthält Quellcode, Einrichtungshinweise und Entwicklungshistorie.

Repository öffnen