Zum Inhalt springen

01 / Leistung

RAG für interne Dokumente

RAG über interne Dokumente: Parsing, Chunking, Embeddings, hybride Suche, Reranking, Rechtefilter und Antworten mit überprüfbaren Quellen.

Bereich
Automatisierung & KI-Systeme
Für
B2B — Unternehmen

RAG steht für Retrieval-Augmented Generation. Vor einer Antwort sucht das System relevante Passagen in Ihren freigegebenen Dokumenten und gibt sie dem Sprachmodell als Kontext. Mitarbeitende können dadurch Verträge, Handbücher, Wikis oder technische Dokumentation in natürlicher Sprache durchsuchen und die verwendeten Quellen direkt prüfen.

RAG ist keine einzelne Datenbankfunktion. Die Qualität entsteht in einer Kette aus Dokumentaufbereitung, Suche, Rechteprüfung, Kontextaufbau, Modellantwort und Evaluation.

Die RAG-Pipeline im Detail

  1. Erfassen und parsen: PDF, Word, Markdown, Confluence oder Dateiablagen werden eingelesen. Tabellen, Überschriften, Seitenzahlen und Dokument-IDs bleiben möglichst als Struktur erhalten. Scans benötigen vorab OCR.
  2. Segmentieren: Inhalte werden nicht blind nach einer festen Zeichenzahl zerschnitten. Chunk-Größe und Überlappung richten sich nach Dokumenttyp, Absätzen, Tabellen und der späteren Fragestellung.
  3. Einbetten und indexieren: Ein Embedding-Modell wandelt Passagen in Vektoren um. Qdrant oder Postgres mit pgvector speichert Vektoren zusammen mit Quelle, Version und Rechte-Metadaten.
  4. Abrufen: Semantische Vektorsuche wird je nach Bestand mit Stichwortsuche und Metadatenfiltern kombiniert. Das hilft bei Fachbegriffen, Artikelnummern oder exakten Klauseln.
  5. Neu bewerten: Ein Reranker kann die Kandidaten für die konkrete Frage sortieren, bevor nur die besten Passagen in das Kontextfenster gelangen.
  6. Antworten und belegen: Das Modell erhält Frage, ausgewählte Passagen und klare Antwortregeln. Die Oberfläche verlinkt auf Dokument, Seite oder Abschnitt und zeigt sichtbar, wenn keine belastbare Quelle gefunden wurde.

Rechte sind Teil der Suche

Ein RAG-System darf nicht erst nach der Antwort prüfen, ob ein Dokument sichtbar war. Nutzer- oder Gruppenrechte müssen schon die abrufbaren Kandidaten begrenzen. Ich übernehme vorhandene Berechtigungen, wo die Quellsysteme das zuverlässig erlauben, oder definiere ein explizites Rechte- und Indexierungskonzept. Getrennte Mandanten, vertrauliche Personalakten oder Vertragsbereiche werden nicht in einen unkontrollierten gemeinsamen Index geschoben.

Stack-Optionen

  • Qdrant für eine eigenständige Vektorsuche mit Filterung und hybriden Retrieval-Optionen
  • Postgres + pgvector, wenn relationale Daten, Rechte und Vektoren sinnvoll in einem vorhandenen Datenmodell zusammenbleiben
  • LlamaIndex, LangChain oder eigener Python-/TypeScript-Code für Ingestion, Retrieval und Orchestrierung
  • gehostete Modell-APIs oder lokale Inferenz über Ollama/vLLM, abhängig von Qualität, Datenklasse, Last und Betrieb
  • vorhandener Chat-Client, kleine Web-Oberfläche oder Integration in Slack, Teams, Portal oder Fachanwendung

Wie Qualität geprüft wird

  • echte Fragen mit erwarteten Quellen und fachlich akzeptablen Antworten
  • Retrieval-Metriken: wird die richtige Passage überhaupt gefunden und sinnvoll gerankt?
  • Antwortprüfung: bleibt die Aussage durch die gelieferten Quellen gedeckt?
  • Tests für fehlende Quellen, widersprüchliche Dokumente und veraltete Versionen
  • Latenz- und Kostenmessung bei realistischer Dokumentmenge und gleichzeitiger Nutzung
  • Regressionstests bei Änderungen an Chunking, Embeddings, Reranker, Prompt oder Modell

Was enthalten ist

  • Dokument-, Format-, Volumen- und Rechteanalyse
  • Ingestion-, Parsing-, Chunking- und Reindexierungs-Pipeline
  • Embedding-, Datenbank- und Retrieval-Konfiguration
  • Quellenanzeige, Authentifizierung und Rechtefilter
  • Evaluationssatz, Qualitätsbaseline und Betriebsmonitoring
  • schriftliche Architektur- und Betriebsdokumentation sowie Einführung der Nutzer

Realistische Grenzen

RAG verhindert Halluzinationen nicht vollständig. Das Modell kann Quellen übersehen, falsch auslegen oder unzulässig verallgemeinern. Deshalb braucht es belegte Antworten, ein sichtbares „keine belastbare Quelle“-Verhalten und menschliche Prüfung bei kritischen Ergebnissen. Dokumentbereinigung, aufwendige OCR oder fachliche Klassifikation großer Altbestände werden nach Sichtung separat eingeplant.

Nach einem Analysegespräch liegt der übliche Planungsrahmen bei 4–8 Wochen. Dokumentmenge, Rechtekonzept, Integrationen und die vereinbarte Evaluationstiefe bestimmen den tatsächlichen Termin.