Fachwissen für digitale Entscheidungen
Wie bindet man interne Dokumente mit RAG an einen LLM-Server an?
Kurzantwort
Ein kontrollierter Datenweg statt eines Datei-Uploads
Retrieval-Augmented Generation, kurz RAG, verbindet ein Sprachmodell zur Laufzeit mit externem Wissen. Der 2020 veröffentlichte ursprüngliche RAG-Ansatz kombiniert eine abrufbare Wissensbasis mit einem generativen Modell. Für interne Dokumente braucht es dafür eine nachvollziehbare Verarbeitungskette: Quelle erfassen, Text extrahieren, Abschnitte bilden, Embeddings berechnen, indexieren, passende Abschnitte abrufen und die Antwort mit Belegen erzeugen.
Jeder Abschnitt sollte Metadaten mitführen: Dokument-ID, Titel, Version, Sprache, Gültigkeitsdatum, Mandant und erlaubte Rollen. Qdrant empfiehlt, Textabschnitte als getrennte Punkte abzulegen; Absatzgrenzen sind für Fließtext ein sinnvoller Start, während technische Nachschlagewerke kleinere Einheiten benötigen können. Eine universell richtige Abschnittslänge gibt es nicht. Sie wird mit echten Fragen getestet.
Was im produktiven Ablauf wichtig ist
- Ingestion: Nur freigegebene Formate und Versionen werden übernommen. OCR-Fehler, Tabellen und Anhänge brauchen eigene Qualitätskontrollen.
- Index: Vektoren ermöglichen Ähnlichkeitssuche. Systeme wie pgvector bieten exakte Suche sowie HNSW und IVFFlat für beschleunigte, angenäherte Suche; mehr Geschwindigkeit kann dabei Recall kosten.
- Abruf: Filter für Mandant, Rolle, Dokumentstatus und Sprache werden vor oder zusammen mit der Vektorsuche serverseitig angewandt. Der Prompt darf diese Kontrolle nicht ersetzen.
- Antwort: Das Modell erhält nur die nötigen Fundstellen, nennt Dokument und Version und soll bei fehlender Evidenz klar ablehnen. Eine Quellenliste muss auf tatsächlich verwendete Textstellen zeigen.
- Pflege: Gelöschte oder ersetzte Dokumente werden auch aus dem Index entfernt. Änderungen laufen inkrementell, bleiben aber über Protokoll und Prüfsumme nachvollziehbar.
Für die Abnahme braucht es einen festen Fragenkatalog. Gemessen werden nicht nur sprachlich gute Antworten, sondern auch Retrieval-Treffer, Berechtigungsfehler und korrekte Belege. Ein Startwert wie 3 bis 8 abgerufene Abschnitte ist lediglich ein Testbereich; die richtige Zahl hängt von Dokumenten, Modell und Kontextfenster ab.
Kernfakten
- RAG-Grundlagenarbeit
- 2020 veröffentlicht; 6 Schritte im betrieblichen Datenweg
- Metadaten
- Dokument-ID, Version, Sprache, Mandant und Rollen je Abschnitt
- Testbereich
- 3 bis 8 Fundstellen als Ausgangspunkt, nicht als allgemeiner Standard
Quellen
Alle externen Angaben nachvollziehbar belegt.-
01
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks Lewis et al. / arXiv
- 02
-
03
pgvector – Open-source vector similarity search for Postgres pgvector Project