Glossar
RAG
Auch: Retrieval Augmented Generation · Retrieval-augmentierte Generierung
Ein Sprachmodell bekommt vor der Antwort passende Ausschnitte aus den eigenen Daten mitgeliefert, statt sich auf sein Training zu verlassen.
Der Ablauf hat zwei Hälften. Vorbereitend werden Dokumente zerlegt, in Vektoren übersetzt und abgelegt. Zur Laufzeit wird die Frage ebenfalls übersetzt, die ähnlichsten Ausschnitte werden gesucht und zusammen mit der Frage an das Modell geschickt. Das Modell antwortet auf Basis dessen, was im Kontext steht.
Der Reiz ist offensichtlich: Das Modell kennt Inhalte, die es nie gesehen hat, Aktualisierungen brauchen kein Training, und man kann Quellen angeben. Der Preis ist ebenso offensichtlich, wird aber oft unterschätzt: Die Antwortqualität hängt fast vollständig davon ab, ob die richtigen Ausschnitte gefunden wurden.
Damit verschiebt sich das Problem von der KI zur Suche. Schlechte Ergebnisse in einem RAG-System haben fast nie ihre Ursache im Modell, sondern in der Zerlegung, der Suche oder der Sortierung. Wer bei schlechten Antworten das Modell wechselt, behandelt das Symptom.
Reine Vektorsuche findet inhaltlich Ähnliches und scheitert an exakten Begriffen: Artikelnummern, Paragraphen, Fehlercodes, Eigennamen. Deshalb ist in der Praxis fast immer eine Kombination aus Vektorsuche und klassischer Stichwortsuche richtig, mit anschließendem Reranking.
Der zweite Kostenfaktor ist der Kontext. Jeder mitgeschickte Ausschnitt wird bezahlt und lenkt zugleich ab: Mehr Kontext ist nicht besser, sondern ab einem Punkt schlechter, weil das Modell die relevante Stelle zwischen Beiwerk suchen muss.
Und schließlich die Berechtigungen. Wenn ein Mitarbeiter über die Suche Dokumente sieht, die er im Quellsystem nicht sehen dürfte, ist das kein KI-Problem, sondern eine Datenpanne. Die Rechteprüfung gehört in die Suche, nicht in den Prompt.
Woran Sie es erkennen
- Antworten klingen plausibel, treffen aber die falsche Dokumentversion.
- Suchen nach Artikelnummern oder Paragraphen liefern nichts Brauchbares.
- Die Dokumente wurden nach fester Zeichenzahl zerschnitten.
- Es gibt keinen festen Fragensatz, mit dem Änderungen geprüft werden.
Nicht zu verwechseln mit
- Fine-Tuning
- Verändert das Verhalten des Modells, nicht sein Wissen über aktuelle Inhalte. Für „unsere Dokumente kennen" ist RAG richtig, für „in unserem Stil antworten" eher Fine-Tuning.
- Langes Kontextfenster
- Alles hineinzuschieben funktioniert bei kleinen Beständen und wird teuer und ungenau, sobald es viele Dokumente sind. RAG wählt aus, statt alles mitzugeben.
- Volltextsuche
- Findet exakte Begriffe zuverlässig, aber keine Umschreibungen. RAG ohne Stichwortanteil scheitert genau dort, weshalb die Kombination die Regel ist.
- Vektordatenbank
- Ein Baustein, nicht das Verfahren. Viele bestehende Datenbanken können Vektoren, ein eigenes Produkt lohnt sich erst bei entsprechender Größe.
Wann es trägt
- Antworten sollen auf eigenen, sich ändernden Inhalten beruhen.
- Quellenangaben sind gefordert, etwa zur Nachprüfbarkeit.
- Der Bestand ist zu groß, um vollständig in den Kontext zu passen.
Wann nicht
- Bei wenigen, kleinen und stabilen Dokumenten: dann reicht der Kontext direkt.
- Wenn nicht Wissen fehlt, sondern Handlungsfähigkeit: dafür sind Werkzeuge und MCP zuständig.
- Solange die Quelldokumente unstrukturiert, veraltet oder widersprüchlich sind. RAG verstärkt schlechte Inhalte, es repariert sie nicht.
Wie man rangeht
- Quellen aufräumen, bevor indexiert wirdVeraltete Fassungen, Doppelungen und Entwürfe aussortieren. Ein RAG-System, das drei widersprüchliche Versionen einer Richtlinie findet, antwortet falsch und wirkt dabei überzeugend.
- Sinnvoll zerlegenNach Struktur schneiden, nicht nach Zeichenzahl: Abschnitt, Kapitel, Absatz. Mit Überlappung, damit Zusammenhänge nicht mitten im Satz enden.
- Hybrid suchenVektorsuche für Bedeutung, Stichwortsuche für Nummern und Eigennamen, beides zusammenführen. Der einzelne größte Qualitätssprung in den meisten Projekten.
- Reranking einsetzenAus zwanzig Kandidaten die besten fünf auswählen lassen. Kostet einen zusätzlichen Schritt und verbessert die Trefferlage deutlich, weil Ähnlichkeit nicht gleich Relevanz ist.
- Berechtigungen in die Suche legenGefiltert wird vor dem Modell, nicht durch eine Anweisung im Prompt. Ein Prompt ist keine Zugriffskontrolle.
- Mit festem Testsatz messenFragen mit bekannter richtiger Quelle, regelmäßig durchlaufen. Ohne diesen Satz merkt niemand, dass eine Änderung an der Zerlegung die Qualität gesenkt hat.
Häufig gefragt
Warum antwortet unser RAG-System falsch, obwohl das Dokument existiert?
In den meisten Fällen wurde der richtige Ausschnitt nicht gefunden oder nicht hoch genug einsortiert. Prüfen sollte man in dieser Reihenfolge: Ist der Ausschnitt überhaupt im Index, wird er von der Suche gefunden, landet er unter den ersten Treffern, und ist er vollständig genug, um die Frage zu beantworten.
Braucht man dafür eine Vektordatenbank?
Nicht zwingend. Viele Datenbanken, die ohnehin im Einsatz sind, können inzwischen Vektoren. Ein eigenes Produkt lohnt sich bei großen Beständen, hoher Abfragelast oder speziellen Filteranforderungen. Ein zusätzliches System bedeutet auch zusätzlichen Betrieb.
RAG oder Fine-Tuning?
RAG für Wissen, Fine-Tuning für Verhalten. Wenn das Modell Inhalte kennen soll, die sich ändern, ist RAG richtig, weil eine Aktualisierung nur den Index betrifft. Wenn es in einem bestimmten Format oder Ton antworten soll, kann Fine-Tuning die bessere Wahl sein. Beides zusammen ist möglich und selten nötig.
Wie geht man mit Berechtigungen um?
Die Filterung gehört in die Suche, vor das Modell. Entweder man indexiert je Berechtigungsgruppe getrennt oder filtert bei der Abfrage anhand der Nutzeridentität. Eine Anweisung im Prompt, bestimmte Inhalte nicht zu verwenden, ist keine Zugriffskontrolle: das Dokument war dann bereits im Kontext.
