Eigene Daten anbinden (RAG)

Wie LLMs lernten, vor dem Antworten in einem Buch nachzuschlagen — RAG erklärt.

Architekturen 12 min Fortgeschritten 26. April 2026

Du fragst ChatGPT nach der Urlaubsregelung deiner Firma. Es antwortet selbstbewusst — und erfindet die Antwort, weil es dein Personalhandbuch nie gesehen hat. RAG löst dieses Problem: Statt dem Gedächtnis des Modells zu vertrauen, bringt man ihm bei, zuerst nachzuschlagen.

In diesem Artikel lernst du, wie RAG funktioniert: vom Grundprinzip über die Aufbereitung der Daten bis zur Suche in Vektor-Datenbanken. Du erfährst, warum die Qualität einer RAG-Anwendung entscheidend davon abhängt, wie Dokumente vorbereitet werden.

Das RAG-Prinzip — Nachschlagen statt Raten

Retrieval-Augmented Generation (RAG) erweitert ein Sprachmodell um eine externe Wissensbasis. Statt sich auf Wissen zu verlassen, das beim Training in die Gewichte eingebrannt wurde, ruft das System relevante Dokumente zur Laufzeit ab und fügt sie als Kontext in den Prompt ein. Das Konzept wurde 2020 von Patrick Lewis et al. vorgestellt. RAG löst drei fundamentale Probleme von Sprachmodellen: Halluzinationen, veraltetes Wissen und Datenschutz.

Retrieval-Augmented Generation

AnalogieDefinition
Ein normales Sprachmodell ist wie ein Student in einer Klausur ohne Hilfsmittel — er kann nur nutzen, was er auswendig gelernt hat. Manchmal erinnert er sich korrekt, manchmal schreibt er etwas Plausibles, das falsch ist. RAG ist wie eine Open-Book-Klausur: Der Student darf in seinen Unterlagen nachschlagen. Er muss die Frage trotzdem verstehen und eine gute Antwort formulieren, aber die Fakten kommen aus einer geprüften Quelle.

In einer echten Open-Book-Klausur blättert der Student selbst durch das Buch. Bei RAG übernimmt ein Algorithmus das Nachschlagen — und der kann die falschen Seiten zurückgeben. Die Qualität des Nachschlagens ist nicht garantiert.

Die RAG-Pipeline in drei Schritten

1
Indexierung: Dokumente in Chunks aufteilen, als Vektoren kodieren und in einer Vektor-Datenbank speichern.
2
Retrieval: Die Benutzeranfrage als Vektor kodieren und die ähnlichsten Chunks per Similarity Search finden.
3
Augmented Generation: Die gefundenen Chunks als Kontext in den Prompt einfügen und das LLM eine Antwort generieren lassen.
Halluzinationen Antworten basieren auf echten Dokumenten statt auf erfundenem Wissen
Aktualität Wissensbasis jederzeit aktualisierbar — ohne teures Nachtraining
Datenschutz Sensible Daten bleiben in der eigenen Datenbank

Ein Firmen-Chatbot hat 500 interne PDFs (Personalhandbuch, Compliance-Richtlinien, Produkthandbücher). Ein Mitarbeiter fragt: "Wie beantrage ich Sonderurlaub?" Das System wandelt die Frage in einen Vektor um, findet die 3 relevantesten Abschnitte aus dem aktuellen Personalhandbuch und fügt sie in den Prompt ein. Das Sprachmodell generiert eine Antwort mit dem korrekten Verfahren. Ohne RAG würde es entweder ablehnen oder ein plausibles, aber falsches Verfahren erfinden.

Irrtum: RAG beseitigt Halluzinationen vollständig

RAG reduziert Halluzinationen drastisch, beseitigt sie aber nicht vollständig. Das Modell kann abgerufene Abschnitte falsch interpretieren, Informationen aus verschiedenen Chunks falsch kombinieren oder flüssigen Unsinn erzeugen, wenn die Suche irrelevante Ergebnisse liefert. RAG verschiebt das Problem von "das Modell erfindet Fakten" zu "das Modell könnte sein Referenzmaterial falsch lesen".

Interaktiv: RAG-Pipeline als Graph

Die RAG-Pipeline besteht aus mehreren Stationen, die Daten weiterreichen. Dieser Graph zeigt dir die Verbindungen zwischen Dokumenten, Chunking, Embedding, Vektordatenbank, Retrieval und LLM. Beobachte, wie BFS und DFS unterschiedliche Pfade durch die Pipeline nehmen.

Doc Chk Emb VDB Ret LLM
Warteschlange (FIFO)
Doc
Besucht
noch keiner

Klicke "Schritt", um die Breitensuche zu starten.

Unbesucht
In Warteschlange/Stapel
Aktuell
Besucht
Ziel gefunden

Chunking & Embeddings — Die Bibliothek vorbereiten

Bevor Dokumente semantisch durchsucht werden können, müssen sie in kleinere Stücke (Chunks) aufgeteilt und in Embedding-Vektoren umgewandelt werden. Die Chunk-Größe bestimmt die Suchqualität: Zu kleine Chunks (200 Token) sind präzise, verlieren aber den Kontext. Zu große Chunks (1000 Token) bewahren den Kontext, verwässern aber die Suchpräzision. Überlappung (50-100 Token) verhindert Informationsverlust an den Schnittstellen.

Chunking

AnalogieDefinition
Stell dir einen 200-seitigen Karteikasten vor. Das ganze Handbuch als ein Buch aufzubewahren macht gezielte Suche unmöglich. Jeden einzelnen Satz auf eine Karte zu schreiben ist zu fragmentiert. Die praktische Lösung: Karteikarten, die jeweils einen zusammenhängenden Absatz enthalten, mit Überlappung an den Rändern. Für jede Karte schreibst du eine Kurzfassung auf den Reiter — das ist das Embedding.

Karteikarten-Kurzfassungen schreibt ein Mensch, der den Inhalt versteht. Embedding-Modelle berechnen Vektoren mathematisch — sie erfassen semantische Ähnlichkeit, aber nicht unbedingt logische Zusammenhänge.

Zu kleine Chunks (200 Token)

Hohe Präzision, aber Kontextverlust. Ein Pronomen wie "er" kann nicht aufgelöst werden, wenn der Name im vorherigen Chunk steht. Garantie-Satz ohne Kontext, was als "Herstellungsfehler" gilt.

Zu große Chunks (2000 Token)

Kontext erhalten, aber verwässerte Suchpräzision. Der Garantie-Absatz wird mit irrelevantem Inhalt über Produktspezifikationen vermischt. Mehr irrelevanter Text pro Ergebnis.

Ein 50-seitiges Produkthandbuch wird mit 500 Token pro Chunk und 100 Token Überlappung aufgeteilt. Das ergibt 120 Chunks. Jeder Chunk wird in einen Vektor mit 1536 Dimensionen umgewandelt: eine Matrix aus 120 x 1536 Zahlen in der Vektor-Datenbank. Bei der Suche nach "Garantiebedingungen" wird die Anfrage ebenfalls in einen 1536-dimensionalen Vektor umgewandelt und mit allen 120 gespeicherten Vektoren verglichen.

Irrtum: Möglichst kleine Chunks ergeben die beste Präzision

Kleinere Chunks erhöhen die Präzision, aber verringern den Kontext. Ein Chunk mit nur "Es gilt 24 Monate" ohne den umgebenden Kontext ist nutzlos — das "Es" hat keinen Bezug. Die Kunst des Chunkings liegt darin, die Größe zu finden, bei der jeder Chunk eigenständig verständlich ist, ohne so groß zu sein, dass die Suche verwässert wird.

Feste Größe: Dokument wird in gleichmäßige Blöcke geschnitten. Einfach zu implementieren, aber ignoriert die inhaltliche Struktur. Ein Absatz kann mitten im Satz getrennt werden.

Absatzbasiert: Natürliche Absatzgrenzen werden respektiert. Bewahrt die inhaltliche Einheit, erzeugt aber Chunks unterschiedlicher Größe.

Semantisch: Ein Embedding-Modell erkennt Themenwechsel im Text und setzt dort die Grenzen. Beste Qualität, aber rechenintensiv und komplexer in der Implementierung.

Vektor-Datenbanken — Das Gedächtnis der KI

Eine Vektor-Datenbank ist ein spezialisiertes Speichersystem für Embedding-Vektoren. Im Gegensatz zu relationalen Datenbanken, die exakte Werte abgleichen (SQL: WHERE name = 'Max'), suchen Vektor-Datenbanken nach mathematischer Ähnlichkeit: Sie finden die gespeicherten Vektoren, die einem Anfrage-Vektor im hochdimensionalen Raum am nächsten sind.

Vektor-Datenbank

AnalogieDefinition
Eine SQL-Datenbank ist wie ein Bibliothekskatalog — du suchst nach einem exakten Titel, Autor oder einer ISBN, und er findet einen Treffer oder nicht. Eine Vektor-Datenbank ist wie ein Empfehlungssystem: Du beschreibst in eigenen Worten, was du suchst, und es gibt die Einträge zurück, deren Beschreibungen deiner am ähnlichsten sind — auch wenn kein einziges Wort exakt übereinstimmt.

Ein echtes Empfehlungssystem nutzt Collaborative Filtering (was haben ähnliche Nutzer gemocht?). Eine Vektor-Datenbank basiert rein auf mathematischer Vektornähe — sie erfasst semantische Ähnlichkeit, aber keine Nutzerpräferenzen.

SQL-Suche (Schlüsselwort)

Exakte Übereinstimmung erforderlich. LIKE '%Rückgabebedingungen%' findet nichts, wenn das Dokument "Erstattungsrichtlinien" sagt. Schnell bei strukturierten Daten, aber blind für Synonyme und natürliche Sprache.

Vektor-Suche (Semantisch)

Findet Ergebnisse nach Bedeutung. "Rückgabebedingungen" und "Erstattungsrichtlinien" haben ähnliche Embedding-Vektoren, obwohl die Wörter verschieden sind. Ermöglicht natürlichsprachliche Anfragen.

Ein Benutzer tippt: "Was sind die Rückgabebedingungen?" Das Embedding-Modell wandelt die Frage in einen 1536-dimensionalen Vektor um. Die Vektor-Datenbank findet die 5 nächsten gespeicherten Vektoren per Kosinus-Ähnlichkeit. Diese stammen aus dem Abschnitt "Erstattungsrichtlinien" — obwohl der Benutzer "Rückgabebedingungen" schrieb und das Handbuch "Erstattungsrichtlinien" sagt. Im Vergleich: Eine SQL-Abfrage mit LIKE '%Rückgabebedingungen%' würde nichts finden, weil das Handbuch andere Wörter verwendet.

Irrtum: Eine Vektor-Datenbank ist nur eine normale Datenbank mit einer Extra-Spalte

Der Suchmechanismus ist fundamental anders. Relationale Datenbanken nutzen B-Trees und Hash-Indizes für exakte Übereinstimmungen. Vektor-Datenbanken nutzen spezialisierte Datenstrukturen (HNSW-Graphen, IVF-Indizes), die für hochdimensionale Nächste-Nachbarn-Suche optimiert sind. pgvector in PostgreSQL bietet grundlegende Vektor-Suche, aber dedizierte Vektor-Datenbanken wie Pinecone oder Weaviate enthalten Optimierungen (Sharding, Replikation, Metadaten-Filterung) speziell für Vektor-Workloads.

Ausprobieren: Retrieval im Vektorraum

RAG gleicht keine Stichwörter ab, sondern Bedeutung. Unten liegt eine kleine Wissensbasis aus drei Dokumenten als Punkte in einem 2D-Vektorraum. Wähl eine Frage und sieh zu, wie die Kosinus-Ähnlichkeit die nächsten Chunks herauszieht. Dann vergrößere die Chunk-Größe und beobachte, warum größere Chunks zwar das richtige Dokument, aber eine schlechter passende Passage liefern.

Interaktiv: Der RAG-Fluss Schritt für Schritt

Verfolge den kompletten Datenfluss einer RAG-Anfrage: Vom Dokument über Chunking und Embedding in die Vektordatenbank, dann zurück über Retrieval zum LLM, das die finale Antwort generiert.

RAG-Pipeline: Vom Dokument zur Antwort

Retrieval-Augmented Generation verbindet eine Wissensdatenbank mit einem Sprachmodell. Statt nur aus seinem Training zu antworten, sucht das LLM zuerst relevante Dokumente und nutzt deren Inhalt für eine fundierte Antwort.

Dokument 1Dokument 2Dokument 3Dokument NWissensbasisEmbeddingVektoren erzeugenVektorisierungVektor-DatenbankSpeicherNutzer-FrageEingabeTop-K+ FrageLLMGenerierungSprachmodellAntwort
Schritt 0 von 6
Animation starten

Klicke auf "Abspielen", um die RAG-Pipeline Schritt für Schritt zu sehen.

Warum RAG?

Ohne RAG antwortet ein LLM nur aus seinem Trainingsstand — das kann veraltet oder unvollständig sein. Mit RAG greift das Modell auf aktuelle, spezifische Dokumente zu. Das reduziert Halluzinationen und ermöglicht quellenbasierte Antworten. RAG ist die meistverbreitete Methode, um LLMs mit externem Wissen zu verbinden.

RAG reduziert Halluzinationen erheblich, beseitigt sie aber nicht vollständig. Das Modell kann abgerufene Informationen falsch interpretieren oder Chunks aus verschiedenen Kontexten fehlerhaft kombinieren.

Garbage In, Garbage Out (Müll rein, Müll raus) gilt auch für RAG: Wenn die Wissensbasis schlecht strukturiert, veraltet oder fehlerhaft ist, produziert auch RAG falsche Antworten — nur mit Quellenangabe.

RAG und Fine-Tuning lösen verschiedene Probleme. RAG fügt externes Wissen hinzu (ideal für aktuelle Fakten, Unternehmensdaten). Fine-Tuning verändert das Verhalten des Modells (ideal für Stil, Ton, domänenspezifische Sprache). Für die besten Ergebnisse werden oft beide Ansätze kombiniert.

Das Wichtigste

  1. RAG bringt einem Sprachmodell bei, Informationen nachzuschlagen statt zu raten — das löst Probleme mit Halluzinationen, veralteten Daten und Datenschutz, ohne das Modell neu zu trainieren.
  2. Die Qualität der Suche hängt vom Chunking ab: Zu kleine Chunks verlieren Kontext, zu große verwässern die Relevanz. Überlappung verhindert Informationsverlust an den Schnittstellen.
  3. Vektor-Datenbanken suchen nach Bedeutung statt nach Schlüsselwörtern — deshalb findet eine natürlichsprachliche Frage das richtige Dokument, auch wenn die exakten Wörter nicht übereinstimmen.

Quiz: RAG

Frage 1 / 4
Noch offen

Was ist der Hauptzweck des Retrieval-Schritts in einer RAG-Pipeline?

Wählen Sie eine Antwort
Auflösung: 1) B · 2) B · 3) B · 4) B

Verständnischeck

  • Aus welchen drei Phasen besteht eine RAG-Pipeline — und was passiert in jeder Phase?
  • Welche Konsequenzen haben zu kleine und zu große Chunks auf die Suchqualität?
  • Warum findet eine Vektor-Suche Ergebnisse, die eine Schlüsselwort-Suche übersehen würde?