Wie LLMs lernten, vor dem Antworten in einem Buch nachzuschlagen — RAG erklärt.
Architekturen 12 min Fortgeschritten 26. April 2026
Du fragst ChatGPT nach der Urlaubsregelung deiner Firma. Es antwortet selbstbewusst — und erfindet die Antwort, weil es dein Personalhandbuch nie gesehen hat. RAG löst dieses Problem: Statt dem Gedächtnis des Modells zu vertrauen, bringt man ihm bei, zuerst nachzuschlagen.
In diesem Artikel lernst du, wie RAG funktioniert: vom Grundprinzip über die Aufbereitung der Daten bis zur Suche in Vektor-Datenbanken. Du erfährst, warum die Qualität einer RAG-Anwendung entscheidend davon abhängt, wie Dokumente vorbereitet werden.
Das RAG-Prinzip — Nachschlagen statt Raten
Retrieval-Augmented Generation (RAG) erweitert ein Sprachmodell um eine externe Wissensbasis. Statt sich auf Wissen zu verlassen, das beim Training in die Gewichte eingebrannt wurde, ruft das System relevante Dokumente zur Laufzeit ab und fügt sie als Kontext in den Prompt ein. Das Konzept wurde 2020 von Patrick Lewis et al. vorgestellt. RAG löst drei fundamentale Probleme von Sprachmodellen: Halluzinationen, veraltetes Wissen und Datenschutz.
2020 Publikationen
GPT-3: Das 175-Milliarden-Parameter-Modell
Der Durchbruch zu Few-Shot Learning und emergenten KI-Fähigkeiten. Am 28. Mai 2020 präsentierte OpenAIs Team um Tom Brown das bedeutende Paper „Language Models are Few-Shot Learners“ – GPT-3 mit 175 Milliarden Parametern, über 100-fach größer als GPT-2. Die Skalierung enthüllte emergente Fähigkeiten: Das Modell konnte neue Aufgaben mit nur wenigen Beispielen lösen, ohne Fine-Tuning. Von Übersetzungen über Wort-Rätsel bis zu 3-stelliger Arithmetik demonstrierte GPT-3 beeindruckende Vielseitigkeit. Menschliche Evaluatoren konnten von GPT-3 generierte Nachrichtenartikel kaum von echten unterscheiden. Allein durch In-Context Learning näherte sich GPT-3 bei einzelnen SuperGLUE-Teilaufgaben dem state of the art an – auf dem Gesamt-Benchmark blieb es mit rund 71,8 Punkten allerdings deutlich hinter den fine-getunten Spitzenmodellen (etwa 89) zurück. 31 OpenAI-Forscher (Tom Brown und 30 Ko-Autoren) bewiesen: Massive Parameterskalierung kann qualitativ neue Fähigkeiten hervorbringen. GPT-3 legte das Fundament für ChatGPT und die moderne LLM-Ära.
Retrieval-Augmented Generation
AnalogieDefinition
Ein normales Sprachmodell ist wie ein Student in einer Klausur ohne Hilfsmittel — er kann nur nutzen, was er auswendig gelernt hat. Manchmal erinnert er sich korrekt, manchmal schreibt er etwas Plausibles, das falsch ist. RAG ist wie eine Open-Book-Klausur: Der Student darf in seinen Unterlagen nachschlagen. Er muss die Frage trotzdem verstehen und eine gute Antwort formulieren, aber die Fakten kommen aus einer geprüften Quelle.
Analogie:
Ein normales Sprachmodell ist wie ein Student in einer Klausur ohne Hilfsmittel — er kann nur nutzen, was er auswendig gelernt hat. Manchmal erinnert er sich korrekt, manchmal schreibt er etwas Plausibles, das falsch ist. RAG ist wie eine Open-Book-Klausur: Der Student darf in seinen Unterlagen nachschlagen. Er muss die Frage trotzdem verstehen und eine gute Antwort formulieren, aber die Fakten kommen aus einer geprüften Quelle.
Definition:
RAG ist eine Architektur, die ein LLM mit einer externen Wissensbasis verbindet. Dokumente werden indexiert, in Vektoren umgewandelt und in einer Datenbank gespeichert. Bei einer Anfrage werden die relevantesten Dokument-Abschnitte abgerufen und als Kontext in den Prompt eingefügt. Das Modell generiert seine Antwort auf Basis dieser abgerufenen Fakten.
In einer echten Open-Book-Klausur blättert der Student selbst durch das Buch. Bei RAG übernimmt ein Algorithmus das Nachschlagen — und der kann die falschen Seiten zurückgeben. Die Qualität des Nachschlagens ist nicht garantiert.
Die RAG-Pipeline in drei Schritten
1
Indexierung: Dokumente in Chunks aufteilen, als Vektoren kodieren und in einer Vektor-Datenbank speichern.
2
Retrieval: Die Benutzeranfrage als Vektor kodieren und die ähnlichsten Chunks per Similarity Search finden.
3
Augmented Generation: Die gefundenen Chunks als Kontext in den Prompt einfügen und das LLM eine Antwort generieren lassen.
↓
Halluzinationen Antworten basieren auf echten Dokumenten statt auf erfundenem Wissen
✓
Aktualität Wissensbasis jederzeit aktualisierbar — ohne teures Nachtraining
✓
Datenschutz Sensible Daten bleiben in der eigenen Datenbank
Ein Firmen-Chatbot hat 500 interne PDFs (Personalhandbuch, Compliance-Richtlinien, Produkthandbücher). Ein Mitarbeiter fragt: "Wie beantrage ich Sonderurlaub?" Das System wandelt die Frage in einen Vektor um, findet die 3 relevantesten Abschnitte aus dem aktuellen Personalhandbuch und fügt sie in den Prompt ein. Das Sprachmodell generiert eine Antwort mit dem korrekten Verfahren. Ohne RAG würde es entweder ablehnen oder ein plausibles, aber falsches Verfahren erfinden.
Irrtum: RAG beseitigt Halluzinationen vollständig
RAG reduziert Halluzinationen drastisch, beseitigt sie aber nicht vollständig. Das Modell kann abgerufene Abschnitte falsch interpretieren, Informationen aus verschiedenen Chunks falsch kombinieren oder flüssigen Unsinn erzeugen, wenn die Suche irrelevante Ergebnisse liefert. RAG verschiebt das Problem von "das Modell erfindet Fakten" zu "das Modell könnte sein Referenzmaterial falsch lesen".
Interaktiv: RAG-Pipeline als Graph
Die RAG-Pipeline besteht aus mehreren Stationen, die Daten weiterreichen. Dieser Graph zeigt dir die Verbindungen zwischen Dokumenten, Chunking, Embedding, Vektordatenbank, Retrieval und LLM. Beobachte, wie BFS und DFS unterschiedliche Pfade durch die Pipeline nehmen.
Warteschlange (FIFO)
Doc
Besucht
noch keiner
Klicke "Schritt", um die Breitensuche zu starten.
Unbesucht
In Warteschlange/Stapel
Aktuell
Besucht
Ziel gefunden
Chunking & Embeddings — Die Bibliothek vorbereiten
Bevor Dokumente semantisch durchsucht werden können, müssen sie in kleinere Stücke (Chunks) aufgeteilt und in Embedding-Vektoren umgewandelt werden. Die Chunk-Größe bestimmt die Suchqualität: Zu kleine Chunks (200 Token) sind präzise, verlieren aber den Kontext. Zu große Chunks (1000 Token) bewahren den Kontext, verwässern aber die Suchpräzision. Überlappung (50-100 Token) verhindert Informationsverlust an den Schnittstellen.
Chunking
AnalogieDefinition
Stell dir einen 200-seitigen Karteikasten vor. Das ganze Handbuch als ein Buch aufzubewahren macht gezielte Suche unmöglich. Jeden einzelnen Satz auf eine Karte zu schreiben ist zu fragmentiert. Die praktische Lösung: Karteikarten, die jeweils einen zusammenhängenden Absatz enthalten, mit Überlappung an den Rändern. Für jede Karte schreibst du eine Kurzfassung auf den Reiter — das ist das Embedding.
Analogie:
Stell dir einen 200-seitigen Karteikasten vor. Das ganze Handbuch als ein Buch aufzubewahren macht gezielte Suche unmöglich. Jeden einzelnen Satz auf eine Karte zu schreiben ist zu fragmentiert. Die praktische Lösung: Karteikarten, die jeweils einen zusammenhängenden Absatz enthalten, mit Überlappung an den Rändern. Für jede Karte schreibst du eine Kurzfassung auf den Reiter — das ist das Embedding.
Definition:
Chunking teilt Dokumente in durchsuchbare Textblöcke von typischerweise 200-1000 Token auf. Zwei Parameter bestimmen die Qualität: Chunk-Größe (wie groß jeder Block ist) und Überlappung (wie viele Token benachbarte Chunks teilen). Nach dem Chunking wandelt ein Embedding-Modell jeden Chunk in einen hochdimensionalen Vektor um (z.B. 1536 Dimensionen). Semantisch ähnliche Texte erzeugen Vektoren, die im Vektorraum nahe beieinander liegen.
Karteikarten-Kurzfassungen schreibt ein Mensch, der den Inhalt versteht. Embedding-Modelle berechnen Vektoren mathematisch — sie erfassen semantische Ähnlichkeit, aber nicht unbedingt logische Zusammenhänge.
Zu kleine Chunks (200 Token)
Hohe Präzision, aber Kontextverlust. Ein Pronomen wie "er" kann nicht aufgelöst werden, wenn der Name im vorherigen Chunk steht. Garantie-Satz ohne Kontext, was als "Herstellungsfehler" gilt.
Zu große Chunks (2000 Token)
Kontext erhalten, aber verwässerte Suchpräzision. Der Garantie-Absatz wird mit irrelevantem Inhalt über Produktspezifikationen vermischt. Mehr irrelevanter Text pro Ergebnis.
Ein 50-seitiges Produkthandbuch wird mit 500 Token pro Chunk und 100 Token Überlappung aufgeteilt. Das ergibt 120 Chunks. Jeder Chunk wird in einen Vektor mit 1536 Dimensionen umgewandelt: eine Matrix aus 120 x 1536 Zahlen in der Vektor-Datenbank. Bei der Suche nach "Garantiebedingungen" wird die Anfrage ebenfalls in einen 1536-dimensionalen Vektor umgewandelt und mit allen 120 gespeicherten Vektoren verglichen.
Irrtum: Möglichst kleine Chunks ergeben die beste Präzision
Kleinere Chunks erhöhen die Präzision, aber verringern den Kontext. Ein Chunk mit nur "Es gilt 24 Monate" ohne den umgebenden Kontext ist nutzlos — das "Es" hat keinen Bezug. Die Kunst des Chunkings liegt darin, die Größe zu finden, bei der jeder Chunk eigenständig verständlich ist, ohne so groß zu sein, dass die Suche verwässert wird.
Chunking-Strategien im Vergleich
Feste Größe: Dokument wird in gleichmäßige Blöcke geschnitten. Einfach zu implementieren, aber ignoriert die inhaltliche Struktur. Ein Absatz kann mitten im Satz getrennt werden.
Absatzbasiert: Natürliche Absatzgrenzen werden respektiert. Bewahrt die inhaltliche Einheit, erzeugt aber Chunks unterschiedlicher Größe.
Semantisch: Ein Embedding-Modell erkennt Themenwechsel im Text und setzt dort die Grenzen. Beste Qualität, aber rechenintensiv und komplexer in der Implementierung.
Vektor-Datenbanken — Das Gedächtnis der KI
Eine Vektor-Datenbank ist ein spezialisiertes Speichersystem für Embedding-Vektoren. Im Gegensatz zu relationalen Datenbanken, die exakte Werte abgleichen (SQL: WHERE name = 'Max'), suchen Vektor-Datenbanken nach mathematischer Ähnlichkeit: Sie finden die gespeicherten Vektoren, die einem Anfrage-Vektor im hochdimensionalen Raum am nächsten sind.
Vektor-Datenbank
AnalogieDefinition
Eine SQL-Datenbank ist wie ein Bibliothekskatalog — du suchst nach einem exakten Titel, Autor oder einer ISBN, und er findet einen Treffer oder nicht. Eine Vektor-Datenbank ist wie ein Empfehlungssystem: Du beschreibst in eigenen Worten, was du suchst, und es gibt die Einträge zurück, deren Beschreibungen deiner am ähnlichsten sind — auch wenn kein einziges Wort exakt übereinstimmt.
Analogie:
Eine SQL-Datenbank ist wie ein Bibliothekskatalog — du suchst nach einem exakten Titel, Autor oder einer ISBN, und er findet einen Treffer oder nicht. Eine Vektor-Datenbank ist wie ein Empfehlungssystem: Du beschreibst in eigenen Worten, was du suchst, und es gibt die Einträge zurück, deren Beschreibungen deiner am ähnlichsten sind — auch wenn kein einziges Wort exakt übereinstimmt.
Definition:
Vektor-Datenbanken verwenden Distanzmetriken wie Kosinus-Ähnlichkeit oder Euklidische Distanz, um die Nähe zweier Vektoren zu berechnen. Für große Datenmengen nutzen Approximate-Nearest-Neighbor-Algorithmen (ANN) einen kleinen Genauigkeitsverlust für massive Geschwindigkeitsgewinne. Das Ökosystem umfasst ChromaDB (einsteigerfreundlich), FAISS (Facebooks Bibliothek für schnelle lokale Suche), Pinecone (verwaltete Cloud-Lösung), pgvector (PostgreSQL-Erweiterung) und Weaviate (Open Source).
Ein echtes Empfehlungssystem nutzt Collaborative Filtering (was haben ähnliche Nutzer gemocht?). Eine Vektor-Datenbank basiert rein auf mathematischer Vektornähe — sie erfasst semantische Ähnlichkeit, aber keine Nutzerpräferenzen.
SQL-Suche (Schlüsselwort)
Exakte Übereinstimmung erforderlich. LIKE '%Rückgabebedingungen%' findet nichts, wenn das Dokument "Erstattungsrichtlinien" sagt. Schnell bei strukturierten Daten, aber blind für Synonyme und natürliche Sprache.
Vektor-Suche (Semantisch)
Findet Ergebnisse nach Bedeutung. "Rückgabebedingungen" und "Erstattungsrichtlinien" haben ähnliche Embedding-Vektoren, obwohl die Wörter verschieden sind. Ermöglicht natürlichsprachliche Anfragen.
Ein Benutzer tippt: "Was sind die Rückgabebedingungen?" Das Embedding-Modell wandelt die Frage in einen 1536-dimensionalen Vektor um. Die Vektor-Datenbank findet die 5 nächsten gespeicherten Vektoren per Kosinus-Ähnlichkeit. Diese stammen aus dem Abschnitt "Erstattungsrichtlinien" — obwohl der Benutzer "Rückgabebedingungen" schrieb und das Handbuch "Erstattungsrichtlinien" sagt. Im Vergleich: Eine SQL-Abfrage mit LIKE '%Rückgabebedingungen%' würde nichts finden, weil das Handbuch andere Wörter verwendet.
Irrtum: Eine Vektor-Datenbank ist nur eine normale Datenbank mit einer Extra-Spalte
Der Suchmechanismus ist fundamental anders. Relationale Datenbanken nutzen B-Trees und Hash-Indizes für exakte Übereinstimmungen. Vektor-Datenbanken nutzen spezialisierte Datenstrukturen (HNSW-Graphen, IVF-Indizes), die für hochdimensionale Nächste-Nachbarn-Suche optimiert sind. pgvector in PostgreSQL bietet grundlegende Vektor-Suche, aber dedizierte Vektor-Datenbanken wie Pinecone oder Weaviate enthalten Optimierungen (Sharding, Replikation, Metadaten-Filterung) speziell für Vektor-Workloads.
Ausprobieren: Retrieval im Vektorraum
RAG gleicht keine Stichwörter ab, sondern Bedeutung. Unten liegt eine kleine Wissensbasis aus drei Dokumenten als Punkte in einem 2D-Vektorraum. Wähl eine Frage und sieh zu, wie die Kosinus-Ähnlichkeit die nächsten Chunks herauszieht. Dann vergrößere die Chunk-Größe und beobachte, warum größere Chunks zwar das richtige Dokument, aber eine schlechter passende Passage liefern.
Retrieval-Demo wird geladen ...
Interaktiv: Der RAG-Fluss Schritt für Schritt
Verfolge den kompletten Datenfluss einer RAG-Anfrage: Vom Dokument über Chunking und Embedding in die Vektordatenbank, dann zurück über Retrieval zum LLM, das die finale Antwort generiert.
RAG-Pipeline: Vom Dokument zur Antwort
Retrieval-Augmented Generation verbindet eine Wissensdatenbank mit einem Sprachmodell. Statt nur aus seinem Training zu antworten, sucht das LLM zuerst relevante Dokumente und nutzt deren Inhalt für eine fundierte Antwort.
Schritt 0 von 6
Animation starten
Klicke auf "Abspielen", um die RAG-Pipeline Schritt für Schritt zu sehen.
Warum RAG?
Ohne RAG antwortet ein LLM nur aus seinem Trainingsstand — das kann veraltet oder unvollständig sein. Mit RAG greift das Modell auf aktuelle, spezifische Dokumente zu. Das reduziert Halluzinationen und ermöglicht quellenbasierte Antworten. RAG ist die meistverbreitete Methode, um LLMs mit externem Wissen zu verbinden.
Grenzen von RAG — Kein Allheilmittel
RAG reduziert Halluzinationen erheblich, beseitigt sie aber nicht vollständig. Das Modell kann abgerufene Informationen falsch interpretieren oder Chunks aus verschiedenen Kontexten fehlerhaft kombinieren.
Garbage In, Garbage Out (Müll rein, Müll raus) gilt auch für RAG: Wenn die Wissensbasis schlecht strukturiert, veraltet oder fehlerhaft ist, produziert auch RAG falsche Antworten — nur mit Quellenangabe.
RAG und Fine-Tuning lösen verschiedene Probleme. RAG fügt externes Wissen hinzu (ideal für aktuelle Fakten, Unternehmensdaten). Fine-Tuning verändert das Verhalten des Modells (ideal für Stil, Ton, domänenspezifische Sprache). Für die besten Ergebnisse werden oft beide Ansätze kombiniert.
Das Wichtigste
RAG bringt einem Sprachmodell bei, Informationen nachzuschlagen statt zu raten — das löst Probleme mit Halluzinationen, veralteten Daten und Datenschutz, ohne das Modell neu zu trainieren.
Die Qualität der Suche hängt vom Chunking ab: Zu kleine Chunks verlieren Kontext, zu große verwässern die Relevanz. Überlappung verhindert Informationsverlust an den Schnittstellen.
Vektor-Datenbanken suchen nach Bedeutung statt nach Schlüsselwörtern — deshalb findet eine natürlichsprachliche Frage das richtige Dokument, auch wenn die exakten Wörter nicht übereinstimmen.
Quiz: RAG
Frage 1 / 4
Noch offen
Was ist der Hauptzweck des Retrieval-Schritts in einer RAG-Pipeline?
1. Was ist der Hauptzweck des Retrieval-Schritts in einer RAG-Pipeline?
☐ A) Das Sprachmodell mit neuen Dokumenten trainieren
☐ B) Die semantisch relevantesten Dokument-Chunks zur Benutzeranfrage finden
☐ C) Die endgültige Antwort für den Benutzer generieren
☐ D) Dokumente in PDF-Format konvertieren
2. Du baust ein RAG-System für eine medizinische Wissensbasis. Ärzte berichten, dass Antworten manchmal wichtige Dosierungsangaben fehlen, die im Satz direkt vor einer Chunk-Grenze stehen. Was ist die effektivste Lösung?
☐ A) Ein größeres Sprachmodell verwenden
☐ B) Die Überlappung zwischen benachbarten Chunks erhöhen, damit Grenzsätze in beiden Chunks erscheinen
☐ C) Von Vektor-Datenbank auf SQL-Datenbank wechseln
☐ D) Alle Chunk-Grenzen vollständig entfernen
3. Ein Kunde fragt deinen RAG-Chatbot: "Kann ich Schuhe nach 30 Tagen zurückgeben?" Das Wissensbasis-Dokument sagt: "Erstattungsanträge für Schuhwerk müssen innerhalb von vier Wochen eingereicht werden." Eine Schlüsselwortsuche nach "Schuhe zurückgeben 30 Tage" findet nichts. Warum findet die Vektor-Suche das Ergebnis?
☐ A) Vektor-Datenbanken sind schneller als SQL-Datenbanken
☐ B) Die Embedding-Vektoren für "Schuhe zurückgeben" und "Erstattungsanträge für Schuhwerk" erfassen deren semantische Ähnlichkeit trotz unterschiedlicher Wörter
☐ C) Vektor-Datenbanken speichern mehr Daten als relationale Datenbanken
☐ D) Das Sprachmodell korrigiert die Suchanfrage vor der Suche
4. Ein Startup nutzt RAG mit einer ChatGPT-API zur Beantwortung von Fragen über sein 200-seitiges Produkthandbuch. Der Chatbot gibt manchmal falsche Antworten mit hoher Zuversicht. Was ist die wahrscheinlichste Erklärung?
☐ A) Das Sprachmodell ist zu klein
☐ B) Der Retrieval-Schritt hat irrelevante Chunks zurückgegeben, und das Modell hat basierend auf falschem Kontext eine flüssige Antwort generiert
☐ C) Das Handbuch ist zu lang für RAG
☐ D) RAG kann nicht mit ChatGPT funktionieren
Auflösung: 1) B · 2) B · 3) B · 4) B
Verständnischeck
Aus welchen drei Phasen besteht eine RAG-Pipeline — und was passiert in jeder Phase?
Welche Konsequenzen haben zu kleine und zu große Chunks auf die Suchqualität?
Warum findet eine Vektor-Suche Ergebnisse, die eine Schlüsselwort-Suche übersehen würde?