Embeddings & Latent Space
Der mathematische Raum, in dem ähnliche Wörter benachbart sind, ohne dass es ihnen jemand gesagt hat.
Dein Computer liest das Wort "Apfel" und sieht die Token-ID 402. Diese Zahl ist bedeutungslos — bis die Maschine lernt, sie in einem Raum zu platzieren, wo ähnliche Konzepte dicht beieinander liegen. Dieser Raum ist das Embedding — und ohne ihn gäbe es kein ChatGPT, keinen Bildgenerator und keine moderne KI.
In diesem Artikel lernst du drei Dinge: wie Word2Vec Wörter in dichte Vektoren verwandelt, was der Latent Space ist und warum Nähe darin semantische Ähnlichkeit bedeutet, und wie RAG-Pipelines auf Embeddings aufbauen, um Wissen aus Dokumenten abzurufen.
Wörter als Vektoren: Der Word2Vec-Durchbruch
Vor Word2Vec nutzten Entwickler One-Hot-Encoding: Jedes Wort wurde als riesiger Vektor dargestellt — 50.000 Dimensionen, davon genau eine 1 und 49.999 Nullen. Das fatale Problem: Die Distanz zwischen "Apfel" und "Banane" ist identisch mit der zwischen "Apfel" und "Auto". One-Hot hat kein Konzept von Ähnlichkeit.
50.000 Dimensionen. Genau eine 1, rest Nullen. Keine Ähnlichkeit messbar. "Apfel" und "Banane" gleich weit entfernt wie "Apfel" und "Motor".
100-300 Dimensionen. Alle Werte aktiv. Ähnlichkeit direkt messbar. "Apfel" und "Banane" liegen nah beieinander.
2013 stellten Tomas Mikolov und sein Team bei Google Word2Vec vor. Die Grundidee stammt vom Linguisten J.R. Firth (1957): "Du erkennst ein Wort an der Gesellschaft, die es pflegt." Wörter, die in ähnlichen Kontexten vorkommen, bekommen ähnliche Vektoren. Word2Vec trainierte auf Milliarden von Sätzen und komprimierte die Bedeutung in dichte Vektoren mit typischerweise 100 bis 300 Dimensionen.
Word Embedding — Wenn Wörter Koordinaten bekommen
Wo die Analogie bricht: Die Schülerin sieht auch Gesichter, hört Stimmen und liest Körpersprache. Word2Vec kennt nur Text — es hat keinerlei sensorische Verankerung. Es weiß, dass "Apfel" und "Banane" mit "Obst" auftreten, aber nicht, wie eines davon schmeckt.
Das berühmteste Beispiel: Vector("König") - Vector("Mann") + Vector("Frau") ≈ Vector("Königin"). Die Richtung von "Mann" zu "Frau" im Vektorraum entspricht ungefähr der Verschiebung von "König" zu "Königin". Ähnlich: Vector("Paris") - Vector("Frankreich") + Vector("Deutschland") ≈ Vector("Berlin"). Diese Gleichungen sind faszinierend — aber auch idealisiert. In der Praxis sind Embedding-Räume unordentlicher als Lehrbuchbeispiele vermuten lassen.
Häufiger Irrtum: "Embeddings verstehen Bedeutung"
Jedes moderne neuronale Netz beginnt damit, seine Eingabe in Embeddings umzuwandeln. In einem Transformer ist die allererste Schicht die Embedding-Schicht — sie konvertiert Token-IDs in dichte Vektoren, bevor irgendein Attention-Mechanismus arbeiten kann.
Interaktiv: Bag-of-Words und TF-IDF
Bevor Wörter zu dichten Embeddings werden, muss ein Text erst einmal zu Zahlen werden. Der klassische Weg: zählen, welches Wort wie oft vorkommt (Bag-of-Words) und dann gewichten, wie aussagekräftig ein Wort ist (TF-IDF). Probiere es an drei kleinen Dokumenten aus.
Der Latent Space: Wo Bedeutung lebt
Latent Space — Der verborgene Raum der Repräsentationen
"Latent" bedeutet verborgen: Die Dimensionen des Raums korrespondieren nicht mit menschlich lesbaren Eigenschaften. Dimension 47 könnte teilweise "Formalität" und teilweise "Themengebiet" kodieren — sauber benennen lässt sie sich nicht. Deshalb nutzen Forscher mathematische Werkzeuge zur Dimensionsreduktion, um hochdimensionale Räume in 2D zu visualisieren.
Wo die Analogie bricht: Eine Stadt ist zweidimensional. Der Latent Space hat Tausende Dimensionen. In 2D kann ein Punkt nur wenige direkte Nachbarn haben. In 12.288 Dimensionen kann "Hund" gleichzeitig nah an "Katze" (Haustier-Dimension), "Wolf" (Biologie-Dimension) und "Treue" (Charakter-Dimension) liegen. Diese mehrdimensionale Nähe ist auf einer flachen Karte unmöglich.
Ein konkretes Beispiel: Ein Textanalyse-Tool bettet Filmrezensionen ein. "Der Film war großartig, brillante Schauspielleistung" und "Fantastischer Streifen, hervorragende Darsteller" landen fast am selben Punkt — obwohl sie kein einziges bedeutendes Wort teilen. "Der Film war furchtbar langweilig" landet am entgegengesetzten Ende des Raums.
Häufiger Irrtum: "Jede Dimension hat eine lesbare Bedeutung"
RAG: Die Killer-App der Embeddings
Retrieval-Augmented Generation verbindet ein vortrainiertes LLM mit externem Wissen. Die technische Grundlage: Embeddings. Ohne die Übersetzung von Text in Vektoren würde RAG nicht existieren.
Der Ablauf: Dokumente werden in Chunks von 500-1000 Tokens zerlegt. Jeder Chunk wird durch ein Embedding-Modell in einen Vektor umgewandelt und in einer Vektor-Datenbank gespeichert. Bei einer Nutzeranfrage wird auch die Frage eingebettet, die ähnlichsten Chunks per Similarity Search gefunden, und dem LLM als Kontext übergeben.
Findet nur Dokumente mit exakt den gesuchten Wörtern. "Passwort zurücksetzen" findet nicht "Zugangsdaten erneuern".
Findet Dokumente nach Bedeutung. "Passwort zurücksetzen" findet auch "Zugangsdaten erneuern" und "Account-Wiederherstellung".
Ein Unternehmen verwaltet 10.000 technische PDF-Handbücher. Ein Mitarbeiter fragt: "Wie setze ich mein Passwort zurück?" Keyword-Suche findet nur Dokumente mit "Passwort". Embedding-basierte Suche findet auch Chunks über "Zugangsdaten erneuern", "Kennwort-Reset" und "Account-Wiederherstellung" — weil diese Phrasen im Latent Space nahe beieinander liegen.
Häufiger Irrtum: "RAG ersetzt Fine-Tuning"
Deep Dive: Von statischen zu kontextuellen Embeddings
BERT verbessert Sprachverständnis erheblich
Ein wichtiger Fortschritt der bidirektionalen Sprachmodelle und die Geburt des modernen NLP. Im Oktober 2018 veröffentlichten Jacob Devlin und sein Team bei Google Research das Paper zu BERT – Bidirectional Encoder Representations from Transformers. Diese Innovation veränderte die Sprachverarbeitung erheblich, indem sie erstmals tiefe bidirektionale Repräsentationen aus unmarkierten Texten trainierte. Im Gegensatz zu vorherigen Modellen berücksichtigt BERT sowohl linken als auch rechten Kontext in allen Schichten gleichzeitig. Das Ergebnis war bemerkenswert: BERT erreichte neue Bestwerte in elf NLP-Aufgaben und verbesserte den GLUE-Score um beachtliche 7,7 Prozentpunkte auf 80,5%. Das eigentliche Pre-Training verschlang zwar mehrere Tage auf vielen TPUs — doch die Open-Source-Veröffentlichung demokratisierte Spitzentechnologie: Das fertig vortrainierte Modell ließ sich auf einer einzelnen Cloud-TPU in rund 30 Minuten an die eigene Aufgabe feinjustieren (Fine-Tuning). BERT etablierte das Pre-Training-Fine-Tuning-Paradigma, das heute die Grundlage aller großen Sprachmodelle bildet.
Deep Dive: Cosine Similarity
Interaktiv: Wörter im Embedding-Raum
Klicke auf die Wörter und beobachte ihre Position im 2D-Raum. Semantisch ähnliche Wörter liegen nah beieinander. Beachte die parallelen Achsen: König verhält sich zu Königin wie Mann zu Frau — genau die Vektorarithmetik, die Word2Vec berühmt gemacht hat.
Klicke auf einen Kreis, um Details zu sehen.
Legende
Warnungen und Fallstricke
Das Wichtigste
Jetzt verstehst du, wie KI-Modelle Bedeutung repräsentieren. Im nächsten Artikel lernst du Computer Vision und CNNs — wie Maschinen lernen, Bilder zu verstehen.
Quiz: Embeddings & Latent Space
Hast du alles verstanden?
- Warum liegen die Vektoren für "Apfel" und "Banane" dicht beieinander, obwohl die Wörter keine Buchstaben teilen?
- Was bedeutet es, wenn ein Latent Space 12.288 Dimensionen hat?
- Warum findet eine RAG-Suche nach "Passwort zurücksetzen" auch Dokumente über "Zugangsdaten erneuern"?