Embedding
SprachverarbeitungEin Embedding ist eine dichte Vektorrepräsentation von Daten (meist Wörter, Sätze oder andere diskrete Objekte) in einem kontinuierlichen, niedrigdimensionalen Raum, die semantische Beziehungen und Ähnlichkeiten erfasst. Im Gegensatz zu One-Hot-Encoding, das sparse, hochdimensionale Vektoren erzeugt, sind Embeddings kompakte, reellwertige Vektoren, die durch Machine Learning-Verfahren trainiert werden. Word Embeddings wie Word2Vec, GloVe oder moderne Transformer-basierte Ansätze ordnen Wörter so im Vektorraum an, dass ähnliche Wörter nahe beieinanderliegen. Berühmtes Beispiel: Vektor('König') - Vektor('Mann') + Vektor('Frau') ≈ Vektor('Königin'). Embeddings ermöglichen es neuronalen Netzen, semantische Bedeutungen zu verstehen und sind Grundlage moderner NLP-Systeme, von Suchmaschinen bis zu Large Language Models. Sie funktionieren auch für andere Datentypen wie Bilder, Dokumente oder Benutzerprofile.
Beispiel
Im Word2Vec-Embedding haben ähnliche Wörter ähnliche Vektoren: 'Hund' [0.2, -0.1, 0.8, ...] liegt nahe bei 'Katze' [0.3, -0.2, 0.7, ...] aber weit von 'Mathematik' [0.9, 0.4, -0.3, ...]. Diese numerische Nähe spiegelt semantische Verwandtschaft wider und ermöglicht es KI-Systemen, Wortbedeutungen zu verstehen.
Auch bekannt als
Einbettung, Vektorrepräsentation, Wort-Embedding