Large Language Models (LLMs)

Deep Learning

Tiefe neuronale Netze – fast immer basierend auf der Transformer-Architektur – die auf enormen Mengen von Textdaten trainiert wurden, um menschliche Sprache zu verstehen und zu generieren. LLMs wie GPT-4, Claude oder Llama zeichnen sich durch ihre Größe aus (oft Hunderte Milliarden Parameter) und durch ihre Fähigkeit, mit minimalem Task-spezifischem Training eine breite Palette von Sprachaufgaben zu bewältigen. Die Transformer-Architektur von Vaswani et al. (2017) machte diese Skalierung erst möglich – durch Self-Attention statt Rekurrenz, was effiziente Parallelisierung und das Training auf beispiellosen Datenmengen ermöglichte.

Beispiel

GPT-4 kann Code schreiben, Texte zusammenfassen, Fragen beantworten und Dialoge führen – alles mit demselben Modell, ohne separate Spezialisierung. Diese Vielseitigkeit entsteht durch Training auf Billionen von Wörtern aus dem Internet.

Verwendet in

Quellen

Zurück zum Glossar