Bild-Generierung
Bilder erschaffen aus Beschreibungen — die Mathematik dahinter, erstaunlich profan.
Du tippst "ein Fuchs liest Zeitung in einer gemütlichen Bibliothek, Aquarell-Stil" — und Sekunden später erscheint ein Bild, das nie existiert hat. Keine Kamera, kein Pinsel, kein Künstler. Wie verwandelt eine Maschine Wörter in Bilder?
In diesem Artikel lernst du den grundlegenden Mechanismus hinter Tools wie Midjourney, DALL-E und Stable Diffusion. Du verstehst, wie Text zu einem Bild wird, wie du mit Prompts das Ergebnis steuerst und warum jedes Bild einzigartig ist — oder es sein kann.
DALL-E erschafft Bilder aus Text
Ein wegweisender Durchbruch der Text-zu-Bild-Generierung und ein wichtiger Fortschritt der KI-Kreativität. Am 5. Januar 2021 enthüllte OpenAI DALL-E – ein System, das aus Textbeschreibungen kohärente und oft verblüffend kreative Bilder erzeugt. Text-zu-Bild-Modelle gab es zwar schon zuvor (etwa alignDRAW 2015 oder GAN-Ansätze wie StackGAN und AttnGAN), doch DALL-E hob Kohärenz und Vielseitigkeit auf ein neues Niveau. Basierend auf einer 12-Milliarden-Parameter-Version von GPT-3 bewies DALL-E, dass die Grenze zwischen Sprach- und Bildverständnis durchbrochen werden kann. Das System trainierte mit 250 Millionen Bild-Text-Paaren aus dem Internet und entwickelte dabei bemerkenswerte Fähigkeiten: Es kann Tiere vermenschlichen, unverwandte Konzepte plausibel kombinieren und sogar Text in Bilder rendern. Mark Riedl von Georgia Tech kommentierte, die Ergebnisse seien „bemerkenswert kohärenter“ als alle bisherigen Text-zu-Bild-Systeme. DALL-E erweiterte GPTs Sprachverständnis erfolgreich ins Visuelle und eröffnete eine völlig neue Dimension der KI-Kreativität.
Text-to-Image — Wie Wörter zu Bildern werden
Diffusionsmodell
Die Pipeline: Vom Text zum Bild
Beispiel: Der Prompt "eine Katze mit Zylinder, Ölgemälde" liefert in Midjourney dramatische Beleuchtung. DALL-E 3 setzt den Text wörtlich um. Stable Diffusion hängt stark vom geladenen Checkpoint ab. Gleiche Wörter, drei verschiedene Bilder — weil jedes Modell andere visuelle Muster gelernt hat.
Ein Künstler interpretiert die Beschreibung, wählt Technik, Farben und Komposition. Ergebnis nach Stunden oder Tagen.
Das Modell übersetzt den Text in ein Embedding und verfeinert Rauschen in Sekunden. Jedes Ergebnis ist eine neue Kreation.
Stable Diffusion: Open-Source-Bildgenerierung
Die Demokratisierung der KI-Bildgenerierung durch das erste leistungsstarke Open-Source-Modell. Am 22. August 2022 veröffentlichte Stability AI Stable Diffusion und veränderte den Zugang zu fortgeschrittener Text-zu-Bild-Technologie erheblich. Als erstes Open-Source-Modell seiner Klasse konnte Stable Diffusion fotorealistische 512x512-Pixel-Bilder auf Consumer-GPUs generieren – ein wichtiger Fortschritt für Geschwindigkeit und Zugänglichkeit. Basierend auf Latent Diffusion Models (LDMs) iteriert das System durch 'De-noising' in latenten Räumen statt direkter Pixelmanipulation. Mit 860 Millionen Parametern im U-Net und 123 Millionen im Text-Encoder blieb es trotz hoher Leistung relativ leichtgewichtig. Der GitHub-verfügbare Quellcode ermöglichte einer explosionsartig wachsenden Community die Entwicklung unzähliger Varianten und Tools. Stable Diffusion durchbrach das Monopol proprietärer Systeme und machte hochwertige KI-Bildgenerierung für jeden zugänglich.
Warnung: Fotorealismus
Deep Dive: Die Modell-Landschaft
Irrtum: KI-Bilder sind immer als künstlich erkennbar
Midjourney V5: Fotorealistische KI-Kunst
Fotorealistische KI-Bildgenerierung erreicht neue Qualitätsstufe und verändert die kreative Industrie erheblich. Am 15. März 2023 veröffentlichte Midjourney Version 5 und erreichte einen Qualitätssprung, den Nutzer als „gruselig“ und „zu perfekt“ beschrieben. Die Alpha-Version konnte erstmals fotorealistische Bilder erzeugen, die von echten Fotografien kaum zu unterscheiden waren. Besonders bemerkenswert: Das chronische Problem fehlerhafter Hände wurde erheblich verbessert – V5 konnte in den meisten Fällen korrekt fünf Finger darstellen. Julie Wieland, Grafikdesignerin, verglich das Erlebnis mit „endlich eine Brille zu bekommen nach zu langem Ignorieren schlechter Sicht“ – plötzlich sehe man alles in 4K-Qualität [Quelle: Ars Technica, März 2023]. Die verbesserte Prompt-Sensitivität ermöglichte präzisere kreative Kontrolle, während automatisches Upscaling die 1024x1024-Pixel-Basisbilder ohne GPU-Zusatzkosten hochskalierte. V5 löste intensive Debatten über die Zukunft menschlicher Kreativität aus.
Interaktiv: Diffusion aus drei Perspektiven
Wie funktioniert der Diffusionsprozess, der aus Rauschen ein Bild macht? Wechsle zwischen drei Analogien und entdecke unterschiedliche Blickwinkel auf denselben Mechanismus.
Was ist ein Tensor?
Ein Tensor ist die grundlegende Datenstruktur in modernen KI-Systemen. Doch je nach Blickwinkel lassen sich Tensoren ganz unterschiedlich verstehen. Wechsle zwischen drei Analogien, um verschiedene Perspektiven zu erleben.
Diffusion als Skulptur aus Rauschen
Stell dir einen Bildhauer vor, der mit einem Block aus purem Rauschen beginnt — zufällige Pixel ohne Struktur. Schritt für Schritt meißelt er Material weg: Erst entstehen grobe Umrisse, dann Formen, dann feine Details. Das fertige Bild war immer im Rauschen verborgen — der Diffusionsprozess hat es freigelegt.
Stable Diffusion startet mit einem Tensor aus Gaußschem Rauschen [64, 64, 4] im Latent Space. In 20–50 Denoising-Schritten entfernt das U-Net schrittweise Rauschen, gesteuert durch den Text-Prompt. Jeder Schritt ist wie ein Meißelschlag: gezielt, aber nur ein kleines Stück Material.
Tensor-Dimensionen im Vergleich
| Rang | Mathematik | Skulptur | KI-Beispiel |
|---|
Prompt Craft — Die Kunst der Beschreibung
Prompt
Drei Schichten eines guten Prompts
Die Wortreihenfolge ist entscheidend: "Ein schöner Sonnenuntergang über Bergen" erzeugt ein fundamental anderes Bild als "Berge mit einem schönen Sonnenuntergang", weil das Modell frühe Wörter stärker gewichtet.
Irrtum: Längere Prompts erzeugen immer bessere Bilder
Seed & Reproduzierbarkeit — Warum jedes Bild einzigartig ist
Seed
Das Seed-Experiment
Deep Dive: CFG Scale & Steps
Irrtum: Jede Generierung ist komplett zufällig
Das Wichtigste auf einen Blick
Quiz: Bild-Generierung
Checkpoint: Bild-Generierung
- Erkläre anhand der Bildhauer-Analogie, was beim Denoising passiert — und wo die Analogie an ihre Grenzen stößt.
- Warum macht es einen großen Unterschied, ob das Wort "Ölgemälde" ganz am Anfang oder ganz am Ende eines Prompts steht?
- Du findest ein generiertes Bild fast perfekt, möchtest aber nur ein kleines Detail (z.B. eine Wolke) ergänzen. Was musst du tun?