Bias & Datenqualität
Schlechte Daten in, schlechte KI out — mit der unangenehmen Pointe, dass es kein "perfekt fair" gibt.
Worum es geht
Training Bias
Training Bias
Beispiel: Dermatologie-Bildklassifikator
Irrtum: "KI ist objektiver als Menschen"
Impossibility Theorem
Impossibility Theorem
Der Anteil der fälschlicherweise als positiv klassifizierten Fälle (die «Fehlalarme» der Gebäude-Analogie) ist für alle Gruppen identisch. Minimiert unbegründete Alarme — aber kann echte Fälle übersehen.
Der Anteil der übersehenen positiven Fälle (die «verpassten Brände» der Gebäude-Analogie) ist für alle Gruppen identisch. Maximiert die Erkennung — aber kann zu mehr Fehlalarmen in manchen Gruppen führen.
Beispiel: Medizinisches Screening
Irrtum: "Bias kann mit genug Aufwand eliminiert werden"
Signal vs. Noise
Analogie: Lernen mit gemischten Notizen
Beispiel: Sprachmodell-Training
ImageNet: Der Datensatz der alles veränderte
Die Schaffung des Datensatzes, der die Deep Learning-Entwicklung ermöglichte. 2009 stellte Fei-Fei Li mit ihrem Team das ImageNet-Paper vor und präsentierte eine visuelle Datenbank, die Computer Vision transformieren sollte – zum Launch waren es rund 3,2 Millionen handannotierte Bilder in etwa 5.200 Kategorien. Auf seine volle Größe ausgebaut umfasste ImageNet später über 14 Millionen handannotierte Bilder und rund 22.000 Kategorien, basierend auf WordNet-Hierarchien, und adressierte so den kritischen Engpass: den Mangel an großen, qualitativ hochwertigen Trainingsdaten. Die Annotation erfolgte im Lauf des Projekts durch rund 49.000 Worker aus 167 Ländern via Amazon Mechanical Turk – ein beispiellos kollaboratives Projekt. Was als Poster in einer Ecke eines Miami Beach-Konferenzzentrums begann, entwickelte sich zur jährlichen ImageNet Challenge (ILSVRC) und wurde zu einem der drei Treiber der modernen KI-Entwicklung. ImageNet ermöglichte AlexNets 2012er-Durchbruch und legte das Fundament für autonome Fahrzeuge, Gesichtserkennung und medizinische Bildgebung.
Irrtum: "Mehr Daten lösen immer das Bias-Problem"
Deep Dive: Datasheets for Datasets
Interaktiv: Welche Art Bias liegt vor?
Du hast drei Fehlerquellen kennengelernt: verzerrte Trainingsdaten, widersprüchliche Fairness-Metriken und mangelnde Datenqualität. Nutze den Diagnosebaum, um systematisch einzugrenzen, welcher Mechanismus in einem konkreten Fall vorliegt.
Wo liegt die vermutete Fehlerquelle?
Kernaussagen
Quiz: Bias & Datenqualität
Checkpoint: Verstehst du Bias & Datenqualität?
- Stell dir vor, eine KI lernt nur aus englischen Texten, was "gutes Essen" ist. Welcher Bias entsteht dabei und warum?
- Warum ist es mathematisch unmöglich, ein Alarmsystem so einzustellen, dass es für zwei sehr unterschiedliche Gebäude gleichzeitig in allen Fairness-Metriken "gerecht" ist?
- Warum löst man das Problem von verzerrten Trainingsdaten nicht einfach, indem man die KI mit noch mehr Daten aus dem Internet füttert?