Das Netzwerk

Was die mittleren Schichten eines neuronalen Netzes lernen — und niemandem erklären können.

Architekturen 14 min Fortgeschritten 1. Juni 2026

Ein einzelnes Neuron kann eine Trennlinie ziehen. Aber die Welt besteht nicht aus geraden Linien — sie besteht aus Gesichtern auf Fotos, Bedeutung in Texten und Mustern in Klängen. Um von einem Neuron zu intelligenter Mustererkennung zu gelangen, braucht man Schichten von Neuronen, die zusammenarbeiten und aufeinander aufbauen.

Diese Hidden Layers sind der Ort, an dem die eigentliche Berechnung stattfindet — unsichtbar von außen, aber unverzichtbar für alles, was ein neuronales Netz leisten kann.

Hidden Layer

AnalogieDefinition
Stell dir eine Fabrik vor. Rohstoffe kommen am Eingang an (Input Layer). An jeder Station im Inneren verändern Arbeiter das Material — schneiden, formen, lackieren. Diese Stationen sind die Hidden Layers. Du siehst von außen nie die Zwischenprodukte. Am Ende rollt das fertige Produkt heraus (Output Layer). Jeder Arbeiter hat ein Geschick (Gewicht), das durch Übung verfeinert wird (Training).

Vom Neuron zum Netzwerk

Ein neuronales Netz organisiert Neuronen in Schichten. Der Input Layer nimmt die Rohdaten entgegen — hier findet keine Berechnung statt. Die Hidden Layers führen die eigentliche Verarbeitung durch. Der Output Layer liefert das Endergebnis.

MNIST Netzwerk-Architektur

Handschrifterkennung: 784 Pixel → 10 Ziffern

Input Layer 784 Neuronen (28×28 Pixel)
784
Hidden Layer 1 128 Neuronen (Dense)
128
Hidden Layer 2 64 Neuronen (Dense)
64
Output Layer 10 Neuronen (Ziffern 0-9)
10

Sobald ein Netzwerk mehr als einen Hidden Layer besitzt, gilt es als "tief" — daher der Name Deep Learning. Moderne Architekturen treiben diese Tiefe auf die Spitze: GPT-4 besteht aus rund 120 Transformer-Blöcken, die als gewaltige Folge von Hidden Layers fungieren.

784
Input-Neuronen 28×28 Pixel eines MNIST-Bildes
~109.000
Parameter Trainierbare Gewichte und Biases
~120
Transformer-Blöcke GPT-4 Architektur (Schätzung)

Woher kommen die ~109.000 Parameter? Jede Verbindung zwischen zwei Neuronen hat ein Gewicht, und jedes Neuron hat einen Bias:

  • Layer 1 → 2: 784 × 128 Gewichte + 128 Biases = 100.480
  • Layer 2 → 3: 128 × 64 Gewichte + 64 Biases = 8.256
  • Layer 3 → Output: 64 × 10 Gewichte + 10 Biases = 650

Gesamt: 100.480 + 8.256 + 650 = 109.386 Parameter

Der Forward Pass

Wie fließen die Daten durch das Netzwerk? Der Forward Pass ist der Berechnungsschritt, bei dem Eingabedaten Schicht für Schicht nach vorne gereicht werden, bis am Ende eine Vorhersage steht.

Schritt 1: Lineare Kombination
z = W · x + b
Schritt 2: Aktivierung
a = ReLU(z) = max(0, z)
Gesamtes Netzwerk
output = f3(f2(f1(input)))

In jeder Schicht passiert immer dasselbe: Erst wird der Eingabevektor mit der Gewichtsmatrix multipliziert und der Bias addiert (z = Wx + b). Keine Panik: Ein Vektor ist hier einfach eine Liste von Zahlen, eine Matrix eine Tabelle aus Zahlen. Dann wird eine Aktivierungsfunktion angewandt (a = ReLU(z)). Die Ausgabe einer Schicht wird zur Eingabe der nächsten — mathematisch eine Funktionskomposition.

Anders als beim Staffellauf, wo der Stab unverändert weitergereicht wird, werden die Daten bei jedem Übergang aktiv transformiert.

Batch-Verarbeitung

In der Praxis werden nie einzelne Datenpunkte verarbeitet, sondern ganze Stapel (Batches). Hunderte Beispiele fließen gleichzeitig durch das Netz. Da es sich im Kern um Matrizenmultiplikationen handelt, können GPUs diese Berechnungen extrem effizient parallelisieren.

So definiert man diesen Forward Pass in PyTorch. Ein Aufruf von netz(batch) jagt die Daten durch alle Schichten:

netz = nn.Sequential(
    nn.Linear(784, 128),
    nn.ReLU(),
    nn.Linear(128, 64),
    nn.ReLU(),
    nn.Linear(64, 10)
)

Feature-Hierarchien — Was Hidden Layers lernen

Die spannende Frage: Was speichern die Millionen von Parametern eigentlich? Tiefe Netze lernen automatisch sogenannte Feature-Hierarchien — sie zerlegen die Welt in verschiedene Abstraktionsebenen.

1
Pixel Rohe Eingabedaten: Farbwerte und Helligkeit
2
Kanten Layer 1 erkennt Kanten und einfache Texturen
3
Formen Mittlere Layer kombinieren Kanten zu geometrischen Mustern
4
Objekte Tiefe Layer erkennen komplexe Konzepte: Gesichter, Hunderassen, Gebäude

Zeiler und Fergus (2014) haben CNN-Schichten visualisiert und genau dies gezeigt: Layer 1 erkennt Kanten in allen Richtungen. Layer 2 reagiert auf Texturen und Muster. Layer 5 identifiziert hochspezifische Konzepte wie Gesichter oder Kirchtürme. Diese Visualisierungen widerlegen teilweise den Mythos, Hidden Layers seien eine "Black Box".

Der entscheidende Vorteil gegenüber klassischem Machine Learning: Statt mühsam Merkmale per Hand zu definieren (Feature Engineering), entdeckt das Netzwerk die relevanten Features automatisch.

Interaktiv: Netzwerkarchitektur erkunden

Klicke auf die einzelnen Layer des MNIST-Netzwerks und beobachte, wie die Neuronenanzahl von 784 Eingangspixeln über die Hidden Layer auf 10 Ausgabe-Klassen schrumpft. Achte auf die enormen Verbindungszahlen zwischen den Layern — sie erklären, warum das Training eines Netzwerks so rechenintensiv ist.

7841286410

Klicke auf einen Layer, um Details zu sehen.

"Tiefer ist immer besser" — Nicht so schnell

Ein verbreiteter Irrtum: Mehr Layer bedeuten ein besseres Modell. Die Realität ist komplexer.

Flach (1 Hidden Layer)

Schnell trainiert. Wenige Parameter. Gut für tabellarische Daten und kleine Datensätze. Random Forest und SVM sind oft besser.

Tief (viele Hidden Layers)

Lernt komplexe Muster. Braucht viele Daten und Rechenleistung. Risiko: Vanishing Gradient und Overfitting.

Falsche Annahme: "Mehr Layer = besseres Modell"

Zu tiefe Netze leiden unter zwei Problemen: Erstens dem Vanishing Gradient — die Gradienten schrumpfen beim Training durch viele Schichten, sodass die ersten Layer aufhören zu lernen. Zweitens dem Overfitting — zu viele Parameter lernen die Trainingsdaten auswendig, statt zu generalisieren. Für viele Aufgaben mit tabellarischen Daten sind klassische Modelle wie Random Forest oder SVM die bessere Wahl.

Das Wichtigste

  1. Ein neuronales Netz hat drei Schichttypen: Input (Rohdaten), Hidden (Berechnung), Output (Ergebnis). Hidden Layers heißen so, weil ihre Ausgaben nie direkt sichtbar sind.
  2. "Deep" bedeutet mehr als ein Hidden Layer. Moderne Netze haben hunderte Schichten (GPT-4: ~120 Transformer-Blöcke).
  3. Der Forward Pass wiederholt in jeder Schicht: Matrizenmultiplikation (z = Wx + b), dann Aktivierung (a = ReLU(z)). Die Ausgabe einer Schicht wird zur Eingabe der nächsten.
  4. Hidden Layers lernen automatisch Feature-Hierarchien: Kanten → Formen → Objekte. Das ersetzt manuelles Feature Engineering.
  5. Mehr Tiefe ist nicht immer besser — Vanishing Gradient und Overfitting setzen Grenzen. Für viele Probleme sind einfachere Modelle angemessener.

Quiz: Hidden Layers

Frage 1 / 5
Noch offen

Warum heißen Hidden Layers "hidden"?

Wählen Sie eine Antwort
Auflösung: 1) B · 2) C · 3) B · 4) C · 5) B

Checkpoint: Hidden Layers

  • Warum heißen Hidden Layers eigentlich 'hidden' und was genau ist ein Dense Layer?
  • Wie würdest du einem Laien den Forward Pass beschreiben?
  • Warum scheitert ein Netzwerk, wenn man in der Feature-Hierarchie Schichten überspringt?