Wenn Software mit Modellen spricht, braucht jemand die Vokabeln — APIs und MCP machen das.
Architekturen 10 min Fortgeschritten 26. April 2026
Du hast gesehen, was ein Sprachmodell kann, wenn du in ein Chatfenster tippst. Aber Software tippt nicht — sie sendet strukturierte Anfragen über eine API.
Dieser Artikel führt dich von deinem ersten API-Aufruf bis zum Protokoll, das standardisieren könnte, wie alle KI-Werkzeuge sich verbinden: MCP. Unterwegs erfährst du, was diese Aufrufe kosten, warum 50 individuelle Integrationen ein Problem sind und wie vier Bausteine aus einem einzelnen Modell einen handelnden Agenten machen.
Vom Chatfenster zum Code
Sobald du vom Chat-Interface zum Code wechselst, wird das Modell zu einem Dienst, den du aufrufst — wie jede andere Web-API auch.
LLM-API
AnalogieDefinition
Stell dir eine Bestelltheke in einem Restaurant vor. Du füllst ein Bestellformular aus (die JSON-Anfrage), das genau angibt, was du möchtest: Modell, Nachrichten, Temperatur. Du gibst es zusammen mit deiner Mitgliedskarte (API-Key) an der Theke ab. Die Küche (das Modell) verarbeitet deine Bestellung und schickt ein Tablett zurück (JSON-Antwort). Du zahlst pro Gericht auf dem Tablett, nicht pro Besuch.
Analogie:
Stell dir eine Bestelltheke in einem Restaurant vor. Du füllst ein Bestellformular aus (die JSON-Anfrage), das genau angibt, was du möchtest: Modell, Nachrichten, Temperatur. Du gibst es zusammen mit deiner Mitgliedskarte (API-Key) an der Theke ab. Die Küche (das Modell) verarbeitet deine Bestellung und schickt ein Tablett zurück (JSON-Antwort). Du zahlst pro Gericht auf dem Tablett, nicht pro Besuch.
Definition:
Ein HTTP-Endpunkt, der eine strukturierte JSON-Anfrage entgegennimmt (Modellname, Nachrichtenverlauf, Parameter) und die Modellantwort als JSON zurückgibt. Die Authentifizierung erfolgt über einen API-Key — ein geheimer Token, der an ein Abrechnungskonto gebunden ist.
Wichtig: Du wählst dabei nicht die Zutaten aus — du hast keinen Zugriff auf die internen Abläufe des Modells.
Ein minimaler Python-Aufruf sieht so aus:
from openai import OpenAI
client = OpenAI(api_key="sk-...")
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "What is DNA?"}]
)
print(response.choices[0].message.content)
Was kostet ein API-Aufruf?
Die Abrechnung erfolgt getrennt nach Input- und Output-Tokens.
Beispiel mit GPT-4o-Preisen: 30 Input-Tokens × 2,50 USD pro Million = 0,000075 USD. 100 Output-Tokens × 10,00 USD pro Million = 0,001 USD. Gesamt: etwa 0,001 USD — rund ein Zehntel Cent.
Bei 1.000 Aufrufen pro Tag: circa 1,08 USD. Bei 100.000 Aufrufen pro Tag: circa 107 USD.
~0,1 Cent
Pro Aufruf Kosten eines einzelnen GPT-4o-Aufrufs
~107 USD
Bei 100k Aufrufen/Tag Tägliche Kosten bei hohem Volumen
70 %
Weniger Integrationen Einsparung durch MCP (N+M statt N×M)
Häufiger Irrtum: APIs sind teuer
Einzelne Aufrufe kosten Bruchteile eines Cents. Das Kostenrisiko liegt im Volumen und in langen Kontextfenstern — nicht im einzelnen Request. Denk an API-Kosten wie an eine Wasserrechnung: Der Literpreis ist winzig, aber den Hahn offen zu lassen, leert das Budget.
Interaktiv: Was passiert bei einem API-Aufruf?
Klicke auf Play und beobachte Schritt für Schritt, was hinter den Kulissen passiert, wenn dein Code eine API aufruft — vom Browser über DNS und TLS bis zur JSON-Antwort.
Der Weg einer HTTP-Anfrage
Diese Animation zeigt die sechs Stationen, die jeder API-Aufruf durchläuft — vom Klick im Browser bis zur JSON-Antwort.
Schritt 0 von 6
Animation starten
Klicke auf "Abspielen", um die RAG-Pipeline Schritt für Schritt zu sehen.
Warum ist das wichtig?
Jeder API-Aufruf — ob an OpenAI, Claude oder eine eigene REST-API — durchläuft exakt diese Schritte. Wenn du verstehst, was passiert, kannst du Fehler (Timeouts, 404, CORS) schneller diagnostizieren.
Ein Stecker für alles — MCP
Du hast gerade gesehen, wie eine App mit einem Modell spricht. Stell dir jetzt fünf Apps vor, die jeweils zehn verschiedene Werkzeuge brauchen. Ohne Standard sind das 50 Integrationen. Das ist das N×M-Problem.
Model Context Protocol (MCP)
AnalogieDefinition
USB-C für KI. Vor USB-C hatte jedes Gerät seinen eigenen Stecker — Handy-Ladegerät, Kamerakabel, Festplattenanschluss. Bei 5 Geräten und 10 Zubehörteilen brauchtest du bis zu 50 verschiedene Kabel. USB-C reduziert das auf einen Standardstecker: Jedes Gerät und jedes Zubehörteil braucht nur einen USB-C-Anschluss. MCP macht dasselbe für KI-Integrationen.
Analogie:
USB-C für KI. Vor USB-C hatte jedes Gerät seinen eigenen Stecker — Handy-Ladegerät, Kamerakabel, Festplattenanschluss. Bei 5 Geräten und 10 Zubehörteilen brauchtest du bis zu 50 verschiedene Kabel. USB-C reduziert das auf einen Standardstecker: Jedes Gerät und jedes Zubehörteil braucht nur einen USB-C-Anschluss. MCP macht dasselbe für KI-Integrationen.
Definition:
Ein offenes Protokoll (eingeführt von Anthropic Ende 2024) zur Standardisierung bidirektionaler Verbindungen zwischen KI-Anwendungen und externen Werkzeugen. Ein MCP-Server stellt Werkzeuge bereit, ein MCP-Client verwaltet die Verbindung, und das LLM entscheidet, welches Werkzeug wann aufgerufen wird.
Ohne MCP
5 Apps × 10 Tools = 50 individuelle Integrationen, die gebaut und gewartet werden müssen.
Mit MCP
5 MCP-Clients + 10 MCP-Server = 15 Implementierungen. Das ist eine Reduktion um 70 %.
Wichtiger Unterschied: USB-C ist ein ausgereifter, universeller Standard. MCP ist jung (2024) und noch nicht universell verbreitet.
Architektonisch bildet MCP ein Dreieck: Der MCP-Server bietet Werkzeuge an, der Client verwaltet die Verbindung, und das LLM entscheidet, wann welches Werkzeug sinnvoll ist. Konkretes Beispiel: Claude Desktop verbindet sich über drei MCP-Server mit Dateisystem, SQLite und GitHub — ein Protokoll, drei Fähigkeiten.
Wichtig: MCP ist kein Universalersatz
MCP ersetzt nicht alle APIs. Direkte Anbindungen bleiben notwendig für spezialisierte SaaS-Dienste, bei denen noch kein MCP-Server existiert. MCP standardisiert, wie KI Werkzeuge entdeckt und aufruft — nicht wie das Werkzeug intern funktioniert.
Anatomie eines Agenten
Ein API-Aufruf ist eine Frage mit einer Antwort. Ein Agent ist eine Schleife — er plant, handelt, beobachtet und entscheidet, ob er weitermacht. Diese Schleife braucht vier Bausteine.
Gehirn (LLM) Plant und interpretiert — entscheidet, welches Werkzeug wann zum Einsatz kommt
Hände (Tools) Führen Aktionen aus — jedes Werkzeug hat eine spezifische Funktion
Gedächtnis (Kontext) Speichert Verlauf, Dokumente und Zwischenergebnisse über Schritte hinweg
Dirigent (Orchestrierung) Steuert den Ablauf, behandelt Fehler und bestimmt Abbruchbedingungen
Stell dir einen Küchenchef beim Abendservice vor.
Das Gehirn des Chefs ist das LLM — er liest Bestellungen, entscheidet, was gekocht wird, und priorisiert. Seine Hände sind die Werkzeuge — Messer, Herd, Ofen, jedes mit einer spezifischen Funktion. Die Bestellzettel über der Durchreiche sind der Kontext — sie verfolgen, was bestellt, in Arbeit und fertig ist. Der Küchenablauf ist die Orchestrierung: Vorspeisen zuerst, dann Hauptgerichte, dann Desserts, Timing prüfen.
Wie ein echter Chef kann auch ein Agent Fehler machen — das falsche Werkzeug wählen oder eine Bestellung falsch lesen.
1
Aufgabe empfangen
2
Planen (LLM wählt Werkzeug)
3
Ausführen (Tool läuft)
4
Beobachten (Ergebnis zurück)
5
Entscheiden (weiter oder stopp)
Beispiel: Ein Reisebuchungs-Agent
Schritt 1: Der Nutzer sagt: Buche mir einen Flug nach Berlin nächsten Dienstag. Schritt 2: Das LLM liest den Kalender (Kontext) — Dienstag ist der 24. März. Schritt 3: Das LLM ruft die Flugsuche auf — drei Optionen gefunden. Schritt 4: Das LLM vergleicht Preise und Zeiten, wählt den günstigsten Morgenflug. Schritt 5: Das LLM fragt den Nutzer um Bestätigung (Sicherheitstor). Schritt 6: Nutzer bestätigt. Schritt 7: Das LLM ruft das Buchungstool auf. Schritt 8: Die Orchestrierung prüft das Ergebnis — Buchung bestätigt — Schleife endet.
Häufiger Irrtum: Agenten sind autonome KI
Heutige Agenten sind nur so leistungsfähig wie ihre Werkzeuge, Berechtigungen und Sicherheitsgrenzen. Sie improvisieren nicht — sie folgen einer Plan-Ausführen-Beobachten-Schleife innerhalb definierter Leitplanken. Ein Agent ohne Werkzeuge ist ein Chatbot. Ein Agent ohne Leitplanken ist ein Risiko.
Überblick: Agent-Frameworks
LangChain: Breites Integrationsökosystem — viele Konnektoren, viele Möglichkeiten.
LlamaIndex: RAG-fokussiert — Dokumentenverarbeitung und Wissensabfrage als Kernstärke.
CrewAI: Multi-Agent-Kollaboration — Agenten mit definierten Rollen arbeiten zusammen.
Claude Agent SDK: Schlank und MCP-nativ — minimaler Overhead, maximale Protokoll-Integration.
Diese Übersicht ist ein Wegweiser, kein Vergleichstest. Jedes Framework hat seinen Schwerpunkt.
Das Wichtigste
Ein API-Aufruf ist ein HTTP-POST mit JSON — dasselbe Denkmodell, das du aus der Webentwicklung kennst, angewandt auf Sprachmodelle.
MCP verwandelt das Integrationschaos von N×M (viele Modelle mal viele Tools) in eine handhabbare N+M-Struktur, indem es standardisiert, wie Werkzeuge ihre Fähigkeiten bereitstellen.
Ein Agent ist keine Magie — er ist eine Schleife aus vier Komponenten (LLM, Tools, Kontext, Orchestrierung), die sich wiederholt, bis eine Abbruchbedingung erfüllt ist.
Wissenscheck: APIs & MCP
Frage 1 / 6
Noch offen
Was ist die Hauptaufgabe eines API-Keys beim Aufruf einer LLM-API?
1. Was ist die Hauptaufgabe eines API-Keys beim Aufruf einer LLM-API?
☐ A) Er bestimmt, in welcher Sprache das Modell antwortet.
☐ B) Er authentifiziert deine Anwendung und verknüpft die Nutzung mit einem Abrechnungskonto.
☐ C) Er verschlüsselt den Inhalt deines Prompts, damit niemand ihn lesen kann.
☐ D) Er wählt die spezifische GPU aus, die deinen Request verarbeitet.
2. Welche Aussage beschreibt am besten, was MCP standardisiert?
☐ A) Die interne Architektur von Sprachmodellen.
☐ B) Die Preisstruktur verschiedener KI-Anbieter.
☐ C) Wie KI-Anwendungen externe Werkzeuge über ein gemeinsames Protokoll entdecken und aufrufen.
☐ D) Wie Trainingsdaten für Feinabstimmung gesammelt und gelabelt werden.
3. Ein Startup führt 50.000 API-Aufrufe pro Tag durch. Jeder Aufruf nutzt 200 Input-Tokens und 500 Output-Tokens. Der Anbieter berechnet 3,00 USD pro Million Input-Tokens und 15,00 USD pro Million Output-Tokens. Wie hoch sind die ungefähren täglichen Kosten?
☐ A) Etwa 4 USD
☐ B) Etwa 40 USD
☐ C) Etwa 405 USD
☐ D) Etwa 4.050 USD
4. Ein Unternehmen hat 3 KI-Anwendungen, die jeweils mit 8 verschiedenen Tools arbeiten müssen. Wie viele Integrationen braucht man ohne MCP — und wie viele mit MCP?
☐ A) Ohne: 11, Mit: 24
☐ B) Ohne: 24, Mit: 11
☐ C) Ohne: 24, Mit: 8
☐ D) Ohne: 11, Mit: 3
5. Ein KI-Agent soll ein 200-seitiges PDF zusammenfassen, produziert aber immer unvollständige Zusammenfassungen. Welche Komponente der Agentenarchitektur ist am wahrscheinlichsten das Problem?
☐ A) Orchestrierung — die Schleife bricht zu früh ab.
☐ B) Tools — der PDF-Reader kann keine großen Dateien verarbeiten.
☐ C) LLM — das Kontextfenster fasst nicht alle Seiten.
☐ D) Jede der genannten Komponenten könnte die Ursache sein — die Diagnose erfordert eine Prüfung jeder einzelnen.
6. Ein Entwickler argumentiert: Wir brauchen kein MCP — direkte API-Integrationen reichen. In welchem Szenario ist dieses Argument am stärksten?
☐ A) Das Team hat 2 Apps, die je 2 stabile, selten wechselnde Tools nutzen.
☐ B) Das Team hat 10 Apps, die 15 gemeinsame Tools nutzen.
☐ C) Das Team fügt jedes Quartal neue Tools über mehrere Apps hinweg hinzu.
☐ D) Das Team baut Open-Source-KI-Tools für breite Community-Nutzung.
Auflösung: 1) B · 2) C · 3) C · 4) B · 5) D · 6) A
Selbstcheck: APIs & MCP
Kannst du erklären, was technisch passiert, wenn Software einen Prompt an ein LLM sendet — vom Request bis zur Antwort?
Warum reduziert MCP die Anzahl der Integrationen von 50 auf 15 bei fünf Apps und zehn Tools?
Benenne die vier Bausteine eines Agenten und erkläre, warum das Entfernen eines einzelnen Bausteins das System bricht.