TL;DR
Die Auswahl des passenden AI Agent Framework entscheidet im Mittelstand über Time-to-Value und Betriebskosten. Wir vergleichen sechs Frameworks (Claude Agent SDK, LangGraph, AWS Strands, OpenAI Agents, AutoGen, CrewAI), zeigen Hello-World-Code, DSGVO-Pfade und konkrete DACH-Empfehlungen. AutoGen ist tot, LangGraph führt in Production-Mileage, Claude SDK gewinnt bei Code-Agents.
Warum dieser Vergleich jetzt nötig ist
Gartner prognostiziert, dass Ende 2026 rund 40 Prozent der Enterprise-Apps Agent-Logik enthalten — gegenüber unter 5 Prozent in 2025. Im selben Atemzug warnt der Analyst: über 40 Prozent der Agent-Projekte werden bis Ende 2027 gecancelt. 79 Prozent der Unternehmen adoptieren Agents, aber nur 11 Prozent erreichen Production. 88 Prozent der Production-Deployments melden Incidents.
Diese Zahlen lassen zwei Schlüsse zu. Erstens: Agent-Architekturen werden Standard, die Frage ist nicht ob, sondern wie. Zweitens: Die meisten Teams scheitern an Framework-Wahl, Permissioning und Cost-Control — nicht am Modell.
Wir beraten in DACH-Banken, Versicherungen und Industrie. In Q1/2026 haben wir sechs Frameworks in Pilot-Projekten gefahren. Dieser Artikel bündelt, was funktioniert hat und was nicht.
Die sechs Frameworks im Schnellüberblick
AutoGen ist faktisch tot. Microsoft schiebt Teams in Richtung Semantic Kernel und das neue Microsoft Agent Framework. Wer heute auf AutoGen startet, plant einen Rewrite in 12 Monaten ein. Wir behandeln es trotzdem, weil viele Bestandsprojekte darauf laufen.
Bevor die Matrix alle sechs Frameworks nebeneinanderlegt: was das Claude Agent SDK aus Anthropics eigener Hand mitbringt, zeigt der Claude Agent SDK Hub →
Vergleichsmatrix: die acht Dimensionen, die im Betrieb zählen
Drei Dimensionen sind für den deutschen Mittelstand besonders kritisch: DSGVO-Pfad, Self-Hosting-Option und Observability. Wer LangSmith als einzige Tracing-Lösung akzeptiert, hat ein US-Hosting-Problem. Wer OpenAI Hosted Tools (Code Interpreter, File Search) nutzt, exfiltriert Daten in die OpenAI-Cloud — das ist mit BaFin-Auditoren nicht verhandelbar.
Hello World pro Framework
Ein AI Agent Framework muss in unter 20 Zeilen Code zeigen, wie ein Agent läuft. Sonst ist der Lernpfad zu steil für Mittelstandsteams mit drei AI-Engineers.
Claude Agent SDK
import asyncio
from claude_agent_sdk import ClaudeSDKClient, AssistantMessage, TextBlock
async def main():
async with ClaudeSDKClient() as client:
await client.query("Hallo Claude")
async for msg in client.receive_response():
if isinstance(msg, AssistantMessage):
for b in msg.content:
if isinstance(b, TextBlock):
print(b.text)
asyncio.run(main())
Der Code-first-Ansatz ist erkennbar. Das SDK ist ein Harness um den Claude-Loop — Tools, Sandbox, Permissions kommen über Konfiguration und Hooks dazu.
LangGraph
from langgraph.prebuilt import create_react_agent
from langchain_openai import ChatOpenAI
agent = create_react_agent(ChatOpenAI(model="gpt-4o"), tools=[])
agent.invoke({"messages": [("user", "Hallo")]})
Prebuilt ReAct ist die einfache Tür. Darunter sitzt der StateGraph mit Nodes und Edges. Sobald Multi-Agent oder Branching ins Spiel kommt, öffnet man die volle Graph-API.
AWS Strands
from strands import Agent
agent = Agent(model="anthropic.claude-sonnet-4")
print(agent("Hallo"))
Strands ist radikal minimal. Der Agent ist ein Loop, das Modell entscheidet alles. Tools, MCP, A2A werden additiv reingehängt. Production-Ready durch AgentCore (Runtime, Memory, Identity).
OpenAI Agents SDK
from agents import Agent, Runner
agent = Agent(name="Helper", instructions="Antworte kurz.")
print(Runner.run_sync(agent, "Hallo").final_output)
OpenAIs Antwort auf Swarm — Handoffs zwischen Agents sind erstklassiges Konzept. Das macht es stark für Customer-Service-Routing, aber schwach bei DSGVO, wenn Hosted Tools eingebunden werden.
CrewAI
from crewai import Agent, Task, Crew
a = Agent(role="Researcher", goal="Antworte", backstory="Hilfsbereit", llm="gpt-4o")
t = Task(description="Sag Hallo", agent=a, expected_output="Gruß")
print(Crew(agents=[a], tasks=[t]).kickoff())
Role-based ist die Stärke und gleichzeitig die Falle. Wer Multi-Agent zu früh modelliert, baut Hidden State, der im Production-Debugging die Hölle ist.
AutoGen sparen wir uns als Code-Beispiel — wer hier neu startet, sollte direkt auf Microsoft Agent Framework warten oder LangGraph wählen.
Wann welches AI Agent Framework: unsere Empfehlungen
Pauschal-Empfehlungen sind in dem Feld gefährlich. Wir geben deshalb Use-Case-spezifische Antworten. Die folgenden Empfehlungen basieren auf zwölf realen Pilot-Projekten zwischen Q3/2025 und Q1/2026.
Single-Agent mit Tool-Use
Wenn ein einzelner Agent eine API ruft, ein Dokument liest oder eine Antwort generiert, ist ein vollwertiges AI Agent Framework Overkill. Direkter SDK-Call (Anthropic, OpenAI, Mistral) plus eine eigene Tool-Schleife in 50 Zeilen Python reicht. Wer trotzdem ein Framework will: OpenAI Agents SDK oder PydanticAI. Beide sind leichtgewichtig und kommen ohne Graph-Overhead aus.
Multi-Agent in komplexen Workflows
LangGraph ist hier die Wahl. Production-Mileage bei Klarna, Uber, LinkedIn, Replit, GitLab und Elastic. Wer auf der Plattform ankommt, profitiert von Interrupts (Human-in-the-Loop ohne Custom-Code), Checkpointing und einem Graph-Modell, das sich im Audit erklären lässt. Achtung bei der Observability — wer LangSmith nicht US-hosten will, muss OTel selbst integrieren. Das funktioniert, ist aber zusätzlicher Aufwand.
Code-Generation und Software-Agents
Claude Agent SDK ist dafür gebaut. Das Harness kommt mit Bash, File-Edit, Permission-Prompts und Subagents out of the box. Wer Coding-Copiloten, Refactoring-Agents oder Test-Generierung baut, hat hier den kürzesten Pfad zur Demo. Anti-Pattern: Claude SDK für klassische Business-Workflows zweckentfremden. Die Tools sind zu Software-spezifisch, das Permission-Modell ist auf Filesystem-Operationen geeicht.
Enterprise AWS-Stack
AWS Strands plus AgentCore ist die saubere Antwort. Bedrock Frankfurt löst DSGVO, AgentCore bringt Runtime, Identity und Memory in einer Hand. 14 Millionen Downloads zeigen, dass die Plattform Traktion hat. Limitation: wer nicht im AWS-Stack steht, verliert die Hälfte des Mehrwerts.
Mittelstand Azure-Stack
LangGraph mit Azure OpenAI oder PydanticAI. Beide laufen lokal, beide sind model-agnostisch. Azure OpenAI mit europäischen Endpoints löst DSGVO. Wer Mistral oder Aleph Alpha einsetzen will, kann das ohne Framework-Wechsel tun.
DACH Banking und Versicherung
LangGraph self-hosted mit Mistral Large oder Aleph Alpha. Kein Hosted Tool, keine US-Tracing-Dependency. Das ist heute der einzige Pfad, der mit BaFin-Auditoren ohne Workaround durchgeht. Wer auf Bedrock setzt, muss Bedrock Frankfurt nutzen und Data-Residency vertraglich nachhalten.
Empfehlung gelesen. Traegt sie im eigenen Stack?
Discovery-Workshop, Entwicklung, Hosting-Setup und Team-Schulung in einem Sprint: mit dem Framework, das oben zu Ihrem Fall passt.
Anti-Patterns: was wir in Pilot-Projekten gesehen haben
Sieben Muster killen Agent-Projekte zuverlässig. Jedes davon ist uns in den letzten zwölf Monaten in mindestens einem Kunden-Setup begegnet.
Multi-Agent zuerst. Teams modellieren fünf Agents, bevor ein Agent stabil läuft. Hidden State zwischen Agents führt zu Retry-Storms. Token-Kosten explodieren. Debugging ist unmöglich. Regel: ein Agent muss in Production laufen, bevor der zweite geplant wird.
Over-Permissioning. Agent darf Bash, darf curl, darf Files schreiben. Niemand setzt Allowlists. Bei der ersten Halluzination löscht der Agent ein Repository. Regel: jedes Tool braucht eine explizite Allowlist und ein Cost-Budget.
Framework-Lock-in. Prompt-Templates kleben am Framework. Wer LangChain-PromptTemplates flächendeckend nutzt, kommt da nicht raus. Regel: Prompts in Plain-Strings oder Jinja-Templates auslagern, Framework nur als Orchestrator nutzen.
LangSmith als einzige Tracing-Lösung. US-hosted, kommerziell, Vendor-Lock. Regel: OTel parallel mitschreiben — Phoenix, Langfuse oder Jaeger funktionieren on-premise.
Hosted-Tools-Trap. OpenAI Code Interpreter läuft in OpenAI-Cloud, nicht im Kunden-VPC. Mit Banking-Daten ist das ein No-Go. Regel: Hosted Tools nur in Public-Daten-Use-Cases. Sonst eigene Sandbox (Daytona, E2B, oder selbst gebaut).
Kein Cost-Budget. Agents brennen 50x mehr Tokens als Chat. Ohne Budget-Cap und Per-Run-Limit landet das erste Production-Deployment bei 30.000 USD im Monat. Realistische Spanne: 3.200 bis 13.000 USD pro Enterprise-Agent pro Monat. Regel: Cost-Budget vor erstem Pilot-Tag setzen.
Eval erst nach Launch. Teams definieren keinen Eval-Datensatz. Nach Release sieht niemand, ob das System schlechter wird. Regel: 50 bis 200 Eval-Cases vor Launch, Run nach jedem Prompt-Change.
Wann gar kein Framework?
Ein klares Anti-Pattern ist Framework-Wahl ohne Grund. Wenn der Use-Case ein einziger LLM-Call mit einem Tool ist — Beispiel: Frachtrechnung scannen, Felder extrahieren, in SAP schieben — reicht ein direkter SDK-Call. Kein LangGraph, kein CrewAI, kein Claude SDK. Wer hier ein AI Agent Framework dazwischenschiebt, fügt Komplexität ohne Funktionsgewinn hinzu.
Faustregel: Sobald mehr als ein Tool im Spiel ist, der Agent über mehrere Turns läuft oder Branching nötig ist, lohnt ein Framework. Davor: direkter Call.
Observability: der unterschätzte Production-Faktor
In Production sind drei Dinge wichtig: Latency, Cost und Error-Rate. Ein gutes AI Agent Framework macht diese drei Metriken sichtbar, ohne dass das Team einen Tracing-Stack selbst bauen muss.
Wer Tracing erst nach dem ersten Production-Incident einbaut, hat das Game verloren. Wir setzen in jedem Pilot OTel von Tag 1 ein.
DSGVO-Pfad pro Framework
Die Frage ist nicht, ob ein Framework DSGVO-konform ist — das hängt am Modell-Hosting. Die Frage ist, ob das Framework den DSGVO-Pfad sauber unterstützt.
Claude Agent SDK: ja, über Bedrock EU oder Azure-vermittelt. Direktnutzung der Anthropic-API ist US-Hosting.
LangGraph: ja, model-agnostisch. Mistral La Plateforme in Frankreich, Aleph Alpha in Deutschland, Azure OpenAI EU-Region.
AWS Strands: ja, über Bedrock Frankfurt. Data-Residency vertraglich nachhalten.
OpenAI Agents: nur über Azure OpenAI EU. Direktnutzung der OpenAI-API ist nicht DSGVO-konform für regulierte Daten.
AutoGen und CrewAI: model-agnostisch, also DSGVO-Pfad abhängig vom gewählten Modell.
Was wir in den nächsten 12 Monaten erwarten
Drei Entwicklungen werden den Markt prägen. Erstens: MCP wird zum De-facto-Standard. Jedes Framework hat 2026 nativen MCP-Support — was vor einem Jahr noch Adapter-Code war, ist heute Standard-API.
Zweitens: Microsoft konsolidiert AutoGen, Semantic Kernel und Copilot Studio im Microsoft Agent Framework. Wer heute AutoGen-Workloads hat, plant den Migrations-Pfad jetzt.
Drittens: Production-Standards setzen sich durch. AgentOps, Eval-Pipelines, OTel-Tracing werden Pflicht. Frameworks ohne diese Bausteine fallen aus Enterprise-Shortlists raus. AutoGen ist das erste Beispiel.
Häufig gestellte Fragen
Welches AI Agent Framework für DACH-Mittelstand?
LangGraph mit Azure OpenAI EU-Region oder Mistral. Beide Optionen sind DSGVO-konform, model-agnostisch und production-ready. Wer im AWS-Stack steht, nimmt Strands mit Bedrock Frankfurt. Finger weg von OpenAI Agents mit Hosted Tools, solange regulierte Daten im Spiel sind.
Claude Agent SDK vs LangGraph — was nehmen?
Hängt am Use-Case. Code-Agents, Refactoring, Test-Generierung: Claude Agent SDK. Multi-Agent-Workflows, Business-Prozesse, Customer-Service: LangGraph. Claude SDK ist ein Harness für Software-Agents, LangGraph ist ein universeller Graph-Orchestrator. Beide haben ihren Platz, aber nicht im selben Projekt.
Brauche ich LangGraph oder reicht OpenAI Agents?
Für einfache Handoff-Szenarien (Customer-Service-Routing, einfache Tool-Use-Agents) reicht OpenAI Agents. Sobald Branching, Human-in-the-Loop, persistente State-Verwaltung oder mehr als drei Agents im Spiel sind, ist LangGraph die saubere Wahl. Und: bei regulierten Daten in DACH ist OpenAI Agents nur via Azure OpenAI nutzbar.
Können Agents in Production?
Ja, aber selten. 88 Prozent der Production-Deployments melden Incidents, nur 11 Prozent der adoptierenden Firmen haben Agents in Production. Wer es schafft, hat drei Dinge: Eval-Pipeline, OTel-Tracing und Cost-Budget vor Tag 1. Ohne diese drei Bausteine ist Production-Deployment ein Glücksspiel.
Was kostet ein AI Agent Framework in Production?
Lizenz für die Frameworks selbst: null (alle Open Source). Modell- und Ops-Kosten: 3.200 bis 13.000 USD pro Enterprise-Agent und Monat. Agents brennen rund 50x mehr Tokens als Chat-Workloads. Wer ein Eval-Tooling on-prem hostet (Langfuse, Phoenix), kommt mit zusätzlichen 200 bis 500 USD pro Monat aus. Hosted Eval-Tools (LangSmith, CrewAI+) sind teurer und werfen Hosting-Fragen auf.
Nächster Schritt
Die Framework-Wahl entscheidet über Time-to-Value, Betriebskosten und Vendor-Risiko Ihres ersten Agent-Projekts. Wir haben in DACH-Mittelstand und Enterprise alle sechs Frameworks in Pilot-Projekten gefahren und wissen, welche Fallen produzieren und welche skalieren.
Vom Vergleich zum produktiven Agenten
Die Wahl ist getroffen. Der Pilot zeigt in 6 Wochen, ob sie im eigenen Stack traegt.
Ein Festpreis-Scope aus Workshop, Entwicklung, Hosting und Team-Schulung statt Framework-Rewrite in 12 Monaten wie bei AutoGen: ein produktionsreifer MVP mit der oben empfohlenen Wahl.
Festpreis ab 30.000 EURDeckt Workshops, Entwicklung, Hosting und Schulungen ab. 6 Wochen bis zum produktionsreifen MVP.
Verwandte Themen
→KI-Beratung
→Document Intelligence
→RAG und KI-Dokumentensuche
→6-Wochen-Pilotprojekt Generative AI
Weiterlesen: Alle vier Claude-Agent-SDK-Leitfäden im Überblick.



