Phillip Pham, AI Developer bei Pexon Consulting | 10 Min. Lesezeit | 01.09.2026
TL;DR
Ein Agent besteht aus drei Teilen: Harness, Modell, Kontext. Wer seine Intelligenz besitzen will, sollte alle drei besitzen. Die Faustregel: Je weiter Ihr Use Case von dem entfernt ist, worauf die Modelle trainiert sind, desto mehr lohnt sich ein eigener Harness. Für Coding und Dateien reichen Claude Code oder Codex. Für Legal, Finance, Healthcare und proprietäre Prozesse zahlen sich Middleware, private Evals und ein Data Flywheel aus. Pexon Consulting (80 Mitarbeitende, Deutschland) begleitet die Entscheidung und den Bau. Der Einstieg ist der Plattform-Check in 45 Minuten.
Das Problem: fertig kaufen, wo die Domäne nicht trainiert wurde
Zwei Teams stellen dieselbe Frage: Brauchen wir einen eigenen Agent Harness, oder reicht Claude Code, Codex, Deep Agents?
Das eine Team schreibt Software. Das Modell kennt Dateien, Tests, Diffs. Ein fertiger Harness ist dort exzellent. Selbst bauen wäre Wartung ohne Vorteil.
Das andere Team steckt denselben Loop in einen Fachprozess: Freigabe vor Versand, Buchung in fester Reihenfolge, Aktenzeichen, Maschinenparameter. Der Loop läuft, das Ergebnis ist unbrauchbar oder nicht nachvollziehbar. Das Modell ist dasselbe. Die Verteilung ist eine andere.
Was ein Agent Harness ist, haben wir in Agent Harness: warum das Modell nicht alles ist getrennt vom Modell erklärt. Dieser Text beantwortet die nächste Frage: wann Sie die Schicht selbst besitzen sollten.
Agent gleich Harness plus Modell plus Kontext
Die Kurzformel aus dem Sequoia-Talk von Harrison Chase (LangChain, Own Your Intelligence) lautet:
├── Harness → bringt Kontext zum richtigen Zeitpunkt zum Modell
├── Modell → das LLM, wechselbar, kein Lock-in
└── Kontext → Memory, Wissen, bisherige Konversation
Own Your Intelligence heißt: alle drei Teile selbst besitzen. Wer nur das Modell mietet und den Loop dem Hersteller überlässt, besitzt die Intelligenz nicht. Wer das Modell tauscht, aber Prompt, Tools und Gates neu schreiben muss, hat keinen Wechsel, sondern ein Projekt.
Fast jeder Agent ist ein LLM in einer Schleife, das Tools aufruft. Anfrage, Generierung, Tool-Call, Beobachtung zurück, wiederholen. Claude Code, Codex, Deep Agents und OpenClaw laufen auf diesem Loop. Sie unterscheiden sich in den Bausteinen drumherum: Sandbox, Dateisystem, Sub-Agents, Memory, Summarization.
Die Customisierung sitzt in Middleware und Hooks. Code vor dem Agenten oder vor jedem Modell-Call. Modell-Calls wrappen, wenn der Kontext zu lang wird. Tool-Calls wrappen, wenn Antworten offloaded werden müssen. Der Kern bleibt simpel. Die Domäne kommt als Baustein, nicht als neues Framework.
Die Entscheidungsregel: In- oder Out-of-Distribution
Modelle sind stark, wo sie trainiert wurden. Coding, Datei-Editing, generische Büroaufgaben liegen In-Distribution. Branchen-Domänen, proprietäre Prozesse, Legal, Finance, Healthcare liegen Out-of-Distribution. Die Distanz entscheidet, nicht die Vorliebe für Open Source.
Der Trade-off ist ehrlich. Ein fertiger Harness ist schnell und gepflegt, aber an ein Ökosystem gebunden: Claude Code an Anthropic, Codex an OpenAI. Ein eigener Harness ist modell-agnostisch und gehört Ihnen, kostet aber Engineering. Der Mittelweg sind Hooks auf einem fertigen Harness.
Wichtig: Auch beim eigenen Harness bleiben In-Distribution-Teile so, wie das Modell sie gelernt hat. Datei-Editing neu erfinden ist Zeitverschwendung.
Ohne Eval bleibt die Entscheidung Bauchgefühl. Private Evals definieren, was in Ihrem Haus gut heißt. Vergleichen Sie Accuracy, Latency und Cost, nicht nur die Trefferquote. Harbor ist ein offener Runner: Agent gegen Task-Dataset in Sandboxes, mit Unit-Tests, LLM-as-Judge oder Agent-as-Judge.
Was auf der Plattform aus Harness, Tools und Governance wird, steht auf der KI-Agenten-Plattform. Die Harness-Entwicklung ist die Money-Seite für den Bau.
Evals, Observability und das Data Flywheel
Wenn Agents scheitern, liegt es meist am Kontext, nicht am Modell. Traces zeigen, was ins Fenster kam, wie er aufgebaut wurde, welche Tools liefen. Trajectories sind die Message-Liste. Full Traces zeigen, was im Modell passiert. Ohne diese Sicht raten Sie.
Das Data Flywheel ist der eigentliche Wettbewerbsvorteil:
Agent bauen → laufen lassen → Traces sammeln → Daten kuratieren
→ Experimente → Harness, Modell oder Kontext nachziehen → wieder
Drei Hebel aus denselben Traces: Harness Engineering, Fine-Tuning, Memory. Feedback muss nicht Thumbs-up sein. Gute UX erzeugt Signale, ohne dass jemand klickt. Online-Evaluatoren (LLM-as-Judge über Traces) sind günstig, wenn ein kleines, feingetuntes Modell den teuren Opus-Judge ersetzt.
Ohne diesen Loop bleibt der Agent ein statisches Tool. Mit ihm wird die Produktionsarbeit zur Verbesserung. Das kauft kein Seat-Abo.
Was Pexon Consulting konkret macht
Wir beraten nicht „einen Agenten anlegen“. Wir entscheiden mit Ihnen bauen gegen kaufen, entwickeln den Loop, setzen Evals und Tracing auf und betreiben den Flywheel.
- Entscheidung. Wo steht der Use Case? Fertig plus Hooks, eigener Harness, oder Cognitive Architecture? Modell-Strategie: wechselbar, kein Lock-in.
- Harness. Kern-Loop, domänenspezifische Tools, Middleware, Sandbox, Sub-Agents, Memory.
- Evals. Private Tasks, Qualitätsdefinition, Vergleich auf Accuracy, Latency, Cost.
- Observability. Traces und Trajectories. Kontext-Debugging, wenn der Agent scheitert.
- Flywheel und Betrieb. Curation, Experimente, Betrieb 8×5 auf der offenen KI-Plattform. Kein Rund-um-die-Uhr-Claim.
Abgrenzung: Harness-Tiefe statt Folie. Eigentum im Kunden-Git. Evals-first. Hybrid mit Kubernetes, Private AI, Azure AI Foundry, Claude. Modelle und Keys bleiben am LiteLLM-Gateway, der Harness orchestriert.
Es gibt keinen Paketpreis in diesem Artikel. Der Einstieg ist der Plattform-Check in 45 Minuten.
Sechs ehrliche Grenzen
- Nicht zu früh bauen. In-Distribution ist fertig besser.
- Der Kontext ist meist das Problem. Observability vor Modellwechsel.
- Evals sind Pflicht. Sonst ist gut ein Gefühl.
- Finanz- und regulierte Abläufe brauchen Gates, keine freie Autonomie.
- In-Distribution-Teile nicht neu erfinden.
- Ohne Flywheel bleibt der Agent stehen, auch mit dem teuersten Modell.
Häufig gestellte Fragen
Wann sollte ich meinen eigenen Agent Harness bauen?
Wenn der Use Case weit von den Trainingsdaten der Modelle entfernt ist oder wenn Sie Vorhersehbarkeit brauchen. Für Coding und Standard-Aufgaben reichen fertige Harnesses.
Was ist der Unterschied zwischen Harness, Modell und Kontext?
Der Harness orchestriert. Das Modell ist das LLM und bleibt wechselbar. Der Kontext ist Memory, Wissen, Verlauf. Own Your Intelligence heißt, alle drei zu besitzen.
Was bringt ein Data Flywheel?
Produktions-Traces werden kuratiert und in Experimente umgesetzt. Harness, Modell oder Kontext werden besser. Ohne den Loop bleibt der Agent statisch.
Was kostet die Entwicklung?
Kein Listenpreis hier. Der Plattform-Check dauert 45 Minuten. Einen Festpreis nennt Pexon Consulting nach Scope. Betrieb ist 8×5.
Reicht ein Framework wie LangGraph?
Als Baumaterial ja. Als Produktions-Harness ohne Evals, Tracing und Betrieb nein. Frameworks sind nicht der fertige Loop mit Gates und Flywheel.
Nächster Schritt
Wenn Sie unsicher sind, ob Ihr Use Case In- oder Out-of-Distribution ist, ist der nächste Schritt keine Tool-Liste. Es ist eine Entscheidung: fertig, Hooks, oder eigener Harness.
Verwandte Themen
→KI-Agenten auf der eigenen Plattform
→Hintergrund-Agenten statt Chat-Pilot
→Offene KI-Plattform
→LiteLLM: Modelle und Keys zentral



