Offene KI-Plattform · Harness-Entwicklung

Eigenen Agent Harness bauen, nicht mieten

Kurz gesagt

Wann lohnt sich ein eigener Agent Harness? Wenn Ihr Use Case weit von dem entfernt ist, worauf die Modelle trainiert sind: Branchen-Domäne, Legal, Finance, Healthcare, proprietäre Prozesse. Für Coding, Dateien und generische Aufgaben reichen Claude Code oder Codex. Pexon Consulting baut den Harness modell-agnostisch, mit Middleware, Evals und Data Flywheel. Der Plattform-Check in 45 Minuten klärt bauen gegen kaufen. 80 Mitarbeitende in Deutschland, Microsoft Partner, ISO 27001.

Microsoft Partner
ISO 27001 zertifiziert
80 MA in Deutschland
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner

Warum der fertige Harness auf Fachprozesse nicht reicht

Claude Code und Codex sind exzellent, wo Modelle trainiert wurden: Code, Dateien, generische Aufgaben. Auf Legal-, Finance- und Branchen-Workflows bricht der fertige Loop. Die Entscheidungsregel steht im wann sich der eigene Harness lohnt. Pexon Consulting misst das an Evals, nicht am Bauchgefühl.

In-Distribution selbst bauen
Wer für Coding einen eigenen Harness schreibt, zahlt Wartung für etwas, das Anthropic und OpenAI bereits pflegen. Die Modelle können Datei-Editing. Neu erfinden verschwendet den Sprint.
Out-of-Distribution ohne Schicht
Fachprozesse, Regulierung und proprietäre Tools liegen außerhalb der Trainingsverteilung. Ohne Middleware, Gates und private Evals bleibt der Agent eine Demo. Hintergrund-Agenten trennt Chat von unbeaufsichtigtem Lauf.
Kein Flywheel, kein Vorteil
Ohne Traces, Curation und Experimente bleibt der Agent statisch. Der Wettbewerbsvorteil sitzt nicht im Modellwechsel, sondern darin, dass Produktionsdaten Harness, Modell und Kontext verbessern.

Vier Hebel: Eigentum, Hooks, Evals, Flywheel

Vier Hebel, damit der eigene Harness kein Selbstzweck wird: Entscheidung, Middleware, Evals, Flywheel.

3 Teile, die Ihnen gehören
Agent gleich Harness plus Modell plus Kontext. Own Your Intelligence heißt: alle drei selbst besitzen, das Modell bleibt wechselbar. (LangChain Sequoia-Talk, Own Your Intelligence, 2026)
Hooks Kern-Loop bleibt simpel
Pre- und Post-Modell-Calls, Tool-Wrapping, Summarization, Context Offloading. Die Schleife bleibt. Die Domäne kommt als Baustein. (Middleware-Muster, Deep Agents und Claude Code Hooks)
Evals gut ist messbar
Private Benchmarks auf Accuracy, Latency und Cost. Ohne Eval ist bauen gegen kaufen Bauchgefühl. Harbor und eigene Tasks. (Harbor, Terminal-Bench 2, firmeneigene Tasks)
8x5 Betrieb der App-Schicht
Pexon betreibt die Schicht in der Servicezeit. Betrieb 8x5 ist 8x5, kein Rund-um-die-Uhr-Claim. Microsoft Partner, ISO 27001. (Pexon Betriebsmodell, MEZ)

Ab wann sich ein eigener Agent Harness lohnt

Ein eigener Agent Harness lohnt sich, sobald der Use Case Out-of-Distribution ist: die Aufgabe liegt außerhalb dessen, worauf Claude, GPT oder Open-Weight-Modelle trainiert wurden. Die Schwelle liegt bei Kontrolle, Vorhersehbarkeit und Modell-Wechsel, nicht bei einem zweiten Chatfenster. In-Distribution-Teile wie Datei-Editing bleiben beim fertigen Harness. Was die Schicht ist, steht im Artikel was ein Agent Harness ist. Was Chat von Harness trennt, steht auf der KI-Agenten-Plattform. Die offene KI-Plattform ist der Cluster. Pexon Consulting, 80 MA in Deutschland, Microsoft Partner, ISO 27001. Betrieb 8x5. Stand 1. September 2026.
OOD
Use Case außerhalb der Trainingsverteilung
Kontrolle
Regulierung braucht Gates, keinen freien Agenten
Wechsel
Modell-agnostisch, kein Lock-in

Wo fertig reicht und wo der eigene Harness beginnt

Use Case 01

Legal: Schriftsatz-Rohling, Versand mit Gate

Der Loop darf recherchieren. Der Versand an Gericht oder Mandant wartet auf Freigabe. Das ist Cognitive Architecture, kein Chat.

Gate vor dem Ausgang, nicht danach
Use Case 02

Finance: kontrollierbarer Ablauf statt Autonomie

Buchung, Freigabe, Audit in fester Reihenfolge. Ein freier Agent ist hier das Risiko. Der Harness erzwingt die Schritte.

Vorhersehbarkeit vor Autonomie
Use Case 03

Coding-Team: fertigen Harness lassen

Claude Code oder Codex für Dateien und Tests. Pexon hängt nur Hooks an, wo das Repo Regeln braucht. Kein zweiter Loop für denselben Job.

Fertig plus Hooks, kein Neubau
Use Case 04

IT: Gateway und Keys bleiben Canonical

Modelle, Keys und Spend sitzen am LiteLLM-Gateway. Der Harness orchestriert. Er ersetzt das Gateway nicht.

Eine Schicht Orchestrierung, ein Gateway

Was fertig bleibt, und was Pexon baut

Claude Code und Codex bleiben für In-Distribution. Pexon baut den Loop dort, wo die Domäne außerhalb der Trainingsverteilung liegt. Multi-Agent-Systeme orchestrieren wir in Python: Routing, Delegation, Kommunikation. Framework ist LangGraph oder Pydantic AI als vergleichbar. Modelle laufen OpenAI-kompatibel über LiteLLM, Container auf Kubernetes, Prompt Engineering im Git, Betrieb 8x5. Die KI-Agenten-Plattform trennt Chat von Harness. wann sich der eigene Harness lohnt trägt die Entscheidungsregel.

Ja, wenn der Chat-Pilot steht und der nächste Schritt Fachprozesse oder Regulierung ist. Copilot und Claude Code bleiben, wo sie In-Distribution sind. Die offene KI-Plattform trägt Chat, Gateway und Betrieb.

Was fertig bleibt

Coding · Claude Code, Codex, Deep Agents. Datei-Editing nicht neu erfinden.
Office · Copilot bleibt in Microsoft 365. Der Harness ist nicht der zweite Chat.
Gateway · Modelle und Keys am LiteLLM-Gateway. Der Harness ruft, er hostet nicht.

Was Pexon baut

Loop und Middleware · Kern-Loop, Hooks, Tool-Wrapping, Sub-Agents, Memory, Sandbox.
Evals und Traces · Private Benchmarks, Observability, Kontext-Debugging statt Modell-Schuld.
Eigentum · Code im Kunden-Repo. Unabhängigkeit macht den Exit messbar.

Loop, Middleware, Evals, Flywheel: so besitzen Sie den Harness

1
Entscheidung zuerst
In-Distribution fertig lassen. Leicht OOD: Hooks. Stark OOD oder Regulierung: eigener Harness. Ohne Eval keine Entscheidung.
2
Kern-Loop, dann Bausteine
LLM in der Schleife, Tools, Beobachtung zurück. Sandbox, Dateisystem, Sub-Agents, Memory kommen als Middleware, nicht als neues Framework.
3
Private Evals
Was gut heißt, definieren Sie. Accuracy, Latency, Cost. Hill-Climbing auf dem eigenen Task-Set, nicht auf einem öffentlichen Leaderboard.
4
Observability
Wenn Agents scheitern, liegt es meist am Kontext, nicht am Modell. Traces und Trajectories zeigen, was ins Fenster kam und welches Tool lief.
5
Data Flywheel
Laufen, Traces kuratieren, Experimente, Harness oder Kontext nachziehen. Ohne diesen Loop bleibt der Agent ein statisches Tool.
6
Betrieb auf der Plattform
Das Plattform-Setup hängt die Schicht parallel. Betrieb 8x5 ist 8x5. Kubernetes und Kosten sitzen daneben, nicht in der Headline.
KI-Agenten-Plattform

Fertig, nur Framework oder eigener Harness

Fertiger Harness
-Schnell, gepflegt, an ein Modell-Ökosystem gebunden
-Passt für Coding und generische Aufgaben
-Passt, wenn der Use Case In-Distribution ist
Nur Framework
-LangGraph oder Pydantic AI (vergleichbar) ohne Evals, ohne Betrieb, ohne Flywheel
-Demo in Wochen, Stillstand in Monaten
-Passt für einen Prototyp, nicht für Produktion
Mit Pexon
Eigener Harness, modell-agnostisch, Code im Kunden-Git
Middleware, private Evals, Traces, Data Flywheel, Betrieb 8x5
Pexon Consulting, Microsoft Partner, ISO 27001, Check 45 Min

Wie die Harness-Entwicklung in fünf Blöcken läuft

1
45 Min
Plattform-Check
In- oder Out-of-Distribution. Fertig plus Hooks, eigener Harness oder Cognitive Architecture. Kein Paketpreis.
2
Loop
Harness-Entwicklung
Kern-Loop, Tool-Landschaft, Middleware, Sub-Agents, Memory. Modell-agnostisch aufsetzen.
3
messen
Evals und Observability
Private Tasks, Harbor oder eigener Runner. Traces, Trajectories, Kontext-Debugging.
4
drehen
Flywheel und Betrieb
Traces zu Experimenten. Betrieb 8x5 8x5. Kein Rund-um-die-Uhr-Claim.

Fertig, Framework oder eigener Harness

Drei Wege. Fertig reicht In-Distribution. Ein Framework ohne Evals bleibt Demo. Der eigene Harness gehört Ihnen, modell-agnostisch, mit Flywheel. Die Zeile Passt, wenn widerspricht der Mutter nicht.

KriteriumFertiger HarnessNur FrameworkEigener Harness (Pexon)
Use CaseCoding, Dateien, generischBeliebig, ohne MesslatteOut-of-Distribution oder Regulierung
EigentumLoop beim HerstellerCode bei Ihnen, Betrieb offenHarness, Modell-Wechsel, Kontext bei Ihnen
CustomisierungHooks, soweit der Vendor sie öffnetAlles selbst, ohne MusterMiddleware im Kern-Loop, Gates wo nötig
QualitätVendor-BenchmarksBauchgefühlPrivate Evals, Accuracy, Latency, Cost
DanachFeature-RequestStillstand nach dem SprintData Flywheel, Betrieb 8x5
Passt, wennDer Job ist In-DistributionNur ein Prototyp zähltDomäne, Kontrolle oder Modell-Wechsel zählen

Plattform-Check ohne öffentlichen Paketpreis

Der Plattform-Check dauert 45 Minuten und klärt bauen gegen kaufen. Pexon nennt Setup, Betrieb und Check namentlich, ohne öffentliche Euro-Liste.

Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner
Ihre Investition
nach Scope 45 Min
kein Paketpreis · nach Scope
Enthält:

Check · 45 Minuten: wo fertig reicht, wo eigener Harness, welche Evals.

Lieferung · Loop, Middleware, Evals, Traces. Code und IP im Kunden-Repo.

Nicht enthalten · Kein Seat-Abo, kein Rund-um-die-Uhr-Support, keine öffentlichen Paketpreise, kein zweiter Coding-Harness für In-Distribution-Aufgaben.
Plattform-Check buchen (45 Min)
Plattform-Check, 45 Minuten, ohne Verpflichtung

Häufige Fragen zum eigenen Agent Harness

Wann lohnt sich ein eigener Agent Harness?

Wenn Ihr Use Case weit von dem entfernt ist, worauf die Modelle trainiert sind: Branchen-Domäne, Legal, Finance, Healthcare, proprietäre Prozesse. Oder wenn Regulierung Vorhersehbarkeit verlangt. Für Coding und Dateien reichen Claude Code oder Codex. Der Plattform-Check klärt die Lage in 45 Minuten.
Was ist der Unterschied zwischen Harness, Modell und Kontext?

Der Harness orchestriert und bringt Kontext zum richtigen Zeitpunkt zum Modell. Das Modell ist das LLM und bleibt wechselbar. Der Kontext ist Memory, Wissen und Verlauf. Ausführlich im Artikel was ein Agent Harness ist.
Was kostet die Entwicklung eines eigenen Agent Harness?

Es gibt keinen Paketpreis auf dieser Seite. Der Einstieg ist der Plattform-Check in 45 Minuten. Einen Festpreis nennt Pexon Consulting nach Scope, wenn Use Case, Evals und Abnahme festliegen. Betrieb ist 8x5.
Warum eine eigene URL neben der Agenten-Plattform?

Eine Frage, eine URL. Die Agenten-Plattform beantwortet Harness gegen Chat. Diese URL beantwortet bauen gegen kaufen und die fünf Phasen. Kein zweiter Agenten-Hub, kein nacktes Segment agenten.
Wo passt ein eigener Agent Harness nicht?

Wenn der Use Case In-Distribution ist: Coding, Dateien, generische Aufgaben. Dann fertigen Harness nutzen. Wenn niemand Evals und Betrieb tragen will, bleibt es ein Prototyp. Kein Rund-um-die-Uhr-Support.
Was bringt ein Data Flywheel?

Produktions-Traces werden kuratiert und in Experimente umgesetzt. Harness, Modell oder Kontext werden besser. Ohne diesen Loop bleibt der Agent ein statisches Tool, unabhängig vom Modell.

Plattform-Check buchen (45 Min)

Der Chat-Pilot steht, der Fachprozess nicht. 45 Minuten: bauen, hooks oder fertig lassen.

Plattform-Check buchen (45 Min)

Nachricht senden

Kein passender Termin? Schreiben Sie uns, wir melden uns innerhalb von 24 Stunden.

Antwort innerhalb von 24 Stunden
Unverbindliches Erstgespräch
Persönlicher Ansprechpartner
Phillip Pham
Phillip Pham
CEO @ Pexon Consulting
Aktualisiert am 1. September 2026

Sie suchen einen Partner für Ihr Projekt?

Wir analysieren Ihren individuellen Bedarf, geben erste Empfehlungen zu Umsetzungsstrategien und bieten Ihnen transparente Einblicke in unsere Methoden, Technologien und Referenzen.

Vertrieb kontaktieren
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner
400+Projekte seit 2020
100+Kunden im DACH-Raum
ISO27001 zertifiziert
3Hyperscaler Partner