DevOps · Agentic Delivery

Claude Code CI/CD Integration: Reviews und Jobs in der Pipeline

Der erste Agenten-Job scheitert selten am Modell. Er scheitert an einem Lauf ohne Kostendeckel, an einem Secret, das fremder Text aus einem Pull Request erreichen kann, und an Findings, die nach drei Wochen niemand mehr liest.

Kurz gesagt

Eine Claude Code CI/CD Integration führt Claude Code als eigenen Job in GitHub Actions oder GitLab CI aus statt am Entwickler-Rechner: headless über claude -p, reproduzierbar mit --bare, maschinenlesbar über --output-format json, gedeckelt über --max-budget-usd im Print-Modus und angebunden über OIDC-Workload-Identity-Federation statt über einen statischen API-Key. Gedacht für DevOps- und Platform-Engineering-Leads mit mehreren aktiven Repositories. Laut Anthropic (2026) stieg der Anteil der Pull Requests mit substanziellem Review in Anthropics eigenen Repositories nach Einführung des automatisierten Reviews von 16 % auf 54 %. Pexon Consulting (ISO 27001 zertifiziert, 14 AI Agents in Produktion) baut diesen Job als Sechs-Wochen-Piloten auf einem Repository, mit Kostendach und Hook-Riegel in den Abnahmekriterien.

ISO 27001 zertifiziert
14 AI Agents in Produktion
30 Azure-Spezialisten
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner

Warum der erste Agenten-Job in der Pipeline aus dem Ruder läuft

Der Engpass ist selten das Modell, sondern das, was um den Job herum fehlt: keine Budgetgrenze pro Lauf, ein Secret, das fremder Text erreichen kann, und Findings, die nach drei Wochen niemand mehr liest. Laut Stack Overflow Developer Survey 2025 geben 45,2 % der Entwickler an, dass das Debuggen von KI-generiertem Code mehr Zeit kostet - genau die Fehlerklasse, die ein zweiter, unabhängiger Durchlauf im CI abfangen soll.

Ein Lauf ohne Deckel ist eine offene Rechnung
Ein Agenten-Job läuft, bis er fertig ist, nicht bis das Budget erreicht ist. Agent Teams verbrauchen im Plan-Modus rund 7-mal so viele Tokens wie eine Standard-Session, weil jeder Teammate ein eigenes Context-Window führt (Anthropic 2026). Ohne hartes Kostendach pro Lauf fällt das erst in der Abrechnung auf.
Fremder Text im selben Prozess wie Ihre Secrets
Microsoft Threat Intelligence veröffentlichte im Juni 2026 einen Prompt-Injection-Pfad in der Claude Code GitHub Action: Das Read-Tool umging das Bubblewrap-Environment-Scrubbing, /proc/self/environ war lesbar und damit der API-Key. Der Fix war zum Zeitpunkt der Veröffentlichung bereits ausgeliefert, mitigiert am 05.05.2026 mit Claude Code 2.1.128. Eine CVE-Nummer nennt der Beitrag nicht. Die Angriffsklasse bleibt.
Kommentare, die das Team nach drei Wochen wegklickt
Bei Pull Requests unter 50 geänderten Zeilen findet ein Review-Agent nur in 31 % der Fälle etwas, im Schnitt 0,5 Issues (Anthropic 2026). Ohne Severity-Kalibrierung über eine REVIEW.md landet dieser Rest als Nit-Flut im Team. Review-Fatigue kostet mehr als gar kein Review.

Was eine Claude Code CI/CD Integration messbar bringt

Die härteste Vorher-Nachher-Zahl zum Thema: Der Anteil der Pull Requests mit substanziellem Review stieg von 16 % auf 54 %. Die folgenden vier Zahlen stammen aus benannten Primärquellen, alle vier sind Herstellerangaben von Anthropic, gemessen an Anthropics eigenen Repositories mit dem Managed Code Review, und als solche zu lesen. Die einzige unabhängige Zahl auf dieser Seite ist der Debugging-Befund der Stack Overflow Developer Survey 2025 weiter oben.

16 % auf 54 % Review-Abdeckung
In Anthropics eigenen Repositories erhielten vorher 16 % der Pull Requests substanzielle Review-Kommentare, nach Einführung des automatisierten Reviews 54 %. Herstellermessung im eigenen Haus, keine Kundenstichprobe und keine unabhängige Studie. (Anthropic, „Code Review for Claude Code", 2026)
unter 1 % als falsch markierte Findings
Weniger als ein Prozent der gemeldeten Findings werden von Entwicklern als falsch markiert. Herstellermessung in Anthropics eigenen Repositories, keine unabhängige Studie - so einordnen. (Anthropic, „Code Review for Claude Code", 2026)
84 % Trefferquote bei großen Pull Requests
Bei Pull Requests über 1.000 geänderten Zeilen finden die Review-Agenten des Managed Code Review in 84 % der Fälle etwas, im Schnitt 7,5 Issues. Gemessen an Anthropics eigenen Repositories und am Managed-Produkt, nicht an einer selbstgebauten Action. Als Indiz lesen, nicht als Zusage. (Anthropic, „Code Review for Claude Code", 2026)
rund 20 Minuten pro Review-Durchlauf
Ein Managed-Code-Review-Durchlauf dauert im Schnitt etwa 20 Minuten. Er läuft auf Anthropics Infrastruktur parallel zu Ihrer Pipeline und blockiert den Build nicht; die 20 Minuten sind die Erwartung an die Rückmeldezeit, kein Job-Timeout. (Anthropic, Claude Code Docs „Code Review", 2026)

Ab wann sich ein Agenten-Job im CI lohnt

Das Eintrittskriterium ist nicht die Diff-Größe, sondern die Review-Last: wie viele Pull Requests pro Woche offen sind, welcher Anteil davon ohne substanzielles Review durchgeht und wie lange ein Autor auf einen Reviewer wartet. Dazu ein Plattform-Team von 3 bis 15 Personen, das die Pipeline danach selbst pflegt, automatisierte Tests und schnelle Rollbacks als Untergrund, und ein hartes Kostendach je Lauf über --max-budget-usd. Die Diff-Größe steuert danach nur noch, welche Läufe Sie überhaupt starten.
über 1.000
geänderte Zeilen je Pull Request: 84 % Trefferquote, im Schnitt 7,5 Findings. Messung des Managed Code Review in Anthropics eigenen Repositories, ein Indiz für Ihre Priorisierung, keine Zusage (Anthropic 2026)
unter 50
geänderte Zeilen: nur 31 % Trefferquote, 0,5 Findings im Schnitt. Solche Läufe filtern Sie über paths und Diff-Größe heraus, statt auf den Job zu verzichten (Anthropic 2026)
3 bis 15
Personen im Plattform-Team, die die Pipeline betreiben und den Job danach selbst pflegen

Vier Einsatzformen einer Claude Code CI/CD Integration

In allen vier Fällen läuft der Agent als eigener Job, nicht als Assistent am Arbeitsplatz: Pull-Request-Review in GitHub Actions, selbstgebauter Job in GitLab CI, diff-aware Sicherheits-Review und ein PreToolUse-Hook als deterministischer Riegel.

Use Case 01

Pull-Request-Review als eigener Job in GitHub Actions

Ihr Plattform-Team hängt anthropics/claude-code-action@v1 in den Pull-Request-Workflow. Mit gesetztem prompt-Input läuft die Action im Automation Mode, also ohne Mention-Trigger; das Ergebnis landet im Workflow-Run-Log statt als Kommentar. Vor jedem Start prüft die Action, ob der auslösende Nutzer Write-Access auf das Repository hat, und lehnt Bot-Actors ab, sofern sie nicht in allowed_bots stehen.

2 Modi der Action: ohne prompt-Input Interactive Mode mit Mention-Trigger, mit prompt-Input Automation Mode ohne Mention. Write-Access-Prüfung und Bot-Ablehnung laufen vor jedem Start (Anthropic, Claude Code Docs „GitHub Actions", 2026)
Use Case 02

Claude Code CI/CD Integration in selbstverwaltetem GitLab

Ein Unternehmen mit selbstverwaltetem GitLab bekommt das Managed-Produkt nicht, weil Code Review nur für GitHub verfügbar ist. Ihr Team baut den Job selbst: Installation im before_script, Aufruf über claude -p mit --allowedTools, Trigger über CI_PIPELINE_SOURCE == "merge_request_event", Kontext aus AI_FLOW_INPUT und AI_FLOW_CONTEXT.

2 dokumentierte Wege zum Modell ohne Langzeit-Secret: AWS Bedrock über GitLab-OIDC und Google Cloud über Workload Identity Federation (Anthropic, Claude Code Docs „GitLab CI/CD", 2026)
Use Case 03

Sicherheits-Review nur auf dem geänderten Diff

Ihr Security-Team hängt die Open-Source-Action anthropics/claude-code-security-review als zweiten Job ein. Sie ist diff-aware und scannt bei Pull Requests nur geänderte Dateien, kommentiert per Default im Pull Request und bricht nach 20 Minuten ab. Über exclude-directories bleiben generierte Verzeichnisse außen vor.

10 abgedeckte Schwachstellenklassen von Injection über Auth und Krypto bis Deserialisierung; DoS, Rate-Limiting und Open Redirects sind bewusst ausgefiltert (Anthropic, GitHub-Repository, 2026)
Use Case 04

Deterministischer Riegel über einen PreToolUse-Hook

Ihr Plattform-Team legt in .claude/settings.json einen PreToolUse-Hook ab, der jeden Aufruf prüft, bevor er läuft. Exit-Code 2 blockiert hart, stdout wird ignoriert, stderr geht als Fehlermeldung an Claude zurück. Derselbe Hook kann Tool-Inputs umschreiben und Testausgaben vorfiltern, sodass nur Fehlerzeilen in den Kontext gelangen: laut Anthropic von Zehntausenden Tokens auf Hunderte.

PreToolUse, Stop und SubagentStop blockieren die jeweilige Aktion. Exit-Code 2 ist der blockierende Fehler: stdout wird ignoriert, stderr geht als Fehlermeldung an Claude zurück (Anthropic, Claude Code Docs „Hooks", 2026)

Integration in Ihre Umgebung

Die Frage vor dem Piloten ist nicht, ob das Modell gut genug ist, sondern ob der Job in Ihre bestehende Pipeline passt, ohne Secrets, Reproduzierbarkeit und Budget zu gefährden. Pexon Consulting betreibt 14 AI Agents in Produktion und dockt den Job an Ihre bestehende Pipeline an. Hier steht, woran angedockt wird und mit welchen Flags.

CI-Plattform und Job-Konfiguration

GitHub Actions · offizielle Action anthropics/claude-code-action@v1. Workflow-Permissions: contents: write, pull-requests: write, issues: write, id-token: write, actions: read. CLI-Flags gehen über claude_args durch, etwa --max-turns 5.
GitLab CI · normaler Job in .gitlab-ci.yml, Installation im before_script, GitLab-API-Zugriff über CI_JOB_TOKEN oder einen maskierten Project Access Token. Ehrlich dazu: Beta-Status, gepflegt von GitLab statt von Anthropic, Support über ein GitLab-Issue.
Azure DevOps und alles andere · keine offizielle Integration. Es bleibt der generische Weg: claude -p in einem Container, ein gesetztes ANTHROPIC_API_KEY, Exit-Code 0 bei Erfolg und ungleich 0 bei Fehlschlag. Läuft überall, bringt aber keine fertige Kommentar-Integration mit.

Determinismus, Secrets und Kostendeckel

Reproduzierbare Läufe · --bare überspringt die Auto-Discovery von Hooks, Skills, Plugins, MCP-Servern, Auto-Memory und CLAUDE.md und ist laut Doku der empfohlene Modus für Skript-Aufrufe. Wichtig: --bare und ein per Auto-Discovery geladener Hook-Riegel schließen sich aus, deshalb geben wir die Hook-Konfiguration bei abgeriegelten Läufen explizit über --settings mit. Ergebnis maschinenlesbar über --output-format json, ausgewertet mit jq statt mit grep auf der Textausgabe.
Zugang ohne Langzeit-Secret · OIDC-Workload-Identity-Federation über den Token des Workflows, konfiguriert mit anthropic_federation_rule_id, anthropic_organization_id, anthropic_service_account_id und anthropic_workspace_id. Für Datenresidenz alternativ Bedrock über assume-role-with-web-identity oder Google Cloud über GCP_WORKLOAD_IDENTITY_PROVIDER. Einschränkung, die dazugehört: Im Bare-Modus liest Claude Code weder OAuth-Credentials noch den Keychain; ohne Cloud-Provider braucht der Lauf ein gesetztes ANTHROPIC_API_KEY.
Hartes Kostendach pro Lauf · --max-budget-usd begrenzt den Betrag je Lauf im Print-Modus (claude -p) inklusive Subagent-Spend und stoppt hart, ab Claude Code 2.1.217. Daneben --max-turns gegen Endlosschleifen, eine concurrency-Group und paths-Filter gegen Doppelläufe sowie --permission-mode dontAsk als Berechtigungs-Baseline. Was ein Lauf an Modellkosten verursacht, hängt an Modell und Diff-Größe und gehört nicht in diese Seite: Claude Kosten und Spend-Tracking.

Managed Code Review, offizielle Action oder eigener CLI-Aufruf

Drei Produkte teilen sich den Namen, und die Entscheidung dazwischen fällt vor der ersten Zeile YAML. Sie hängt an drei Fragen: GitHub oder nicht, Zero Data Retention oder nicht, und wer den Job danach pflegt.

  Managed Code Review Offizielle GitHub Action Eigener CLI-Aufruf
Kostenmechanik Abrechnung nach Tokenverbrauch über Usage Credits auf der Anthropic-Rechnung, separat vom Plan-Kontingent. Spend-Cap in der Console, bei Erreichen wird das Review übersprungen. Modellkosten des Laufs plus Actions-Minuten. Deckel über --max-budget-usd im Print-Modus und --max-turns. Modellkosten des Laufs plus Runner-Zeit. Gleicher Deckel, zusätzlich Modellwahl je Job.
Plattform Nur GitHub, nur Team- und Enterprise-Abos, Research Preview. GitHub Actions. Überall, wo ein Container und ein Secret laufen: GitLab CI (Beta, von GitLab gepflegt), Azure DevOps, eigener Runner.
Blockiert den Merge Nein. Der Check-Run schließt immer mit neutral und kann über Branch Protection nichts blockieren. Ein Gate baut man selbst aus der Severity-Zählung. Ja, sobald der Job in Ihrer Branch Protection als erforderlicher Check steht. Ja, über den Exit-Code des Jobs: 0 bei Erfolg, ungleich 0 bei Fehlschlag.
Zero Data Retention Nicht verfügbar für Organisationen mit aktiviertem Zero Data Retention. Möglich, Modellzugang über eigenen Vertrag oder über Bedrock beziehungsweise Google Cloud. Möglich, gleicher Weg, zusätzlich freie Wahl der Region über den Cloud-Provider.
Wer wartet Anthropic. Steuerung bei Ihnen nur über REVIEW.md im Repository-Root. Anthropic pflegt die Action, Ihr Plattform-Team den Workflow und die Berechtigungen. Vollständig Ihr Plattform-Team, inklusive Installation und Ausgabe-Parsing.

Das bauen wir im Piloten: auf GitHub die offizielle Action plus die Open-Source-Security-Review-Action, auf GitLab den eigenen CLI-Job. Managed Code Review setzen wir nur ein, wenn Sie auf GitHub sind, ein Team- oder Enterprise-Abo haben und kein Zero Data Retention fahren. Alle Angaben aus den Claude Code Docs von Anthropic, 2026.

Konfiguration zum Mitnehmen

Drei Dateien, mit denen Sie das in einem Testrepository selbst laufen lassen können, ohne mit uns zu sprechen: ein GitHub-Actions-Workflow mit OIDC statt statischem Secret, ein GitLab-CI-Job mit Kostendeckel, und ein PreToolUse-Hook, der über Exit-Code 2 hart blockiert. Modellnamen, Pfade und Budgets passen Sie an.

.github/workflows/claude-review.yml
name: claude-review

on:
  pull_request:
    types:
      - opened
      - ready_for_review
    paths:
      - "src/**"
      - "services/**"

concurrency:
  group: claude-review-${{ github.event.pull_request.number }}
  cancel-in-progress: true

jobs:
  review:
    if: github.event.pull_request.draft == false
    runs-on: ubuntu-latest
    timeout-minutes: 15
    permissions:
      contents: write
      pull-requests: write
      issues: write
      id-token: write
      actions: read
    steps:
      - uses: actions/checkout@v4
        with:
          fetch-depth: 0
      - uses: anthropics/claude-code-action@v1
        with:
          # Workload Identity Federation statt ANTHROPIC_API_KEY im Repository
          anthropic_federation_rule_id: ${{ vars.ANTHROPIC_FEDERATION_RULE_ID }}
          anthropic_organization_id: ${{ vars.ANTHROPIC_ORGANIZATION_ID }}
          anthropic_service_account_id: ${{ vars.ANTHROPIC_SERVICE_ACCOUNT_ID }}
          anthropic_workspace_id: ${{ vars.ANTHROPIC_WORKSPACE_ID }}
          # gesetzter prompt-Input = Automation Mode, kein Mention-Trigger
          prompt: "Prüfe den Diff dieses Pull Requests. Melde nur Fehler mit Datei- und Zeilenangabe."
          claude_args: "--max-turns 5 --model claude-sonnet-5 --permission-mode dontAsk"
.gitlab-ci.yml
claude-review:
  stage: test
  image: node:22
  rules:
    - if: $CI_PIPELINE_SOURCE == "merge_request_event"
  before_script:
    - curl -fsSL https://claude.ai/install.sh | bash
    - export PATH="$HOME/.local/bin:$PATH"
  script:
    - |
      claude -p "$AI_FLOW_INPUT" 
        --bare 
        --settings .claude/ci-settings.json 
        --output-format json 
        --max-budget-usd 5.00 
        --max-turns 5 
        --permission-mode acceptEdits 
        --allowedTools "Bash Read Edit Write mcp__gitlab" 
        > claude-result.json
    - jq -r '.result' claude-result.json
    - jq -r '.total_cost_usd' claude-result.json   # clientseitige Schätzung, keine Rechnung
  artifacts:
    when: always
    paths:
      - claude-result.json
.claude/ci-settings.json und .claude/guard.sh
{
  "hooks": {
    "PreToolUse": [
      {
        "matcher": "Bash",
        "hooks": [
          {
            "type": "command",
            "command": ".claude/guard.sh",
            "timeout": 600
          }
        ]
      }
    ]
  }
}

#!/usr/bin/env bash
# stdin trägt den Tool-Aufruf als JSON.
# Exit 2 = harter Block: stdout wird ignoriert, stderr geht an Claude zurück.
# Jeder andere Exit-Code lässt die Aktion weiterlaufen.
cmd=$(jq -r '.tool_input.command // empty')

case "$cmd" in
  *"git push"*|*"rm -rf"*|*"kubectl"*|*"terraform apply"*)
    echo "Von der CI-Policy blockiert: $cmd" >&2
    exit 2
    ;;
esac

exit 0

Zwei Fallstricke, die in keinem der Beispiele aus der Suche stehen: Das Leerzeichen in Bash(git diff *) ist bedeutungstragend, ohne es erfasst die Regel auch git diff-index. Und --bare schaltet die Hook-Auto-Discovery ab, deshalb kommt die Hook-Datei im GitLab-Job über --settings explizit mit.

Wie der Agenten-Job in Ihrer Pipeline funktioniert

Sechs Schritte, und keiner davon ist Prompt Engineering: Trigger, Zugang ohne statisches Secret, Berechtigungs-Baseline, Kostendeckel, Hook-Riegel, Auswertung.

1
Trigger festlegen
Wir legen fest, was den Job auslöst: einmal nach dem Öffnen des Pull Requests statt bei jedem Push, paths-Filter auf die relevanten Verzeichnisse, Draft-PRs ausgeschlossen, eine concurrency-Group gegen parallele Doppelläufe. Bot-Actors bleiben draußen, sofern sie nicht in allowed_bots stehen.
2
Zugang ohne statisches Secret einrichten
Statt eines Langzeit-Keys im Repository richten wir Workload Identity Federation über den OIDC-Token des Workflows ein, dafür braucht der Job id-token: write. Wo Datenresidenz gefordert ist, läuft das Modell über AWS Bedrock oder Google Cloud, ebenfalls per OIDC ohne statische Cloud-Credentials.
3
Den Lauf abriegeln
--permission-mode dontAsk als Baseline, --allowedTools als Positivliste mit Prefix-Regeln. Das Leerzeichen in Bash(git diff *) ist bedeutungstragend: ohne es würde die Regel auch git diff-index erfassen. --disallowedTools entfernt ein Tool ganz oder nur für passende Aufrufe.
4
Kostendach und Determinismus setzen
--max-budget-usd deckelt den Lauf im Print-Modus inklusive Subagent-Spend; ist das Limit erreicht, schlägt das Spawnen weiterer Subagents fehl und laufende Background-Subagents werden beendet. Dazu --max-turns. Wo der Lauf auf jeder Maschine gleich sein muss, kommt --bare dazu; dann ist auch die Hook-Auto-Discovery aus, deshalb übergeben wir die Hook-Datei im selben Aufruf über --settings.
5
Hooks als deterministischen Riegel einziehen
Konfiguriert in .claude/settings.json, organisationsweit über Managed Policy Settings, im Bare-Modus explizit über --settings übergeben. PreToolUse blockiert mit Exit-Code 2 hart und modellunabhängig, Stop und SubagentStop ebenso. Default-Timeout 600 Sekunden für Command-Handler. Derselbe Hook kann Tool-Inputs vor dem Ausführen umschreiben.
6
Ergebnis auswerten und Severity kalibrieren
Der JSON-Output liefert result, session_id und total_cost_usd - letzteres ist eine clientseitige Schätzung, keine Rechnungsgröße. Eine REVIEW.md im Repository-Root steuert Nit-Cap und Skip-Pfade und wird wörtlich in den System-Prompt jedes Review-Agenten injiziert.
Hooks, Skills und MCP: wie Claude-Code-Workflows deterministisch werden

Warum Pexon statt Inhouse-Entwicklung

Ein erfahrener Senior baut den ersten Workflow in wenigen Tagen. Der Unterschied liegt nicht im Bauen, sondern in dem, was danach kommt: Threat-Model, Kalibrierungswochen und ein Kostendeckel, der in den Abnahmekriterien steht.

Inhouse aufbauen
Trigger-Kontrolle, OIDC-Federation und Hook-Semantik werden neben dem laufenden Betrieb erarbeitet. Machbar, kostet aber Kalenderzeit im Plattform-Team.
Den Microsoft-Befund vom Juni 2026 zu Prompt Injection in der GitHub Action findet nur, wer gezielt nach Threat Intelligence sucht.
Die Kalibrierung der REVIEW.md ist Fleißarbeit über Wochen. Ohne sie kippt das Team nach kurzer Zeit ins Ignorieren.
Generalisten-Beratung
Kennt CI/CD, aber nicht die Flag-Semantik: dass --bare die Auto-Discovery abschaltet oder dass das Leerzeichen in Bash(git diff *) bedeutungstragend ist.
Liefert Workflow-YAML, aber kein Threat-Model für den Fall, dass fremder Text aus einem Pull Request in den Kontext des Agenten gelangt.
Liefert eine Konfiguration, aber selten ein Abnahmekriterium, an dem Sie den Kostendeckel und den Hook-Riegel nachprüfen können.
Mit Pexon Consulting
14 AI Agents in Produktion: Wir betreiben Agenten selbst, nicht nur als Demo im Workshop.
ISO 27001 zertifiziert, 30 Azure-Spezialisten im Haus: Der Security-Review Ihres CISO bekommt Antworten zu OIDC, Trust Boundary und Fork-Policy von Leuten, die Cloud-Identitäten täglich konfigurieren.
Kostendach, Berechtigungs-Baseline und Hook-Riegel sind Teil der Abnahme, nicht ein Nachtrag nach dem Go-live.

Sechs Wochen, ein Repository, vier Phasen

Am Ende steht eine Baseline auf drei Kennzahlen und eine Entscheidung, kein Rollout-Plan.

1
Woche 1
Bestandsaufnahme und Trust Boundary
Wir sehen uns Trigger, Runner, Secrets und Fork-Policy an. Ergebnis: eine Trust-Boundary-Skizze plus die Entscheidung zwischen Managed Code Review, eigener Action und reinem CLI-Aufruf.
2
Woche 2 bis 3
Job bauen und abriegeln
Workflow oder GitLab-Job, OIDC-Federation statt statischem Key, Berechtigungs-Baseline, Positivliste der erlaubten Tools, Budget- und Turn-Deckel, PreToolUse-Hook mit Exit-Code 2.
3
Woche 4 bis 5
Kalibrieren auf echten Pull Requests
REVIEW.md mit Nit-Cap und Skip-Pfaden, Effort-Level nach unten, bis das Verhältnis von Important zu Nit stimmt. Gemessen wird der Anteil der Kommentare, den ein Entwickler durch eine Änderung auflöst.
4
Woche 6
Übergabe mit Messpunkt
Runbook, Reusable Workflow für weitere Repositories und eine Baseline auf drei Kennzahlen: Anteil substanziell reviewter Pull Requests, Change Failure Rate und Mean Time to Restore, Kosten je gemergtem Pull Request in EUR.

Pilot zum Festpreis

Pexon Consulting liefert einen abgegrenzten Piloten auf einem Repository, das Ihnen wichtig genug ist, um daran zu entscheiden: vom ersten Trigger bis zum abgeriegelten Job mit Kostendach, in sechs Wochen, mit ISO-27001-Zertifizierung im Rücken. Am Ende steht ein Abbruchkriterium, kein Rollout.

Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner
Ihre Investition
ab 14.000 EUR
6 Wochen · ein Repository · zzgl. MwSt. · Endpreis nach Scoping
Enthält:
Enthalten · ein Repository, ein Review-Job plus ein Sicherheits-Job, Trigger- und Concurrency-Regeln, OIDC-Federation statt statischem Secret, Budget- und Turn-Deckel, ein PreToolUse-Hook mit Exit-Code 2, REVIEW.md-Kalibrierung auf echten Pull Requests, Runbook und Reusable Workflow.
Nicht enthalten · der Umbau Ihrer Pipeline selbst, Lizenzbeschaffung und Nutzerverwaltung, das Ausrollen auf weitere Repositories sowie die laufenden Modellkosten. Drei Faktoren verschieben den Zuschnitt nach oben: eine zweite CI-Plattform parallel, ein Monorepo mit mehreren Sprachen, und eine eigene GitHub App statt der offiziellen, wenn Ihr Security-Team deren Permission-Set nicht akzeptiert.
Abnahme · der Job läuft auf drei echten Pull Requests durch, bricht bei erreichtem Budget-Limit sauber ab, verweigert einen nicht erlaubten Aufruf per Exit-Code 2, und die Baseline auf den drei Kennzahlen ist dokumentiert. Erfüllt er das nicht, ist der Pilot nicht abgenommen und wir bessern ohne Zusatzkosten nach.
Jetzt Kontakt aufnehmen
Kostenfrei und unverbindlich

Was Sie stellen

Ehrlich addiert und nicht nur eine Ansprechperson: eine Person aus dem Plattform-Team mit rund einem Tag pro Woche über sechs Wochen, ein Engineer für Runner und Berechtigungen an zwei Tagen, Ihr CISO oder Security-Lead für einen Review-Termin, drei bis fünf Entwickler mit je einer Stunde Feedback in Woche 4 und 5, und ein Termin mit dem Einkauf. Dazu eine Entscheidung zur Fork-Policy und die Installation der GitHub App, deren Permission-Set sich nicht teilweise akzeptieren lässt.

Wenn etwas schiefgeht

Nachbesserung bis zur Abnahme ohne Zusatzkosten. Der Zugang läuft über einen dedizierten Account statt über persönliche Token und endet mit der Abnahme. Ein Auftragsverarbeitungsvertrag liegt vor dem ersten Repository-Zugriff unterschrieben vor. Greift ein von uns konfigurierter Kostendeckel nicht, ist das ein Mangel unserer Konfiguration und kein Betriebsrisiko, das bei Ihnen bleibt.

Nach dem Piloten

Das zweite bis fünfte Repository hängt Ihr Team selbst über den Reusable Workflow an, ohne weitere Beratungsleistung. Danach entscheidet der Zuschnitt, ob ein Betriebs-Check je Quartal sinnvoll ist. Wiederkehrender Aufwand bei Ihnen: Kalibrierung der REVIEW.md, wenn sich Team oder Codebasis ändern, und ein Blick auf die Action-Version, wenn Anthropic einen Major-Sprung veröffentlicht. Die laufenden Modellkosten liegen bei Ihnen.

Häufige Fragen

Wir haben schon SonarQube und Semgrep. Was fehlt uns?
Statische Analyse findet Muster, der Agent findet Absichtsfehler im Kontext des Repositories. Die Größenverteilung zeigt den Unterschied: 84 % Trefferquote bei Pull Requests über 1.000 geänderten Zeilen, aber nur 31 % bei Diffs unter 50 Zeilen (Anthropic 2026, gemessen am Managed Code Review in Anthropics eigenen Repositories). Ein Linter verhält sich genau umgekehrt. Läuft bei Ihnen bereits ein zweites Agenten-Review, entscheidet die REVIEW.md, wer welche Fehlerklasse meldet; Formatierung und Lint gehören dort abgeschaltet.
Kann ein bösartiger Pull Request über den Agenten an unsere Secrets kommen?
Das war real. Bis Claude Code 2.1.128 umging das Read-Tool das Bubblewrap-Environment-Scrubbing, der API-Key war über Prompt Injection aus einem GitHub-Issue auslesbar. Microsoft Threat Intelligence veröffentlichte den Fall im Juni 2026, der Fix war zu diesem Zeitpunkt bereits ausgeliefert, mitigiert am 05.05.2026. Eine CVE-Nummer nennt der Beitrag nicht, die Angriffsklasse bleibt. Deshalb: OIDC statt statischem Secret, kein pull_request_target mit Fork-Head-Checkout, PreToolUse-Hook mit Exit-Code 2 als modellunabhängiger Riegel.
Was kostet der Pilot, und wie deckeln wir die Laufzeit je Job?
Der Pilot startet bei 14.000 EUR zzgl. MwSt. für ein Repository und sechs Wochen, Endpreis nach Scoping. Die Laufzeit deckeln Sie pro Job: --max-budget-usd stoppt hart und zählt Subagent-Spend mit, im Print-Modus und ab Claude Code 2.1.217. Dazu --max-turns gegen Endlosschleifen sowie eine concurrency-Group und paths-Filter gegen Doppelläufe. Was ein einzelner Lauf an Modellkosten verursacht, hängt an Modell und Diff-Größe und steht nicht in diesem Angebot: Claude Code Kosten: die 2.500-Euro-Rechnung.
Wer haftet, wenn der Agent einen Fehler durchwinkt?
Niemand mergt auf Zuruf des Agenten. Managed Code Review, also das von Anthropic betriebene Review-Produkt für GitHub, schließt seinen Check-Run immer mit dem Status neutral und kann über Branch Protection nichts blockieren (Anthropic 2026). Das menschliche Review bleibt der Freigabepunkt, der Agent erhöht nur die Abdeckung; weniger als 1 % der gemeldeten Findings markieren Entwickler als falsch, das ist eine Herstellermessung in Anthropics eigenen Repositories. Ein hartes Gate bauen wir bei Bedarf selbst aus der Severity-Zählung des Check-Runs. Für den Piloten gilt: Erfüllt der Job die Abnahmekriterien nicht, bessern wir ohne Zusatzkosten nach.
Wann sollten wir eine Claude Code CI/CD Integration nicht einführen?
Wenn automatisierte Tests und schnelle Rollbacks fehlen. DORA 2025 findet weiterhin eine negative Beziehung zwischen KI-Adoption und Delivery-Stabilität und beschreibt KI als Verstärker vorhandener Stärken und Schwächen. Eine Effektstärke nennen wir nicht, weil wir sie nicht belegen können. Zweiter Fall: Wenn Ihre Pull Requests durchweg unter 50 geänderte Zeilen umfassen und Sie kleine Läufe nicht ausfiltern wollen, findet der Agent dort nur in 31 % der Fälle etwas, im Schnitt 0,5 Issues (Anthropic 2026). Eigene Projekt-Kennzahlen aus Kundenprojekten veröffentlichen wir nicht; im Erstgespräch zeigen wir stattdessen zwei Läufe aus unserer eigenen Pipeline im Original, inklusive Kosten-JSON.
Was brauchen Sie von uns, und was passiert nach dem Piloten?
Von Ihnen: eine Person aus dem Plattform-Team mit rund einem Tag pro Woche über sechs Wochen, ein Engineer an zwei Tagen für Runner und Berechtigungen, ein Review-Termin mit Ihrem CISO, drei bis fünf Entwickler mit je einer Stunde Feedback in Woche 4 und 5, Repository-Zugang und eine Entscheidung zur Fork-Policy. Danach läuft Ihre Claude Code CI/CD Integration ohne uns weiter: Repository 2 bis 5 hängen Sie selbst über den Reusable Workflow an, die Kalibrierung der REVIEW.md bleibt eine wiederkehrende Aufgabe, die laufenden Modellkosten liegen bei Ihnen.

Bringen Sie Ihre Workflow-Datei mit, nicht Ihre Folien

Der Workflow, der GitLab-Job und die Hook-Konfiguration stehen weiter oben auf dieser Seite, zum Mitnehmen ohne Gespräch. Wenn Sie danach reden wollen: Im Erstgespräch gehen wir Trigger, Secrets und Kostendeckel an Ihrem konkreten Repository durch, nicht an einem Beispiel, und wir zeigen zwei Läufe aus unserer eigenen Pipeline im Original inklusive Kosten-JSON. 30 Minuten reichen, um zu entscheiden, ob ein Pilot sinnvoll ist oder ob zuerst Tests und Rollbacks dran sind.

Jetzt Kontakt aufnehmen

Nachricht senden

Kein passender Termin? Schreiben Sie uns, wir melden uns innerhalb von 24 Stunden.

Antwort innerhalb von 24 Stunden
Unverbindliches Erstgespräch
Persönlicher Ansprechpartner
Phillip Pham
Phillip Pham
CEO @ Pexon Consulting
Aktualisiert am 11. August 2026

Sie suchen einen Partner für Ihr Projekt?

Wir analysieren Ihren individuellen Bedarf, geben erste Empfehlungen zu Umsetzungsstrategien und bieten Ihnen transparente Einblicke in unsere Methoden, Technologien und Referenzen.

Vertrieb kontaktieren
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner
400+Projekte seit 2020
100+Kunden im DACH-Raum
ISO27001 zertifiziert
3Hyperscaler Partner