Pexon Consulting | 9 Min. Lesezeit | 10.07.2026
TL;DR
KI-Kosten Modellwahl heißt: jede Anfrage an das kleinste Modell schicken, das sie noch sauber löst, statt jede Anfrage teuer an ein Top-Modell. Pexon Consulting (80 Mitarbeiter, Deutschland, Microsoft Partner) baut das Routing als Betriebs-Schicht. Teams sparen so 40 bis 70 Prozent LLM-Kosten bei gleicher Antwortqualität.
Warum die Modellwahl der größte Kostenhebel ist
Die kurze Antwort: weil der Preisunterschied zwischen klein und groß bei Faktor 5 bis 25 liegt, die Qualitätsdifferenz bei den meisten Aufgaben aber nur bei wenigen Prozentpunkten. Wer jede Anfrage an das teuerste Modell schickt, zahlt Frontier-Preise für Arbeit, die ein Klein-Modell genauso erledigt.
Ein Blick auf die Zahlen macht das konkret. Enterprise-Ausgaben für Modell-APIs lagen 2025 bei über 8,4 Milliarden US-Dollar, und knapp 40 Prozent der Unternehmen geben inzwischen mehr als 250.000 US-Dollar pro Jahr für Sprachmodelle aus (Quelle: Orq.ai Router, 2026). Bei dieser Größenordnung ist eine 50-Prozent-Reduktion kein Optimierungs-Detail, sondern 125.000 US-Dollar im Jahr.
Wir sehen bei unseren Kunden denselben Fehler immer wieder: ein einzelnes gutes Modell wird als Default hart verdrahtet, und dann läuft die Zusammenfassung einer zweizeiligen E-Mail über dasselbe Modell wie die Analyse eines 40-seitigen Vertrags. Das ist Geldverschwendung. Die Modellwahl gehört nicht in den Code als Konstante, sondern zur Laufzeit entschieden, pro Anfrage.
Was klein und groß 2026 konkret kosten
Preise pro einer Million Token, jeweils Input und Output. Die Anthropic-Werte stammen aus der offiziellen Anthropic-Doku (Stand 2026-06-04), die OpenAI- und Google-Werte aus den jeweiligen Preis-Updates (Stand Juli 2026). Preise pro Anbieter verstehen sich als Grundpreis ohne Data-Residency-Aufschläge.
Die Spreizung ist der Punkt. Zwischen Gemini 3 Flash (0,50 USD Input) und Claude Opus 4.8 (5,00 USD Input) liegt Faktor 10, beim Output zwischen Haiku (5,00 USD) und Opus (25,00 USD) Faktor 5. GPT-5.1 wurde am 13.11.2025 veröffentlicht und bleibt mit 1,25 USD Input eine günstige Mitte für Standard-Chat.
Unsere klare Empfehlung: mische Anbieter. Es gibt keinen Grund, aus Bequemlichkeit alles bei einem Provider zu lassen, wenn Gemini 3 Flash die Klassifikation zum halben Haiku-Preis macht und Sonnet 4.6 die agentischen Abläufe besser hält.
Klein-Modell-First: die Regel und ihre Ausnahmen
Die Regel lautet: Standard ist das kleinste Modell, das die Aufgabe noch besteht. Ein großes Modell ist die Ausnahme, die begründet werden muss, nicht der Default, den man aus Vorsicht setzt.
Das funktioniert, weil sich Aufgaben in drei grobe Komplexitätsstufen sortieren lassen:
- Deterministische, enge Tasks (Klassifikation, Extraktion, Tagging, Sprach-Erkennung): Klein-Modell. Haiku 4.5 oder Gemini 3 Flash. Hier gewinnt ein großes Modell praktisch nichts.
- Mittlere Reasoning-Tasks (RAG-Antworten, Tool-Use, mehrstufige Abläufe): Mittel-Modell. Sonnet 4.6 oder GPT-5.1. Klein-Modelle brechen hier bei längeren Ketten weg.
- Harte Analyse und lange Ketten (juristische Bewertung, komplexe Verträge, autonome Agenten über viele Schritte): Groß-Modell. Opus 4.8. Hier zahlt sich die Intelligenz aus.
Die Ausnahme von Klein-First betrifft alles, wo ein Fehler teuer ist und schlecht rückgängig zu machen. Bei einer Vertrags-Klausel-Prüfung im regulierten Umfeld raten wir davon ab, aus Kostengründen auf das kleinste Modell zu gehen. Da ist die Fehler-Toleranz null, und ein falsch klassifiziertes Datum kostet mehr als die gesamte Modell-Ersparnis.
Routing in Code: welches Modell für welche Aufgabe
Damit die Modellwahl nicht Bauchgefühl bleibt, gehört sie in eine Routing-Funktion, die pro Anfrage anhand der Task-Komplexität entscheidet. Das folgende Beispiel zeigt das Muster mit einem LLM-Gateway (LiteLLM-Style-Proxy), das die Anbieter hinter einer OpenAI-kompatiblen Schnittstelle vereinheitlicht.
# Modell-Routing nach Task-Komplexität
# Ziel: kleinstes Modell, das die Aufgabe noch besteht
from openai import OpenAI
# Der Client zeigt auf das LLM-Gateway, nicht direkt auf einen Anbieter.
# Das Gateway kennt die echten Provider-Keys und vereinheitlicht die API.
client = OpenAI(base_url="https://gateway.intern/v1", api_key="gw-key")
# Modell-Register nach Komplexitätsstufe (Stand Juli 2026)
MODELLE = {
"klein": "gemini-3-flash", # 0,50 / 3,00 USD je Mio Token
"mittel": "gpt-5.1", # 1,25 / 10,00 USD je Mio Token
"gross": "claude-opus-4-8", # 5,00 / 25,00 USD je Mio Token
}
def komplexitaet_bestimmen(task_typ: str, token_schaetzung: int) -> str:
"""Ordnet eine Aufgabe einer Modell-Klasse zu."""
enge_tasks = {"klassifikation", "extraktion", "tagging", "routing"}
if task_typ in enge_tasks and token_schaetzung < 4000:
return "klein"
if task_typ in {"analyse", "vertrag", "langkette"}:
return "gross"
return "mittel" # Default: agentisch, RAG, Tool-Use
def anfrage_ausfuehren(task_typ: str, prompt: str) -> str:
stufe = komplexitaet_bestimmen(task_typ, len(prompt) // 4)
modell = MODELLE[stufe]
antwort = client.chat.completions.create(
model=modell,
messages=[{"role": "user", "content": prompt}],
)
return antwort.choices[0].message.content
# Klassifikation läuft auf dem Klein-Modell, Analyse auf dem Groß-Modell.
tag = anfrage_ausfuehren("klassifikation", "Ist diese Mail eine Beschwerde?")
gutachten = anfrage_ausfuehren("vertrag", "Prüfe Paragraph 7 auf DORA-Konformität.")
Der Code ist absichtlich schlicht. Die Task-Zuordnung ist am Anfang eine Heuristik nach Task-Typ und Länge. In der Praxis kommt später oft ein kleines Klassifikator-Modell dazu, das die Komplexität selbst schätzt, aber die harte Verdrahtung nach Task-Typ trägt bereits den großen Teil der Ersparnis.
Was das Routing im Betrieb wirklich braucht
Ein Routing ohne Eval-Gate ist keine Kosten-Optimierung, sondern ein Qualitäts-Glücksspiel. Der entscheidende Punkt: sobald du Anfragen auf kleinere Modelle umlenkst, musst du beweisen können, dass die Antwortqualität nicht fällt. Sonst sparst du auf dem Papier und verlierst in der Praxis.
Teams, die ein sauber getuntes Routing produktiv fahren, berichten von Bill-Reduktionen im Bereich 40 bis 70 Prozent, einzelne Fälle bis 85 Prozent, ohne sichtbaren Qualitätsverlust (Quelle: mehrere Gateway-Anbieter-Reports, 2026). Die Betonung liegt auf getunt. Der Weg dahin führt über ein Pre-Merge-CI-Gate mit 50 bis 500 repräsentativen Fällen, das jede Routing-Änderung blockt, die die Qualität unter einen Schwellwert drückt.
Als Plattform-Optionen für dieses Routing haben sich 2026 LiteLLM, OpenRouter, Kong AI Gateway und, auf Plattform-Ebene, der Microsoft-Foundry-Model-Router etabliert. Welches davon passt, hängt am bestehenden Stack. Wichtig ist, dass die Wahl des Gateways getrennt von der Wahl der Modelle getroffen wird: das Gateway ist die Betriebs-Schicht, die Modellwahl ist die Kosten-Entscheidung darin.
Häufig gestellte Fragen
Was kostet die richtige KI-Kosten Modellwahl im Betrieb?
Die Modellwahl selbst kostet nichts, sie spart. Was Aufwand macht, ist das Drumherum: Task-Analyse, Routing-Logik, Eval-Gate und Gateway-Betrieb. Als 6-Wochen-Pilot liegt das bei uns im Bereich 50.000 bis 90.000 Euro, je nach Zahl der Use-Cases. Die laufende LLM-Ersparnis von 40 bis 70 Prozent holt das in der Regel innerhalb weniger Monate wieder rein.
Klein-Modell oder groß: wann lohnt sich welches?
Kommt drauf an, aber die Faustregel ist stabil. Enge, deterministische Aufgaben (Klassifikation, Extraktion, Tagging) laufen auf Klein-Modellen wie Haiku 4.5 oder Gemini 3 Flash ohne Qualitätsverlust. Sobald mehrstufiges Reasoning oder lange Tool-Ketten dazukommen, brauchst du ein Mittel- oder Groß-Modell. Alles andere ist teurer als nötig.
Kann ich einfach alle Anfragen auf das billigste Modell umleiten?
Nein, davon raten wir ab. Ohne Eval-Gate merkst du zu spät, dass die Antwortqualität bei komplexen Aufgaben fällt. Der richtige Weg ist Klein-First mit einer klaren Zuordnung nach Task-Komplexität plus einem CI-Gate, das Qualitätsabfall vor dem Merge stoppt.
Muss ich mich auf einen Anbieter festlegen?
Nein, und das solltest du auch nicht. Ein Multi-LLM-Setup über ein Gateway lohnt fast immer, weil kein Anbieter in jeder Klasse am günstigsten ist. Gemini 3 Flash ist bei Massen-Klassifikation stark, Sonnet 4.6 bei agentischen Abläufen, Opus 4.8 bei harter Analyse. Das Gateway macht den Wechsel transparent.
Wie stelle ich sicher, dass die Kosten-Optimierung DSGVO-konform bleibt?
Die Modellwahl ändert nichts an der Datenschutz-Frage, aber das Routing muss sie berücksichtigen: welche Daten dürfen an welchen Anbieter, in welche Region. Im regulierten Umfeld (Banking, Versicherung, DORA) gehört das ins Routing selbst, damit sensible Anfragen gar nicht erst an ein Modell außerhalb der zulässigen Region gehen.
Nächster Schritt
Wenn Sie gerade evaluieren, wo Ihre LLM-Kosten aus dem Ruder laufen: Wir schauen uns Ihre Top-Use-Cases an, ordnen jeden einer Modell-Klasse zu und rechnen die Ersparnis konkret durch, bevor irgendetwas umgestellt wird.
Verwandte Themen
→LiteLLM und OpenRouter im direkten Vergleich
→Inference-Engines: Ollama, vLLM und TGI gegenübergestellt
→Aktuelle Modell-Preise bei Anthropic



