Was ist LLM-Evaluation?

Governance
Kurz beantwortet

LLM-Evaluation ist das systematische Messen der Antwortqualität eines Sprachmodells oder einer darauf gebauten Anwendung anhand fester Testfälle. Statt eines subjektiven Eindrucks entsteht eine Kennzahl, die sich bei jeder Änderung an Modell, Prompt oder Retrieval wiederholen lässt.

Kurz vorwegOhne Eval-Suite bleibt jede Modellentscheidung Geschmackssache. KI-Qualität messbar machen

LLM-Evaluation: Definition

LLM-Evaluation ist die wiederholbare Messung, wie gut ein Sprachmodell oder eine KI-Anwendung antwortet. Grundlage ist ein Testset: echte Fragen aus dem Anwendungsfall, dazu die von Fachleuten geprüfte Antwort und die Belegstelle. Gegen dieses Testset läuft jede Änderung an Modell, Prompt, Chunking oder Retrieval - vor dem Ausrollen, nicht danach.

Gemessen wird auf mehreren Wegen. Deterministische Prüfungen sind am eindeutigsten: Steht die richtige Kennzahl in der Antwort, hält sie das geforderte Schema ein? Für offene Antworten kommen Referenzmetriken und LLM-as-a-Judge hinzu, bei dem ein zweites Modell nach festen Kriterien bewertet. Für RAG-Systeme haben sich vier Metriken etabliert, wie sie das Open-Source-Werkzeug RAGAS umsetzt: Faithfulness prüft, ob die Aussagen der Antwort durch den abgerufenen Kontext gedeckt sind, Context Recall und Context Precision bewerten die Trefferqualität der Suche, Answer Relevancy die Passung zur gestellten Frage.

Abzugrenzen ist die Evaluation von zwei Nachbarn: Öffentliche Benchmarks bewerten ein Modell an allgemeinen Aufgaben und sagen wenig über Ihre Dokumente. Monitoring beobachtet den laufenden Betrieb und meldet Auffälligkeiten, kennt aber keine geprüfte Sollantwort. Evaluation ist der Teil, der eine Änderung freigibt oder stoppt.

Zweck
Antwortqualität messbar machen statt zu schätzen
Grundlage
Ein Testset aus echten Fragen mit geprüften Antworten
Verfahren
Regelprüfung, Referenzmetriken, LLM-as-a-Judge, menschliche Stichprobe
RAG-Metriken
Faithfulness, Context Recall, Context Precision, Answer Relevancy (z.B. RAGAS)
Grenze
Gemessen wird nur, was im Testset steht

Wie läuft eine LLM-Evaluation ab?

Der Ablauf ist immer derselbe, unabhängig vom eingesetzten Werkzeug:

  1. Testset aufbauenEchte Fragen aus dem Betrieb sammeln, dazu die von Fachleuten geprüfte Antwort und die Belegstelle. Wenige Dutzend gut gewählte Fälle sind mehr wert als tausend generierte Fragen.
  2. Kriterien festlegenJe Frage bestimmen, was eine richtige Antwort ausmacht: die exakte Kennzahl, die korrekte Quelle, das Format, die Vollständigkeit.
  3. Automatisiert messenDas Testset läuft bei jeder Änderung durch - Modellwechsel, neuer Prompt, andere Chunk-Größe, anderes Embedding-Modell.
  4. Freigeben oder stoppenSinkt eine Metrik unter die vereinbarte Schwelle, geht die Änderung nicht live. Ohne diese Schwelle bleibt die Messung Dekoration.

Welche Metriken sind bei RAG üblich?

Die vier gängigen RAG-Metriken trennen sauber, wo ein Fehler entsteht - in der Suche oder in der Antwort:

MetrikMisstTypische Ursache bei schlechtem Wert
FaithfulnessOb die Aussagen der Antwort durch den abgerufenen Kontext gedeckt sindDas Modell ergänzt aus dem Gedächtnis statt aus der Quelle
Context RecallOb die zur Antwort nötigen Stellen überhaupt gefunden wurdenChunking oder Suche verfehlen die relevante Passage
Context PrecisionWie viel des abgerufenen Kontexts wirklich relevant istZu viele oder zu grob geschnittene Treffer im Kontext
Answer RelevancyOb die Antwort die gestellte Frage trifftUnscharfe Aufgabenstellung oder abschweifender Prompt

Warum öffentliche Benchmarks nicht reichen

Ein Modell, das auf allgemeinen Aufgaben vorne liegt, kann auf Ihren Normen, Stücklisten oder Verträgen deutlich schlechter abschneiden. Benchmarks messen allgemeines Sprachvermögen, nicht die Trefferquote auf Ihrem Dokumentenbestand.

Dazu kommt: In einer RAG-Anwendung entscheidet selten das Modell über die Qualität, sondern das Retrieval davor. Ein Testset auf Ihren eigenen Fragen zeigt diesen Unterschied - ein Benchmark-Ranking nicht.

Was in eine Eval-Suite gehört

Eine Eval-Suite ist kein Testbericht, sondern ein wachsender Bestand echter Fälle.

Bestandteile
  • Echte Nutzerfragen aus dem Betrieb, nicht ausgedachte Beispiele
  • Geprüfte Antworten von Fachleuten, mit Datum und verantwortlicher Person
  • Bekannte Fehlerfälle: jede einmal aufgetretene Falschantwort bleibt als Testfall
  • Grenzfälle ohne Antwort im Bestand, um Nichtwissen zu prüfen
  • Fester Ablauf: dieselbe Suite bei jeder Änderung, Ergebnis versioniert

Wann eine Evaluation läuft

Eine Eval-Suite, die nur vor dem Produktivgang läuft, misst den einzigen Zustand, der ohnehin geprüft wurde.

1
Bei jeder Änderung
Prompt, Modellversion, Retrieval-Einstellung: dieselbe Suite, Ergebnis versioniert.
2
Nach neuen Daten
Ein neuer Dokumentenbestand ändert die Trefferlage, auch ohne Änderung am Modell.
3
Regelmäßig im Betrieb
Anbieter aktualisieren Modelle im Hintergrund. Ohne Messung fällt das erst dem Nutzer auf.
4
Nach jedem Vorfall
Jede gemeldete Falschantwort wird zum dauerhaften Testfall.
In der Praxis

Die häufigste Lücke ist nicht das fehlende Werkzeug, sondern das fehlende Testset. Ein Fragenkatalog Ihrer Fachleute mit geprüften Antworten sagt mehr über Ihren Anwendungsfall als jedes öffentliche Ranking - und er ist die einzige Grundlage, auf der sich ein Modellwechsel überhaupt begründen lässt.

Häufiger Irrtum

„Die Antworten sehen gut aus, das reicht.“ Ein Eindruck aus zwanzig Handproben ist keine Messung. Er fängt genau die Rückschritte nicht ab, die eine geänderte Chunk-Größe oder ein neues Modell in den Fällen erzeugt, die niemand von Hand geprüft hat.

Häufige Fragen zu LLM-Evaluation

Was gehört in ein Testset?

Echte Fragen aus dem Betrieb, die geprüfte Antwort und die Belegstelle im Quelldokument. Dazu Randfälle: mehrdeutige Fragen, Fragen ohne Antwort im Bestand und Fragen, deren Antwort sich regelmäßig ändert. Gerade die Fälle ohne Antwort zeigen, ob das System „nicht gefunden“ sagen kann.

Was ist LLM-as-a-Judge?

Ein zweites Sprachmodell bewertet Antworten nach festen Kriterien, etwa ob eine Aussage durch den Kontext gedeckt ist. Das skaliert weit über die Handprüfung hinaus, ersetzt sie aber nicht: Auch das bewertende Modell braucht eine Stichprobe, die ein Mensch gegenprüft.

Wie oft sollte evaluiert werden?

Bei jeder Änderung an Modell, Prompt, Chunking oder Retrieval, mindestens aber vor jeder Freigabe. Im laufenden Betrieb ergänzt Monitoring die Evaluation, weil sich Datenbestand und Fragen der Nutzer mit der Zeit verschieben.

Wenn es konkret wird

Ohne Messung bleibt KI-Qualität Geschmackssache - wir bauen mit Ihnen das Testset und die Metriken, die zu Ihrem Anwendungsfall passen.

KI-Qualität messbar machen
Phillip PhamPexon ConsultingStand 19.08.2026