KI-Beratung · RAG-Qualität

Warum verwechselt mein KI-Chatbot ähnliche Produktvarianten, und wie ich es behebe

Kurz gesagt

Wenn Ihr RAG-Chatbot bei Typ 35 statt Typ 40 antwortet, Materialstärken vertauscht oder zwei Varianten mischt, liegt das fast nie am Sprachmodell, sondern an reiner Vektor-Ähnlichkeitssuche. In einem Referenzprojekt sank die Recherchezeit um über 90% (Pexon Projektbeleg, anonymisiert). Der Fix ist bekannt und messbar: hybride Suche, ein Produkt-Metadaten-Schema und Quellenpflicht.

Hybride Suche: Vektor + BM25
product_id-Metadaten-Filter
messbar per RAGAS
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001:2024, Google Cloud Partner, AWS Partner

Warum Bot zieht die falsche Variante teuer wird

Für technische Entscheider und Produktmanager mit strukturierten Produktdaten: Ihr RAG-Chatbot ist live oder im Piloten, aber bei technisch ähnlichen Varianten zieht er die falsche oder mischt zwei Produkte. Die Antwort klingt plausibel, nur die Variante stimmt nicht, und im Support wird daraus Fehlberatung.

Typ 35 statt Typ 40
Der Bot vertauscht ähnliche Varianten, Materialstärken oder Anschlussmaße, oder liegt bei der Artikelnummer eine Ziffer daneben.
Plausibel, aber falsch
Gefährlicher als eine offensichtlich falsche Antwort: Sie ist sauber formuliert und wirkt korrekt. Nur die entscheidende Variante ist vertauscht.
Produktcodes gehen verloren
Codes wie ein Produktschlüssel mit der Endung 35 sind für reine Semantik-Suche fast unsichtbar. Die unterscheidende Ziffer ist genau das, was verloren geht.

Die vier Hebel, messbar gemacht

Der Fix ist kein neues Modell, sondern vier zusammenwirkende Retrieval-Hebel, deren Wirkung über RAGAS messbar wird.

Vektor+BM25 hybride Suche
Die Keyword-Suche (BM25) findet den exakten Produktcode, die Vektorsuche den Kontext, verschmolzen per Reciprocal Rank Fusion. (Pexon RAG-Framework)
product_id Metadaten-Vorfilter
Jedes Produkt als eigener Chunk mit product_id als Pflicht-Metadatum, gefiltert vor der Vektorsuche. (Pexon RAG-Framework)
Top-20 zu 5 Cross-Encoder-Reranking
Ein Reranker priorisiert die Top-20-Kandidaten auf die präzisesten fünf, die knapp-daneben-Variante fällt raus. (Pexon RAG-Framework)
> 90% RAGAS Faithfulness
Quellenpflicht und Grounding, messbar über RAGAS Faithfulness mit einem Zielwert über 90 Prozent. (Pexon RAG-Framework)

Ab wann sich der Retrieval-Fix lohnt

Der Retrieval-Fix gegen Varianten-Verwechslung lohnt sich, sobald der Chatbot ähnliche Produktvarianten vertauscht, exakte Produktcodes und Artikelnummern zählen oder falsche Antworten im Support zu Fehlberatung werden. Vier Retrieval-Hebel statt eines größeren Modells.
0.72
Score-Threshold, darunter keine Antwort
> 90%
RAGAS Faithfulness als Ziel
50
Frage-Antwort-Paare im Testset

Anwendungsbeispiele

Use Case 01

Exakter Produktcode gewinnt

Über BM25 findet die Suche den exakten Produktcode, statt eine semantisch ähnliche Variante zu ziehen.

Die richtige Variante gewinnt.
Use Case 02

Vorfilter auf die Variante

Der Metadaten-Filter grenzt vor der Vektorsuche auf die richtige product_id ein, dann wird semantisch gesucht.

Kein Mischen zweier Varianten mehr.
Use Case 03

Knapp-daneben fällt raus

Das Cross-Encoder-Reranking sortiert die fast-richtige Variante aus den Top-Treffern aus.

Präzise Top-5 statt plausibler Verwechslung.
Use Case 04

Nichts Unbelegtes behaupten

Unter dem Score-Threshold von 0.72 gibt der Bot lieber keine Antwort als eine falsche.

Keine Halluzination statt falscher Variante.

Integration in Ihre Umgebung

Passt der Fix zu unseren Daten? Produktdaten und Messbarkeit geben den Rahmen.

Datenbasis

PIM / Produktkatalog · Strukturierte Produktdaten sind der größte Beschleuniger, product_id wird zum Pflicht-Metadatum.
PDFs & Dokumente · Auch unstrukturierte Belege werden mit semantischem Chunking von 300 bis 500 Tokens indexiert.
Ohne PIM · Geht auch, dann übernimmt ein regelbasiertes Metadaten-Schema die Filterung.

Messbarkeit

RAGAS · Faithfulness, Context Recall und Precision machen jede Verbesserung nachweisbar.
Testset · Mindestens 50 geprüfte Frage-Antwort-Paare je Datenquelle.
Monitoring · Wöchentlicher Lauf, Alerting bei Faithfulness unter 80 Prozent.

Wie der Fix gegen Varianten-Verwechslung bei Pexon funktioniert

1
RAG-Qualitäts-Check
In 30 Minuten schauen wir auf Ihren konkreten Verwechslungs-Fall, kostenlos.
2
Metadaten-Schema
Wir definieren die Pflicht- und Produktmetadaten, product_id im Zentrum.
3
Indexierung neu
Semantisches Chunking, Produkt-Hierarchie als Metadaten-Baum, hybride Suche.
4
Reranking & Grounding
Cross-Encoder-Reranking und Quellenpflicht kommen dazu.
5
RAGAS-Validierung
Ein Testset misst die Trefferquote vorher und nachher.
6
Produktiv & Monitoring
Der Fix geht produktiv, das Monitoring hält die Qualität stabil.
Erfahren Sie mehr über KI-Qualitätssicherung: Halluzinationen vermeiden

Warum Pexon statt Inhouse-Entwicklung

Größeres LLM kaufen
-Löst das Problem nicht, der falsche Chunk wird nur besser formuliert
-Kosten steigen, die Trefferquote nicht
-Das Symptom bleibt
Am Prompt herumbasteln
-Behebt keinen Retrieval-Fehler
-Die falsche Variante wird trotzdem abgerufen
-Nicht messbar
Mit Pexon
Vier Retrieval-Hebel, die zusammen wirken
product_id-Filter, BM25, Reranking, Grounding
Messbar per RAGAS, vorher und nachher belegt

In 4 Phasen zur produktiven Lösung

1
30 Min
RAG-Qualitäts-Check
Konkreten Verwechslungs-Fall ansehen, kostenlos.
2
Aufbau
Schema & Indexierung
Metadaten-Schema, hybride Suche, product_id-Filter.
3
Feintuning
Reranking & Messung
Cross-Encoder-Reranking, Grounding und RAGAS-Testset.
4
produktiv
Rollout & Monitoring
Produktivsetzung und wöchentliches RAGAS-Monitoring.

So starten Sie

Der Einstieg ist ein kostenloser RAG-Qualitäts-Check auf Ihren realen Fall, der Fix danach nach Scope.

Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001:2024, Google Cloud Partner, AWS Partner
Ihre Investition
kostenlos zum Start
RAG-Qualitäts-Check, 30 Min · Fix nach Scoping
Enthält:

RAG-Qualitäts-Check · 30 Minuten auf Ihren konkreten Verwechslungs-Fall, kostenlos und unverbindlich.

Der Fix · Metadaten-Schema, hybride Suche, Reranking und Grounding, Umfang nach Datenbestand.

Der Nachweis · Ein RAGAS-Testset misst die Trefferquote vorher und nachher, Sie sehen die Verbesserung schwarz auf weiß.
Jetzt Kontakt aufnehmen
100 % unverbindlich, ohne Verpflichtung

Häufige Fragen

Warum verwechselt mein KI-Chatbot ähnliche Produktvarianten?

Weil er nur mit Vektor-Ähnlichkeitssuche arbeitet. Varianten wie Typ 35 und Typ 40 liegen im Vektorraum fast identisch, da sich der Kontext deckt. Die unterscheidende Ziffer im Produktcode geht verloren. Ohne Keyword-Suche und Metadaten füllt das Modell die Lücke plausibel, aber falsch auf.
Liegt das am Sprachmodell oder am Retrieval?

Fast immer am Retrieval, nicht am LLM. Ein größeres Modell löst das Problem nicht, wenn der Chatbot bereits den falschen Chunk abruft. Der Fehler entsteht in der Suche vor der Antwortgenerierung. Ein stärkeres LLM formuliert die falsche Variante nur überzeugender.
Was kostet der Fix und wie fängt er an?

Der Einstieg ist ein kostenloser RAG-Qualitäts-Check, 30 Minuten auf Ihren realen Verwechslungs-Fall. Der eigentliche Fix hängt an Ihrem Datenbestand: Metadaten-Schema, hybride Suche, Reranking und Grounding. Umfang und Rahmen legen wir nach dem Check gemeinsam fest.
Was ist hybride Suche und warum hilft sie bei Produktcodes?

Hybride Suche kombiniert Vektorsuche für die Semantik mit BM25-Keyword-Suche. BM25 findet den exakten Produktcode, den die Semantik übersieht. Beide Ergebnisse werden per Reciprocal Rank Fusion verschmolzen. So bleibt die entscheidende Ziffer erhalten und die richtige Variante gewinnt.
Brauche ich dafür ein PIM oder strukturierte Produktdaten?

Ein PIM ist der größte Beschleuniger, aber keine Pflicht. Jedes Produkt wird als eigener Chunk mit product_id gefiltert. Ohne PIM übernimmt ein regelbasiertes Metadaten-Schema diese Rolle, das ist aufwändiger. Ganz ohne strukturierbare Produktlogik stößt varianten-genaue Suche allerdings an ihre Grenze.
Wie messe ich, ob der Chatbot jetzt korrekt antwortet?

Über das RAGAS-Framework. Faithfulness misst, wie viel der Antwort durch abgerufene Quellen belegt ist, mit Ziel über 90 Prozent. Context Recall und Precision zeigen, ob die richtigen Chunks abgerufen wurden. Ein Testset mit mindestens 50 geprüften Frage-Antwort-Paaren macht die Verbesserung nachweisbar.

Ihren Verwechslungs-Fall im RAG-Qualitäts-Check ansehen

Sagen Sie uns, wo Ihr Chatbot Varianten vertauscht und wie Ihre Produktdaten aussehen. In einem kostenlosen 30-Minuten-Check schauen wir auf den konkreten Fall und zeigen den Weg zum messbaren Fix.

Jetzt Kontakt aufnehmen

Nachricht senden

Kein passender Termin? Schreiben Sie uns, wir melden uns innerhalb von 24 Stunden.

Antwort innerhalb von 24 Stunden
Unverbindliches Erstgespräch
Persönlicher Ansprechpartner
Phillip Pham
Phillip Pham
CEO @ Pexon Consulting
Aktualisiert am 3. August 2026

Sie suchen einen Partner für Ihr Projekt?

Wir analysieren Ihren individuellen Bedarf, geben erste Empfehlungen zu Umsetzungsstrategien und bieten Ihnen transparente Einblicke in unsere Methoden, Technologien und Referenzen.

Vertrieb kontaktieren
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001:2024, Google Cloud Partner, AWS Partner
400+Projekte seit 2020
100+Kunden im DACH-Raum
ISO27001 zertifiziert
3Hyperscaler Partner