[!NOTE] Automatische Übersetzung Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Beste Bewertungstools und -metriken für RAG im Jahr 2026

Ein einzelner Score reicht nicht aus, um festzustellen, ob ein mit Retrieval erweitertes Generierungssystem (RAG) funktional ist. Es kann bei der Parsung von Dokumenten, deren Aufteilung in Blöcke, dem Abrufen oder Reranking Erfassen von Belegen, der Erstellung einer Antwort, dem Hinzufügen von Zitaten oder der Anwendung von Filtern versagen. Messen Sie daher jede Phase separat, damit eine Regression auf einen bestimmten Bestandteil des Pipeline hindeutet.

Beginnen Sie mit den Retrieval-Metriken auf einem kleinen, beschrifteten Dataset. Fügen Sie Ragas für Standard-RAG-Metriken hinzu, DeepEval für CI-Überprüfungen sowie TruLens, wenn Sie Rückmeldungen zu einzelnen Ausführungen benötigen. Verwenden Sie LangSmith, falls Ihre Traces- und Datasets-Komponenten bereits dort vorhanden sind. Erstellen Sie eigene Metriken für fehlerbezogene Probleme, die spezifisch für ein Produkt gelten.

Entscheidungstabelle

Der beste AusgangspunktWarum
Billige Retrieval-RegressionstestsLokale MetrikenRecall@k, MRR, nDCG, das Filtern von Falsch-Ausschlüssen sowie die Zitierunterstützung können deterministisch sein.
Referenzlose Qualitätsmetriken für RAGRagasEs liefert Informationen zu der Präzision des Kontexts, dem Kontextabrufvermögen, der Relevanz der Antwort, der Treue zum Original sowie zu weiteren damit verbundenen Metriken.
CI-Gates für LLM-AnwendungenDeepEvalEine Schnittstelle im Testfall-Stil funktioniert hervorragend, wenn Evals einen Pull Request ablehnen oder Deployment auslösen sollte.
Erklärbares Feedback für AppsTruLensRAG Die Triade trennt die Relevanz des Kontexts, die Grundierung durch reale Daten sowie die Relevanz der Antwort voneinander.
Trace-zentriertes Produkt EvalsLangSmithDatasets, Evaluators, Annotationen, Traces sowie Regressionen Workflows koexistieren gemeinsam.
domänenspezifische QualitätKundenspezifischer EvalsAllgemeine Metriken kennen in der Regel weder Ihre Ontologie noch die Filter, Zitierrichtlinien, Einschränkungen des Parsers oder die Ablehnungsregeln.

Metriken nach der Pipeline-Phase

PhaseErste zu hinzufügende MetrikenWarum
ParsingVollständigkeit der Extraktion, Erhalt der Tabellenstruktur, Abdeckung der SeitenEine fehlerhafte Eingabe führt dazu, dass alle nachfolgenden Metriken irreführend sind.
ChunkingAntwortbarkeit von Chunks, Grenzverlust, DuplikationsrateDer Retriever kann Fakten, die über schlecht definierte Grenzen verteilt sind, nicht wiederherstellen.
RetrievalRecall@k, MRR, nDCG@k, Kontextgenauigkeit, Kontext-RecallDies erkennt fehlende Belege, bevor der Generator das Problem versteckt.
RerankingPräzision@1, nDCG-Delta, Verbesserung durch Reranking, Latency-DeltaReranker sollten die Sortierung ausreichend verbessern, um Latency zu rechtfertigen.
GenerierungTreue zur Quelle, Fundiertheit, Relevanz der AntwortDiese messen, ob die Antwort den abgerufenen Kontext verwendet hat.
ZitateAnspruch auf Absicherung, Zitierunterstützung, Anteil der nicht unterstützten AnsprücheEine fundierte Antwort ohne nützliche Quellenangaben kann den Produktentwicklungsprozess dennoch zum Scheitern bringen.
ProduktionsumgebungRückfallrate, Korrekturrate, P95 Latency, Kosten pro AntwortDie Offline-Qualität ist ohne operative Telemetriedaten unvollständig.

Hinweise zu den Tools

Ragas stellt die einfachste Methode dar, um ein standardisiertes Bewertungswortverzeichnis für RAG zu erhalten. Er ist besonders nützlich, wenn ein Team schnell an Präzision bezüglich des Kontexts, an der Erinnerung an den Kontext, an Treue zum Original sowie an Relevanz der Antworten benötigt. Es gilt jedoch die Vorsichtsmaßnahme Calibration: Die Metriken LLM bis Judge mögen zwar präzise erscheinen, verbergen aber oft Judge Prompts, Beispiele, die Auswahl von Model sowie die damit verbundenen Kosten.

DeepEval eignet sich hervorragend für die Softwareentwicklung Workflows, bei der die Bewertung genauso funktionieren sollte wie Tests. Er ist besonders nützlich für Regressionstests in CI-Pipelines, insbesondere im Umgang mit bekannten Fehlerfällen. Die Warnung mag langweilig klingen, ist aber durchaus berechtigt: Testartige Evals sind nur so gut wie die Fälle, die man pflegt.

TruLens erweist sich als besonders nützlich, wenn Feedbackfunktionen an App-Daten verknüpft werden sollen. Das RAG-Triad ist vorteilhaft, da es die Aspekte Kontextrelevanz, Grundierung und Antwortrelevanz getrennt voneinander bewahrt, anstatt sie in einer undurchsichtigen Gesamtwertzahl zusammenzufassen.

LangSmith ist praktisch, wenn Ihre Traces, Ausführungen, Datasets sowie Überprüfungen Workflow bereits im LangChain/LangGraph-Ekosystem vorhanden sind. Er bietet hingegen weniger Vorteile, falls Sie eine Framework-neutrale lokale Eval Harness wünschen.

Eingebundene Evals sind in der Produktion keineswegs optional. Wenn Ihr RAG-System Dokumente nach Berechtigungen, Rechtsgebieten, Datumsangaben, Produktlinien oder Ontologien filtert, müssen Fehl ausschlüsse sowie Fehler in den Filterregeln unmittelbar erfasst werden.

Eine sinnvolle Ausgangsarchitektur

  1. Erstellen Sie eine „Golden-Set“-Sammlung von 50 bis 200 Abfragen mit den erwarteten Quell-ID‑Werten sowie kurzen Antworthinweisen.
  2. Verfolgen Sie vor dem Hinzufügen von LLM Judges lokal die deterministischen Retrieval-Metriken.
  3. Fügen Sie eine Metrik zur Grundgesetztheit oder Treue aus den Bibliotheken Ragas oder TruLens hinzu.
  4. Implementieren Sie DeepEval‑Prüfungen für Fehlerfälle, bei denen auf keinen Fall zu einem Rückgang der Leistung kommen darf.
  5. Speichern Sie Traces sowie ausgewählte menschliche Bewertungen in LangSmith, OpenTelemetry oder in Ihren eigenen Tabellen.
  6. Fügen Sie benutzerdefinierte Metriken für Filter, Zitate, Qualität des Parsers sowie Verhaltensweisen bei Ablehnungen hinzu.

Ein häufiger Fehler

Ein häufiger Fehler besteht darin, die Treuebewertung durchzuführen und dabei bereits aufzuhören. Die Treuebewertung beantwortet lediglich eine einzige, eng gefasste Frage: Stimmt die Antwort mit dem abgerufenen Kontext überein? Sie kann jedoch nicht angeben, ob der Informationsabrufmechanismus tatsächlich die richtige Quelle gefunden hat. Zudem werden dabei fehlende Tabellen, fehlerhafte Berechtigungsfilter sowie Verweise auf falsche Abschnitte übersehen.

Weitere Lektüre

Referenzen