[!NOTE] Automatische Übersetzung Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Beste Such-Ranking-Stack für AI-Produkte

Ein effektiver Suchstack funktioniert wie ein Trichter. Günstige Methoden sammeln zunächst eine breite Menge an Kandidaten ein, während teurere Methoden später diese Menge erheblich verkleinern. Probleme entstehen oft dann, wenn Teams die Volltextsuche durch Embeddings ersetzen, anstatt beide Ansätze miteinander zu kombinieren.

Beginnen Sie mit Filtern sowie BM25, einer leistungsstarken Methode zur Rangierung von exakten Texten. Fügen Sie anschließend dichte Retrieval hinzu, um semantische Übereinstimmungen zu finden, und verschmelzen Sie die beiden Ergebnislisten anschließend mithilfe von Reciprocal Rank Fusion (RRF) oder einer ähnlichen Methode. Rangieren Sie die ermittelte Shortlist schließlich mit einem Cross-Encoder neu. Verwenden Sie einen LLM ausschließlich für eine sehr kleine Endgruppe, bei der der erzielte Qualitätszuwachs die zusätzlichen Aufwand und Kosten von Latency rechtfertigt.

Empfohlene Technologie-Stacks

PhaseStandardwertAufgabe
FilternStrukturierte FilterEs werden Vorgaben für Tenant, Berechtigungen, Produkt, Sprache, Zeit sowie Verfügbarkeit durchgesetzt.
Lexikalischer RetrievalBM25Genaue Namen, IDs, Fehlercodes, rechtliche Begriffe sowie hochpräzise Tokens.
Dichte RetrievalEmbeddingsSynonyme, Paraphrasen, verschwommene Absichten sowie semantische Wiedererkennung.
FusionReziproke Rangfusionsmethode oder gewichtete Kombination von SuchalgorithmenFühren Sie die Verschmelzung von spärlichen und dichten Kandidaten durch, ohne vorzutäuschen, dass die entsprechenden Scores vergleichbar seien.
RerankingKreuzencoderDie 20 bis 100 Kandidaten mithilfe der Abfrage-Dokument-Interaktion neu ordnen.
Endgültige PräzisionLLM-Neubewertungsmechanismus oder Antwort auf ModelErst wenn die Liste klein ist, soll die fein abgestimmte Relevanz bewertet werden.
BewertungRecall@k, nDCG, MRR, Klicketiketten, menschliche EtikettenBeweisen Sie, dass jede Stufe die vorherige verbessert.

Standardwerte für Use-Cases

ProduktoberflächeGute StandardeinstellungWarum
DokumentensucheBM25 plus Embeddings plus KreuzencoderSowohl die genauen Namen von API als auch die semantischen Aspekte sind von Bedeutung.
RAG RetrievalHybrid Retrieval zusammen mit einem Reranker sowie Prüfungen von ZitatenFehlende Belege sind in der Regel schlimmer als eine langsame Generierung.
ProduktsucheLexikalische Filter zusammen mit dem hybriden Retrieval-Ansatz sowie GeschäftsfunktionenVerfügbarkeit, Preis, Beliebtheit sowie die genauen Eigenschaftsmerkmale sind von entscheidender Bedeutung.
Suchfunktion unterstützenHybrid Retrieval zusammen mit Aktualitätsinformationen und Metadaten der TicketsSowohl ähnliche Formulierungen als auch die aktuelle Richtlinie sind von Bedeutung.
Interne WissensdatenbankBaseline BM25, anschließend dichte Retrieval-Modelle aus den AbfragenachweisenBeginnen Sie mit der Messung, bevor Sie die Kosten für Model tragen.
Rechtliche oder KonformitätsabfrageLexikalische Grundlage zusammen mit strengen Filtern, gefolgt von einer sorgfältigen semantischen ErweiterungSowohl falsch positive als auch falsch negative Ergebnisse verursachen erhebliche Kosten.

Warum BM25 weiterhin Teil des Technologiestacks bleibt

Embeddings finden von Texten mit ähnlicher Bedeutung, wobei diese jedoch keine zuverlässige Alternative zur exakten Übereinstimmung darstellen. Fehlercodes, Funktionsnamen, Produkt-SKUs, rechtliche Formulierungen sowie Personennamen tragen oft die ursprüngliche Absicht durch ihre genaue Schreibweise in sich. BM25 bleibt aufgrund der Belohnung von Begriffen, die der Benutzer tatsächlich eingegeben hat, weiterhin eine solide Grundlage.

Dichte Retrieval-Methoden erhöhen die Trefferquote, wenn Nutzer das genaue Vokabular nicht kennen. Der geeignete Ansatz ist weder BM25 noch Embeddings. Verwenden Sie BM25 für die lexikalische Trefferfindung, Embeddings für die semantische Trefferfindung und eine Fusionstechnik, um beide Ansätze miteinander zu verbinden.

Wann ein Reranker hinzugefügt werden sollte

Fügen Sie einen Cross-Encoder hinzu, sobald die relevanten Dokumente in den ersten 50 Ergebnissen zu finden sind, jedoch nicht ganz an der Spitze. Dies ist das deutlichste Anzeichen dafür, dass die Kandidatengenerierung funktioniert, während die Ranking-Algorithmen Unterstützung benötigen.

Fügen Sie einen LLM Reranker vor einen Cross-Encoder nur dann hinzu, wenn die Kandidatensammlung sehr klein ist. Zudem benötigt dieser Reranker eine Relevanzbewertung, die ausreichend fein abgestimmt ist, um den damit verbundenen Aufwand zu rechtfertigen. LLM sowie Reranking können zwar helfen, sind jedoch teuer und langsamer in der Ausführung. Vergleichen Sie deren Leistung daher mit einer günstigeren Variante eines Rerankers.

Bewertungsablauf

  1. Beschriften Sie eine kleine Menge an echten Abfragen.
  2. Messen Sie zunächst nur den Wert von BM25.
  3. Fügen Sie den dichten Retrieval hinzu und ermitteln Sie die Änderung des Recall-Werts.
  4. Implementieren Sie die Fusionstechnik und messen Sie anschließend nDCG sowie Recall@k.
  5. Integrieren Sie den Cross-Encoder Reranking und prüfen Sie die Werte von Precision@1 sowie nDCG.
  6. Fügen Sie LLM Reranking nur dann hinzu, wenn dies die Qualität trotz der damit verbundenen Kosten verbessert und Latency bereits berücksichtigt wurde.
  7. Überwachen Sie die Metriken in der Produktion: Anteil an Null-Ergebnissen, Anteil an Neuformulierungen, Klickrate, Korrekturrate der Antworten, p95 Latency sowie die Kosten.

Weitere Lektüre

Referenzen