[!NOTE] Automatische vertaling Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

De beste zoekrankingsstack voor AI-producten

Een goede zoekstack werkt als een trechter. Goedkope methoden verzamelen eerst een breed scala aan mogelijke resultaten; dure methoden fijnen later een veel kleinere groep af. Problemen ontstaan vaak wanneer teams de exacte-tekstzoekopdracht vervangen door embeddings in plaats van beide methoden te combineren.

Begin met filters en BM25, een krachtige methode voor exacte tekstrankering. Voeg dense retrieval toe om semantische overeenkomsten te vinden, en voeg vervolgens beide resultatenlijsten samen met Reciprocal Rank Fusion (RRF) of een soortgelijke methode. Rangschik de verkorte lijst opnieuw met behulp van een cross-encoder. Gebruik een LLM uitsluitend voor een zeer klein eindresultaat waarin de kwaliteitsverbetering de extra latency en kosten rechtvaardigt.

Aanbevolen technologiestack

FaseStandardwaardeTaak
FilterenGestructureerde filtersVoer controle uit op tenant-, toegangsrechten-, product-, taal-, tijds- en beschikbaarheidsinstellingen.
Lexicaal retrievalBM25Exacte namen, ID’s, foutcodes, juridische termen en tokens met hoge precisie.
Dichte retrievalEmbeddingsSynoniemen, parafrasen, vage intentie en semantische herinnering.
FusieFusie van wederzijdse rangen of samenstelling van gewogen zoekmachinesFusioneer de sparsen en dichte kandidaten zonder te doen alsof de scores met elkaar vergeleken kunnen worden.
RerankingCross-encoderHerordeneer 20 tot 100 kandidaten op basis van de interactie tussen de query en het document.
Uiteindelijke precisieLLM reranker of geef antwoord op modelLos pas de de complexe relevantieproblematiek op wanneer de lijst beknopt is.
EvaluatieRecall@k, nDCG, MRR, kliklabels, menselijke labelsBewijs dat elke fase de vorige verbetert.

Standaardinstellingen voor use cases

ProductoppervlakGoede standaardinstellingenWaarom
DocumentatiezoekenBM25 plus embeddings plus cross-encoderZowel de exacte namen van API als de semantische vragen spelen een belangrijke rol.
RAG retrievalHybride retrieval in combinatie met reranker en controle op citatiesHet ontbreken van bewijsmateriaal is meestal erger dan een trage generatie.
ProductzoekopdrachtLexicaal filteren gecombineerd met het hybride retrieval-model en bedrijfsfunctiesDe beschikbaarheid, prijs, populariteit en de specifieke facetten spelen een cruciale rol.
Ondersteuning voor zoekfunctiesHybride retrieval in combinatie met versheid en ticketmetadataZowel vergelijkbare formuleringen als de huidige beleidsregels zijn belangrijk.
Interne kennisbaseBM25-baseline, gevolgd door de dense retrieval uit de query-logsBegin pas met meten wanneer de kosten van model zijn verwerkt.
Rechtelijke of compliance-opsporingEen lexicaal basisniveau gecombineerd met strikte filters, gevolgd door zorgvuldige semantische uitbreidingZowel valse positieven als valse negatieven brengen hoge kosten met zich mee.

Waarom BM25 nog steeds thuishoort in de technologiestack

Embeddings Zoek tekst met een vergelijkbare betekenis, maar deze methoden vervangen niet altijd een exacte overeenkomst op betrouwbare manier. Foutcodes, functienaam​en, product‑SKU’s, juridische formuleringen en namen van personen dragen vaak de oorspronkelijke intentie over via hun exacte spelling. BM25 blijft een sterke basismethode, omdat het termen beloont die de gebruiker daadwerkelijk heeft getypt.

Een dichte retrieval verhoogt de recall wanneer gebruikers het exacte vocabulaire niet kennen. Het juiste model is noch BM25, noch embeddings. Gebruik BM25 voor lexicaal recall, embeddings voor semantisch recall, en fusing om deze twee methoden met elkaar te combineren.

Wanneer je een reranker moet toevoegen

Voeg een cross-encoder toe wanneer de relevante documenten zich ergens binnen de eerste 50 bevinden, maar niet helemaal bovenaan staan. Dit is het duidelijkste signaal dat de kandidaatgeneratie correct werkt en dat de rangschikking ondersteuning nodig heeft.

Voeg geen LLM reranker toe aan een cross-encoder tenzij de kandidaatenset zeer klein is. De encoder heeft bovendien een relevantiebeoordeling nodig die voldoende subtiel is om de bijbehorende kosten te rechtvaardigen. LLM reranking kan helpen, maar het is kostbaar en trager. Meet de prestaties hiervan af tegen een goedkopere reranker.

Evaluatiesysteem

  1. Label een klein aantal echte vragen.
  2. Meet alleen BM25.
  3. Voeg dense retrieval toe en meet de recall-delta.
  4. Voeg fusion toe en meet nDCG evenals Recall@k.
  5. Voeg de cross-encoder reranking toe en meet Precision@1 en nDCG.
  6. Voeg LLM reranking alleen toe als dit de kwaliteit verbetert na inclusie van de kosten en latency.
  7. Houd de productiemetingen in de gaten: het percentage zonder resultaat, het herformuleringspercentage, de click-through-ratio, de correctie van antwoorden, p95 latency en de kosten.

Verder lezen

Referenties