[!NOTE] Automatische vertaling Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
De beste zoekrankingsstack voor AI-producten
Een goede zoekstack werkt als een trechter. Goedkope methoden verzamelen eerst een breed scala aan mogelijke resultaten; dure methoden fijnen later een veel kleinere groep af. Problemen ontstaan vaak wanneer teams de exacte-tekstzoekopdracht vervangen door embeddings in plaats van beide methoden te combineren.
Begin met filters en BM25, een krachtige methode voor exacte tekstrankering. Voeg dense retrieval toe om semantische overeenkomsten te vinden, en voeg vervolgens beide resultatenlijsten samen met Reciprocal Rank Fusion (RRF) of een soortgelijke methode. Rangschik de verkorte lijst opnieuw met behulp van een cross-encoder. Gebruik een LLM uitsluitend voor een zeer klein eindresultaat waarin de kwaliteitsverbetering de extra latency en kosten rechtvaardigt.
Aanbevolen technologiestack
| Fase | Standardwaarde | Taak |
|---|---|---|
| Filteren | Gestructureerde filters | Voer controle uit op tenant-, toegangsrechten-, product-, taal-, tijds- en beschikbaarheidsinstellingen. |
| Lexicaal retrieval | BM25 | Exacte namen, ID’s, foutcodes, juridische termen en tokens met hoge precisie. |
| Dichte retrieval | Embeddings | Synoniemen, parafrasen, vage intentie en semantische herinnering. |
| Fusie | Fusie van wederzijdse rangen of samenstelling van gewogen zoekmachines | Fusioneer de sparsen en dichte kandidaten zonder te doen alsof de scores met elkaar vergeleken kunnen worden. |
| Reranking | Cross-encoder | Herordeneer 20 tot 100 kandidaten op basis van de interactie tussen de query en het document. |
| Uiteindelijke precisie | LLM reranker of geef antwoord op model | Los pas de de complexe relevantieproblematiek op wanneer de lijst beknopt is. |
| Evaluatie | Recall@k, nDCG, MRR, kliklabels, menselijke labels | Bewijs dat elke fase de vorige verbetert. |
Standaardinstellingen voor use cases
| Productoppervlak | Goede standaardinstellingen | Waarom |
|---|---|---|
| Documentatiezoeken | BM25 plus embeddings plus cross-encoder | Zowel de exacte namen van API als de semantische vragen spelen een belangrijke rol. |
| RAG retrieval | Hybride retrieval in combinatie met reranker en controle op citaties | Het ontbreken van bewijsmateriaal is meestal erger dan een trage generatie. |
| Productzoekopdracht | Lexicaal filteren gecombineerd met het hybride retrieval-model en bedrijfsfuncties | De beschikbaarheid, prijs, populariteit en de specifieke facetten spelen een cruciale rol. |
| Ondersteuning voor zoekfuncties | Hybride retrieval in combinatie met versheid en ticketmetadata | Zowel vergelijkbare formuleringen als de huidige beleidsregels zijn belangrijk. |
| Interne kennisbase | BM25-baseline, gevolgd door de dense retrieval uit de query-logs | Begin pas met meten wanneer de kosten van model zijn verwerkt. |
| Rechtelijke of compliance-opsporing | Een lexicaal basisniveau gecombineerd met strikte filters, gevolgd door zorgvuldige semantische uitbreiding | Zowel valse positieven als valse negatieven brengen hoge kosten met zich mee. |
Waarom BM25 nog steeds thuishoort in de technologiestack
Embeddings Zoek tekst met een vergelijkbare betekenis, maar deze methoden vervangen niet altijd een exacte overeenkomst op betrouwbare manier. Foutcodes, functienaamen, product‑SKU’s, juridische formuleringen en namen van personen dragen vaak de oorspronkelijke intentie over via hun exacte spelling. BM25 blijft een sterke basismethode, omdat het termen beloont die de gebruiker daadwerkelijk heeft getypt.
Een dichte retrieval verhoogt de recall wanneer gebruikers het exacte vocabulaire niet kennen. Het juiste model is noch BM25, noch embeddings. Gebruik BM25 voor lexicaal recall, embeddings voor semantisch recall, en fusing om deze twee methoden met elkaar te combineren.
Wanneer je een reranker moet toevoegen
Voeg een cross-encoder toe wanneer de relevante documenten zich ergens binnen de eerste 50 bevinden, maar niet helemaal bovenaan staan. Dit is het duidelijkste signaal dat de kandidaatgeneratie correct werkt en dat de rangschikking ondersteuning nodig heeft.
Voeg geen LLM reranker toe aan een cross-encoder tenzij de kandidaatenset zeer klein is. De encoder heeft bovendien een relevantiebeoordeling nodig die voldoende subtiel is om de bijbehorende kosten te rechtvaardigen. LLM reranking kan helpen, maar het is kostbaar en trager. Meet de prestaties hiervan af tegen een goedkopere reranker.
Evaluatiesysteem
- Label een klein aantal echte vragen.
- Meet alleen BM25.
- Voeg dense retrieval toe en meet de recall-delta.
- Voeg fusion toe en meet nDCG evenals Recall@k.
- Voeg de cross-encoder reranking toe en meet Precision@1 en nDCG.
- Voeg LLM reranking alleen toe als dit de kwaliteit verbetert na inclusie van de kosten en latency.
- Houd de productiemetingen in de gaten: het percentage zonder resultaat, het herformuleringspercentage, de click-through-ratio, de correctie van antwoorden, p95 latency en de kosten.
Verder lezen
- Search Ranking Stack in 2026 geeft een volledige uitleg over de implementatie. RAG Evaluatiemetingen Legt retrieval en de evaluatie van citaties uit.