[!NOTE] Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.

Mejor stack de clasificación de búsquedas para productos AI

Un buen stack de búsqueda funciona como un embudo. Los métodos económicos recopilan primero un conjunto amplio de candidatos; los métodos costosos refinan posteriormente un conjunto mucho más reducido. Los problemas suelen surgir cuando los equipos reemplazan la búsqueda de texto exacto por embeddings en lugar de combinar ambas técnicas.

Comience con filtros y BM25, un método de clasificación por texto exacto muy eficaz. Añada una recuperación densa para identificar coincidencias semánticas y, a continuación, fusione las dos listas de resultados mediante Reciprocal Rank Fusion (RRF) u otro método similar. Realice una nueva clasificación de la lista reducida usando un cross-encoder. Utilice un LLM únicamente en un pequeño conjunto final, cuando la mejora en calidad justifique el aumento adicional de latencia y costes.

Stack recomendado

EtapaValor predeterminadoTarea
FiltradoFiltros estructuradosAplicar restricciones por arrendatario, permisos, producto, idioma, hora y disponibilidad.
Recuperación léxicaBM25Nombres exactos, identificadores, códigos de error, términos legales y tokens de alta precisión.
Recuperación densaEmbeddingsSinónimos, paráfrasis, intención difusa y recuperación semántica.
FusiónFusión de rangos recíprocos o composición de recuperadores ponderadosFusionar los candidatos dispersos y densos sin pretender que sus puntuaciones sean comparables.
RerankingCodificador cruzadoReordenar de 20 a 100 candidatos mediante la interacción consulta-documento.
Precisión finalLLM reranker o responder al modeloSolo se debe resolver la relevancia matizada una vez que la lista esté reducida.
EvaluaciónRecall@k, nDCG, MRR, etiquetas de clic, etiquetas humanasDemuestre que cada etapa mejora a la anterior.

Valores predeterminados de casos de uso

Superficie del productoBuena configuración predeterminada¿Por qué?
Búsqueda de documentaciónBM25 más embeddings más codificador cruzadoLos nombres exactos de API y las cuestiones semánticas son igualmente importantes.
RAG recuperaciónRecuperación híbrida junto con reranker y verificaciones de citaciónLa falta de evidencias suele ser un problema peor que una generación lenta.
Búsqueda de productosFiltros léxicos junto con recuperación híbrida más funcionalidades empresarialesLa disponibilidad, el precio, la popularidad y las facetas exactas son factores cruciales.
Soporte para búsquedasRecuperación híbrida junto con información de frescura y metadatos de ticketTanto la redacción similar como la política actual son importantes.
Base de conocimiento internaLínea de referencia BM25, seguida de recuperación densa a partir de los registros de consultasComience a medir los resultados antes de incorporar el costo del modelo.
Búsqueda legal o de cumplimiento normativoUna línea de base léxica sumada a filtros estrictos, seguida de una expansión semántica cuidadosa.

Por qué BM25 sigue formando parte del stack

Embeddings localizar texto con un significado similar, aunque no sustituyen de forma fiable a una coincidencia exacta. Los códigos de error, los nombres de funciones, las SKU de productos, las frases legales y los nombres de personas suelen transmitir la intención del usuario a través de su escritura exacta. BM25 sigue siendo una base sólida, ya que premia a aquellos términos que el usuario escribió realmente.

La recuperación densa mejora el recuerdo cuando los usuarios no conocen el vocabulario exacto. El patrón adecuado no es BM25 ni embeddings. Se debe utilizar BM25 para el recuerdo léxico, embeddings para el recuerdo semántico, y la fusión para combinarlos.

Cuándo añadir un reranker

Se debe añadir un codificador cruzado cuando los documentos relevantes aparezcan en alguna posición de las 50 primeras pero no cerca del inicio de la lista. Ese es el indicador más claro de que la generación de candidatos funciona correctamente y de que el sistema de clasificación necesita ser mejorado.

No se debe incluir un LLM reranker antes de un cross-encoder, a menos que el conjunto de candidatos sea muy reducido. Además, este necesita un criterio de relevancia lo suficientemente preciso como para justificar el costo asociado. LLM reranking pueden ser útiles, pero resultan costosos y más lentos. Es recomendable compararlos con un reranker más económico.

Secuencia de evaluación

  1. Etiquetar un conjunto reducido de consultas reales.
  2. Medir únicamente el índice BM25.
  3. Incorporar la recuperación densa y medir el cambio en la tasa de recuperación.
  4. Añadir la fusión de resultados y medir el nDCG así como la tasa de recuperación @k.
  5. Integrar el codificador cruzado reranking y evaluar la precisión @1 junto con el nDCG.
  6. Incluir LLM reranking solo si su adición mejora la calidad, teniendo en cuenta los costes y la latencia.
  7. Monitorear las métricas en producción: tasa de resultados nulos, tasa de reformulación, tasa de clics, correcciones de respuestas, latencia p95 y costes.

Lectura adicional

Referencias