[!NOTE] Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.
Оптимальная стек-архитектура для ранжирования поиска продуктов AI
Хорошая стек-архитектура поиска функционирует аналогично воронке: дешёвые методы сначала собирают широкий набор кандидатов, тогда как дорогостоящие методы затем уточняют результат, оставляя лишь гораздо меньший набор. Проблемы обычно возникают тогда, когда команды заменяют поиск по точному тексту на эмбеддинги вместо того, чтобы объединить оба подхода.
Начните с использования фильтров и метода BM25 — эффективного способа ранжирования на основе точного текста. Для поиска семантических соответствий добавьте технику дense retrieval, после чего объедините полученные списки результатов с помощью метода Reciprocal Rank Fusion (RRF) или аналогичного подхода. Переранжируйте отобранный список с использованием кросс-кодера. Применяйте LLM лишь к крайне небольшому числу итоговых записей, в случаях, когда получаемое повышение качества оправдывает дополнительные затраты в виде латентность.
Рекомендуемый набор технологий
| Этап | По умолчанию | Задача |
|---|---|---|
| Фильтрация | Структурированные фильтры | Обеспечивается контроль за арендаторами, разрешениями, продуктами, языками, временем и доступностью. |
| Лексический retrieval | BM25 | Точные названия, идентификаторы, коды ошибок, юридические термины и высокоточные токены. |
| Плотный retrieval | Эмбеддинги | Синонимы, парафразы, нечеткое формулирование запроса и семантическое воспроизведение. |
| Fьюжн | Слияние рекурсивных рангов или комбинирование взвешенных поисковиков | Сливайте кандидаты с разреженной и плотной структурами, не делая вид, что их оценки взаимозаменяемы. |
| Реранкинг | Кросс-энкодер | Переупорядочить от 20 до 100 кандидатов на основе взаимодействия запроса и документа. |
| Конечная точность | LLM реранкер или ответить на модель | Решение вопросов, связанных с тонкими нюансами релевантности, следует осуществлять лишь после сокращения списка до небольших размеров. |
| Оценка | Recall@k, nDCG, MRR, метки кликов, человеческие метки | Докажите, что каждый этап улучшает предыдущий. |
По умолчанию для сценариев использования
| Поверхность продукта | Хороший стандартный вариант | Почему? |
|---|---|---|
| Поиск документации | алгоритм BM25 плюс эмбеддинги плюс кросс-кодер | Как точные названия API, так и семантические аспекты имеют решающее значение. |
| RAG retrieval | Гибридный retrieval в сочетании с реранкер и проверками цитирования | Отсутствие данных обычно хуже, чем медленная генерация. |
| Поиск продуктов | Лексические фильтры в сочетании с гибридным механизмом retrieval и бизнес-функциями | Доступность, стоимость, популярность и конкретные характеристики играют ключевую роль. |
| Поддержка поиска | Гибридный retrieval в сочетании с информацией о свежести и метаданными тикетов | Как формулировка текста, так и действующая политика имеют одинаковое значение. |
| Внутренняя база знаний | Базовая модель BM25, а затем метод retrieval с использованием журналов запросов | Прежде чем включать затраты на модель, необходимо сначала определить показатели для измерения эффективности. |
| Поиск юридических или регуляторных требований | Лексический базовый уровень в сочетании с строгими фильтрами, за которыми следует тщательное семантическое расширение | Ложноположительные и ложноотрицательные результаты сопряжены с высокими издержками. |
Почему BM25 по‑прежнему имеет место в технической стеке
Эмбеддинги поиск текста с схожим значением, при этом такие методы не гарантируют замены исключительно точных вариантов. Коды ошибок, имена функций, SKU продуктов, юридические формулировки и имена людей зачастую передают первоначальную цель использования именно благодаря своему точному написанию. BM25 остаётся надёжной базовой моделью, поскольку она отдаёт преимущество тем терминам, которые пользователь действительно ввёл.
Подход с высокой плотностью retrieval повышает точность восстановления информации в тех случаях, когда пользователи не знают точного словарного запаса. Подходящими алгоритмами здесь являются не BM25 и эмбеддинги. Для лексического восстановления следует использовать BM25, для семантического — эмбеддинги, а для объединения результатов — метод слияния.
Когда добавлять реранкер
Добавьте кросс-энкодер в тех случаях, когда соответствующие документы присутствуют в первой пятидесятке, но не находятся в её верхней части. Это является наиболее чётким сигналом того, что механизм генерации кандидатов функционирует корректно, а ранжированию требуется дополнительная корректировка.
Не следует использовать LLM реранкер перед кросс-кодером, если набор кандидатов не крайне мал. Кроме того, для такого устройства требуется оценка релевантности, достаточно тонкая, чтобы оправдать связанные с ней затраты. LLM реранкинг могут помочь, однако они дороги и работают медленнее. Сравните их эффективность с более дешёвым реранкер.
Последовательность оценки
- Пометь небольшой набор реальных запросов.
- Оценить эффективность алгоритма BM25 в одиночку.
- Ввести метод retrieval и измерить изменение показателя воспроизведения.
- Применить технику слияния результатов и оценить значения nDCG и Recall@k.
- Использовать кросс-кодер реранкинг и измерить Precision@1 вместе с показателем nDCG.
- Добавить LLM реранкинг только в том случае, если это улучшает качество при соблюдении заданных ограничений по стоимости и при наличии латентность.
- Отслеживать метрики в режиме работы системы: доля запросов без результатов, частота переформулирования запросов, коэффициент кликов, степень коррекции ответов, значение p95 латентность и суммарную стоимость обработки.
Дополнительная литература
- Стек технологий для ранжирования поисковых результатов в 2026 году предоставляет полное пошаговое руководство по реализации. RAG Метрики оценки Поясняется функционирование retrieval и процесс оценки цитат.