Work
Системы, эксперименты и доказательства
Избранные публичные работы с проверяемыми источниками, ограниченными утверждениями и явными оговорками. Каждый кейс показывает задачу, границу системы, мой вклад, способ оценки и пределы доказательств.
-
Engineering the Agentic Stack
Задача: Надёжность агентов часто считают вопросом выбора модели, хотя сбои затрагивают reasoning, память, инструменты, разрешения, runtime и контроль выпуска.
Вклад: Я разработал production-архитектуру из шести частей и референсную реализацию Market Analyst Agent, которая связывает эти уровни.
Доказательства: Прочитать серию · Изучить исходный код
Решение: Считать harness и его независимые проверки частью продукта, а затем требовать от каждого добавленного механизма контроля подтверждения его ценности с помощью абляции.
Ограничение: Это референсная система и инженерный метод, а не опубликованный production-бенчмарк.
-
От трейсов к наборам тестов
Задача: Оценка только ответа не замечает пропущенные инструменты, небезопасные аргументы, циклы и преждевременное объявление успеха.
Вклад: Я описал метод превращения трейсов production-агентов в регрессионные тесты и создал запускаемый harness для оценки RAG, охватывающий retrieval, фильтры, реранкинг, генерацию, judges и латентность.
Доказательства: Прочитать метод оценки агентов · Запустить RAG-оценку
Решение: Версионировать трейсы сбоев как тестовые случаи и сочетать детерминированные проверки траекторий с откалиброванными judges только там, где требуется интерпретация.
Ограничение: Публичный оценщик использует SciFact и ограниченные примеры; его результаты нельзя автоматически переносить на другой корпус или модель.
-
TypeScript Agent Service
Задача: Python ML-инженерам нужно выпускать и проверять production-подобные TypeScript-сервисы агентов, не изучая backend engineering с нуля.
Вклад: Я создал pnpm-монорепозиторий со streaming API на Hono, валидированным циклом инструментов, хранилищем Drizzle, worker, MCP-сервером, observability и 40 тестами.
Доказательства: Прочитать руководство по реализации · Изучить исходный код
Решение: Сопоставить знакомые границы сервисов — Pydantic, FastAPI, очереди, хранилище — с их эквивалентами в TypeScript, сохраняя строгие схемы на каждой границе инструмента.
Ограничение: Это локальный референсный сервис, а не размещённый продукт или утверждение о системе конкретного работодателя.
-
Стек поискового ранжирования
Задача: Retrieval-стеки скрывают, какой этап повышает релевантность, а какой лишь увеличивает стоимость.
Вклад: Я создал пятиэтапную демонстрацию с BM25, dense retrieval, reciprocal rank fusion, реранкингом cross-encoder и listwise-ранжированием LLM на выборке данных Amazon ESCI.
Доказательства: Прочитать поэтапный анализ · Запустить исходный код
Решение: Измерять каждый этап отдельно и сохранять его только тогда, когда прирост релевантности оправдывает латентность и операционные затраты.
Ограничение: Корпус представляет собой выборку, а устаревшая строка LLM в статье явно помечена как не являющаяся доказательством.
Изучите доказательства напрямую: запустите лабораторную работу или просмотрите Blog по темам агентных систем, retrieval и языковых систем или model engineering.