Work

Системы, эксперименты и доказательства

Избранные публичные работы с проверяемыми источниками, ограниченными утверждениями и явными оговорками. Каждый кейс показывает задачу, границу системы, мой вклад, способ оценки и пределы доказательств.

  • Engineering the Agentic Stack

    Задача: Надёжность агентов часто считают вопросом выбора модели, хотя сбои затрагивают reasoning, память, инструменты, разрешения, runtime и контроль выпуска.

    Вклад: Я разработал production-архитектуру из шести частей и референсную реализацию Market Analyst Agent, которая связывает эти уровни.

    Доказательства: Прочитать серию · Изучить исходный код

    Решение: Считать harness и его независимые проверки частью продукта, а затем требовать от каждого добавленного механизма контроля подтверждения его ценности с помощью абляции.

    Ограничение: Это референсная система и инженерный метод, а не опубликованный production-бенчмарк.

  • От трейсов к наборам тестов

    Задача: Оценка только ответа не замечает пропущенные инструменты, небезопасные аргументы, циклы и преждевременное объявление успеха.

    Вклад: Я описал метод превращения трейсов production-агентов в регрессионные тесты и создал запускаемый harness для оценки RAG, охватывающий retrieval, фильтры, реранкинг, генерацию, judges и латентность.

    Доказательства: Прочитать метод оценки агентов · Запустить RAG-оценку

    Решение: Версионировать трейсы сбоев как тестовые случаи и сочетать детерминированные проверки траекторий с откалиброванными judges только там, где требуется интерпретация.

    Ограничение: Публичный оценщик использует SciFact и ограниченные примеры; его результаты нельзя автоматически переносить на другой корпус или модель.

  • TypeScript Agent Service

    Задача: Python ML-инженерам нужно выпускать и проверять production-подобные TypeScript-сервисы агентов, не изучая backend engineering с нуля.

    Вклад: Я создал pnpm-монорепозиторий со streaming API на Hono, валидированным циклом инструментов, хранилищем Drizzle, worker, MCP-сервером, observability и 40 тестами.

    Доказательства: Прочитать руководство по реализации · Изучить исходный код

    Решение: Сопоставить знакомые границы сервисов — Pydantic, FastAPI, очереди, хранилище — с их эквивалентами в TypeScript, сохраняя строгие схемы на каждой границе инструмента.

    Ограничение: Это локальный референсный сервис, а не размещённый продукт или утверждение о системе конкретного работодателя.

  • Стек поискового ранжирования

    Задача: Retrieval-стеки скрывают, какой этап повышает релевантность, а какой лишь увеличивает стоимость.

    Вклад: Я создал пятиэтапную демонстрацию с BM25, dense retrieval, reciprocal rank fusion, реранкингом cross-encoder и listwise-ранжированием LLM на выборке данных Amazon ESCI.

    Доказательства: Прочитать поэтапный анализ · Запустить исходный код

    Решение: Измерять каждый этап отдельно и сохранять его только тогда, когда прирост релевантности оправдывает латентность и операционные затраты.

    Ограничение: Корпус представляет собой выборку, а устаревшая строка LLM в статье явно помечена как не являющаяся доказательством.

Изучите доказательства напрямую: запустите лабораторную работу или просмотрите Blog по темам агентных систем, retrieval и языковых систем или model engineering.