AI-инжиниринг блог

Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.

Для более кратких руководств по принятию решений используйте Быстрые ответы. Приведённый ниже архив предназначен для статей длинной формы.

Все статьи 33

  1. Инженерия моделей · ИИ-инфраструктура

    Руководство по квантизации моделей: от основ до продакшен-сервинга

    Практическое руководство по выбору вариантов квантизации LLM и diffusion-моделей с учётом боттлнека, железа, kernel'а рантайма, калибровочных данных и проверок перед деплоем.

    · 23 мин

  2. ИИ-агенты

    Память ИИ-агента: состояние под управлением схемы и происхождение данных

    Почему production-агентам нужны схемно-управляемая память с временной валидностью, происхождением данных и структурированной обработкой конфликтов, а не recall сырых текстов через vector search.

    · 14 мин

  3. Поисковые и языковые системы

    Гайд по NER на 2026 год: GLiNER, spaCy, Transformers и LLMs

    NER в 2026 году — это выбор между GLiNER, spaCy, Transformers и извлечением с помощью LLM с учётом латентности, точности и контроля схемы.

    · 30 мин

  4. ИИ-агенты Часть 1

    Циклы ризонинга ИИ-агентов: ReAct, ReWOO и Plan-and-Execute

    Сравнение ReAct, ReWOO и Plan-and-Execute для ИИ-агентов. Примеры на LangGraph показывают, как каждый цикл балансирует между адаптивностью, стоимостью, латентностью и структурой планирования.

    · 11 мин

  5. ИИ-агенты · Инженерия моделей

    Ризонинг по схеме: vLLM, XGrammar и Pydantic

    Как Schema-Guided Reasoning использует vLLM, XGrammar, схемы Pydantic и constrained decoding, чтобы гарантировать структурно валидные ответы LLM.

    · 9 мин

  6. Инженерия моделей · ИИ-инфраструктура

    Руководство по сервингу LoRAX: LoRA-адаптеры в Kubernetes в масштабе

    Оценка и деплой LoRAX для сервинга LoRA-адаптеров из длинного хвоста: актуальные API, усиление безопасности Kubernetes-чарта, защита адаптеров, роутинг с учётом кэша и компромиссы по сравнению с vLLM.

    · 9 мин

  7. ИИ-агенты · Инструменты разработчика

    Туториал по MCP-серверу: сборка на Python, uv и FastMCP

    Соберите собственный MCP-сервер с помощью uv и FastMCP, предоставьте инструменты ML-фичестора, протестируйте их локально и подключите сервер к Claude Desktop.

    · 7 мин

  8. Инженерия моделей

    Варианты, форматы и квантизация open-weight LLM

    Как читать названия open-weight-моделей, разделяя роль в обучении, архитектуру, метод квантизации, формат хранения, рантайм и совместимость с аппаратурой.

    · 9 мин

  9. Инструменты разработчика

    Stable Diffusion на macOS: сравнение локальных инструментов для генерации изображений

    Сравнение локальных инструментов для генерации изображений на macOS по установке, поддержке моделей, управлению пайплайнами, воспроизводимости, расширениям и статусу сопровождения.

    · 6 мин

  10. Инженерия моделей · Инструменты разработчика

    Локальные LLM на macOS: Ollama, LM Studio, MLX, llama.cpp

    Сравнение инструментов для локальных LLM на macOS по интерфейсу, формату модели, запасу памяти, доступности API и рабочему процессу разработки под Apple Silicon.

    · 6 мин

  11. Инструменты разработчика

    Файлы запуска Zsh: .zprofile и .zshrc в macOS и Linux

    Разбор файлов запуска Zsh: когда в macOS и Linux загружаются ~/.zprofile и ~/.zshrc, что помещать в каждый файл и как диагностировать режим запущенной оболочки.

    · 4 мин

  12. Инженерия моделей · ИИ-инфраструктура

    Масштабирование LLM с помощью параллелизма на нескольких GPU и узлах

    Как масштабировать большие языковые модели на нескольких GPU и узлах с помощью параллелизма по данным, полностью шардированного, тензорного, конвейерного, контекстного и экспертного параллелизма.

    · 8 мин