[!NOTE] Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.

Варианты Open-Вес LLM, Квантизация и форматы: Instruct, MoE, GGUF, GPTQ и AWQ

Такие названия, как Model-32B-A3B-Instruct-AWQ кажутся сложными из-за того, что в них объединяется несколько независимых факторов: состав семьи и её размер, архитектура, роль обучения и квантизация. Репозиторий может упаковывать такие веса в виде разделённых Safetensors, в то время как результат коммунальной обработки того же чекпоинт представляет собой Q4_K_M.gguf.

У этих меток нет общей категории: GPTQ и AWQ являются квантизация-методами, GGUF представляет собой контейнер, а рантайм — экосистему; кроме того, MoE относится к архитектуре. Рассматривая слои по отдельности, гораздо проще сделать выбор при загрузке.

Кратко. Сначала выбирается чекпоинт в зависимости от качества задачи, лицензии, языка, контекста и поведения интерфейса. Затем подбирается рантайм, совместимый с архитектурой этого решения. Только после этого определяются формат представления вес и способы хранения квантизация, которые укладываются в ограничения по объёму памяти и латентность. GPTQ и AWQ представляют собой квантизация методы, Safetensors и GGUF — контейнеры, а MoE — это архитектурная концепция, которая не гарантирует, что все веса поместятся в память, отведённую для «активных параметров».

Чтение артефакта модель в шести уровнях

Шесть независимых слоёв в артефакте с открытой структурой вес модель

Слоёвая структураПример
Семейство и ревизияModel-3.1, хеш коммитаКакой контракт веса и токенизатор?
Роль обученияBase, Instruct, ризонинг-отрегулированные, дистиллированныеКакое поведение было оптимизировано?
АрхитектураПлотные MoE общие и активные параметрыКакие ядра и структура памяти требуются?
Числовое представлениеBF16, FP8, GPTQ — 4-битные, AWQ — 4-битныйКак представляются или квантируются тензоры?
Контейнер и макетшарды Safetensors, GGUFКак упаковываются тензоры и метаданные?
РантаймTransformers, vLLM, llama.cppКакой загрузчик и какой путь аппаратного обеспечения его запускают?

Эти слои не являются взаимоисключающими. Модель чекпоинт может быть апроксимирована, отрегулирована с учётом инструкций, настроена с использованием ризонинг и одновременно пройти процедуру MoE.

«Открытый исходный код» также требует особого внимания. Многие загружаемые файлы модели являются открытыми-вес, однако они распространяются под лицензиями, которые не соответствуют определению открытого исходного кода или налагают определённые ограничения на их использование. Перед разработкой архитектуры или проведением сравнений бенчмарк обязательно ознакомьтесь с информацией, указанной на карточке модель, а также с условиями лицензии.

Метки ролей обучения описывают поведение, а не гарантии функциональных возможностей

База

База чекпоинт обучается в первую очередь для прогнозирования следующего токен. Она полезна для продолжения претрейнинг, проведения контролируемых исследований или адаптации в ситуациях, когда необходимо полностью контролировать поведение модели при выполнении заданий. В таких случаях она может выполнять промпт вместо того, чтобы просто ответить на запрос.

Не стоит считать, что для каждой настройки по тонкой настройке обязательно требуется начинать с исходной версии модели. Использование инструкции чекпоинт может стать более эффективным способом инициализации, если её текущее поведение соответствует целям проекта, а результаты оценки подтверждают отсутствие конфликтов с новой задачей.

Указания или чат

Эти чекпоинты получают пост-трейнинг с целью улучшения следования инструкциям и ведения диалогов. Конкретная технологическая схема может включать контролируемый файн-тюнинг, оптимизацию предпочтений, методы обучения с подкреплением, процесс дистилляции или их комбинации — не обязательно классический SFT в сочетании с RLHF.

Используйте инструкцию чекпоинт в качестве базового параметра для первого ассистента. Проверьте его шаблон чата, поддерживаемый формат вызова инструментов, поведение системных сообщений и правила отказа. Одной лишь фразы «Инструктируйте» недостаточно для обеспечения надёжной работы JSON или tool use.

Ризонинг-настроенный

Ризонинг-ориентированный чекпоинты Оптимизированы для задач или траекторий, в которых вознаграждается решение проблем многих шагов. Некоторые из них позволяют ризонинг текст, его можно разделить с помощью сервинг парсер, причём некоторые из них возвращают лишь ответ. Более длительная генерация не гарантирует точности результата. ризонинг или меньше галлюцинации.

Применяйте такой подход в тех случаях, когда он способствует улучшению критически важных результатов после учёта параметров выхода токены, латентность и процедур верификации. В противном случае обычные операции извлечения данных или их классификации могут замедлиться, даже если качество результата не улучшится.

Очищенный

Процесс дистилляции позволяет перенести характеристики поведения от «учителя» или данных, сгенерированных им, на другой модель. «Ученик» может быть меньшего размера, такого же размера или иметь иную структуру. Не существует фиксированного правила вида «70–80% качества при половинном размере»: уровень сохранённого качества зависит от «учителя», данных, поставленной цели, возможностей «ученика» и методов оценки.

обрабатывать Distill В качестве информации об источнике обучения бенчмарк рассматривается так же, как и любой другой чекпоинт.

Метки архитектуры описывают процесс выполнения

Плотная модели

Большинство параметров участвуют в процессе прямой обработки каждого токен. Количество параметров служит приблизительным показателем объёма хранилища вес, однако память рантайм также включает в себя ресурсы, занимаемые KV cache и активации, а также рабочее пространство, накладные расходы аллокатора, при этом иногда возникает дублирование данных или их разделение на части.

Смешивание экспертов

Слой MoE направляет каждый токен в подмножество экспертных сетей с прямым прохождением сигнала. Названия вроде A3B Как правило, это означает, что активно работает примерно три миллиарда параметров для каждого токен, однако конвенции именования варьируются в зависимости от семейства. Чтобы узнать общее количество параметров, активных параметрах, количестве экспертов и особенностях проектирования роутинг, ознакомьтесь с соответствующей карточкой модель.

Активные параметры в основном относятся к вычислительным процессам. Если только рантайм не переносит работу экспертов на внешние ресурсы, все экспертные модели веса по‑прежнему требуют памяти для хранения данных, причём обычно это оперативная память устройств, расположенных в рамках сервинг топологии. Модель объёмом 30 миллиардов элементов, из которых 3 миллиарда являются активными, модель, не всегда может быть реализована в виде компактной структуры объёмом 3 миллиарда элементов типа модель.

Поддержка Рантайм также определяется архитектурой устройства. Перед загрузкой необходимо убедиться в наличии реализации модель — поддержки модели expert-parallel или tensor-parallel, использовании квантизация ядер, а также в максимальном размере контекста.

Контейнеры и квантизация представляют собой разные уровни организации данных

Safetensors

Safetensors — это формат безопасной сериализации тензоров, широко используемый в репозиториях Hugging Face. Один модель может содержать несколько .safetensors фрагменты данных вместе с конфигурацией, токенизатор, и файлами генерации. Эти тензоры могут быть BF16/FP16 или предварительно квантизированы с использованием таких методов, как GPTQ или AWQ.

Одного лишь расширения недостаточно для определения точности или совместимости с рантайм. Необходимо провести проверку. config.json, конфигурация квантизация, карта модель, тип данных тензора и документация рантайм.

GGUF

GGUF Пакеты, содержащие тензоры и метаданные для экосистемы ggml/llama.cpp. llama.cpp Для работы требуется GGUF, а также поддержка бэкенды, включая форматы Metal, CUDA, HIP, Vulkan и пути типа CPU. Совместимость по‑прежнему определяется архитектурой Модель и качеством преобразования данных.

GGUF представляет собой контейнер, способный хранить тензоры высокой точности или квантизированные версии таких тензоров. Для обработки мультимодальных данных модели также может потребоваться отдельный файл проектора или кодека; правило «один файл GGUF содержит всё необходимое» не является универсальным.

GPTQ и AWQ

GPTQ и AWQ представляют собой пост-трейнинг вес-квантизация методы, а не расширения файлов. Генерируемые ими результаты обычно хранятся в формате Safetensors вместе с конфигурацией, специфичной для данного метода. Для работы с такими Сервинг движками требуются ядра, совместимые с используемым методом, шириной бита, размером группы, модель архитектурой и типом оборудования.

Ни один из этих методов не является универсальным решением для обеспечения высокого качества. Калибровочные данные, способ реализации, путь в ядре и тип задач играют ключевую роль. Текущие трансформаторы, TGI и vLLM поддерживают несколько квантизация бэкенды, однако их матрицы могут меняться; следует проверять фиксированные рантайм, а не полагаться на статические таблицы из блогов.

Квантизация математическое выражение представляет собой нижнюю границу, а не максимальную пропускную способность планирование

Для параметров (P) вес с разрядностью (b) битов объём необработанного хранилища вес составляет примерно:

[ \text{вес байт} \approx \frac{P \times b}{8} ]

13-миллиардный модель модель при номинальной четырёхбитной глубине веса начинает работу примерно с объёма памяти 6,5 ГБ. Однако фактическое потребление памяти не обязательно будет равно 6,5 ГБ. Увеличение размера шкал, использование нулевых точек, тензоры более высокой точности, эмбеддинги, метаданные, рантайм буферы, KV cache, а также фрагментация приводят к дополнительному расходу памяти.

Контекст и конкурентность в значительной степени определяют разницу между показателями «нагрузки» и «обрабатываемых запросов». Для оценки максимального объёма памяти необходимо использовать реальную последовательность операций, политику обработки пакетов, тип данных кэш и уровень параллелизма.

Квантизация позволяет сократить объём памяти и иногда повысить скорость работы, однако ядра с низким количеством битов могут работать медленнее на оборудовании, не поддерживающем такую архитектуру. Необходимо оценивать качество выполнения задачи и результаты полного цикла обработки throughput, а не только размер файла.

Тщательно декодируйте имена GGUF квантизация

В Q4_K_M:

Текущий llama.cpp Документация к квантизация указывает на то, что схемы обработки данных могут отличаться в зависимости от архитектуры и категории тензоров. Матрица значимости также может помочь определить, какие веса следует сохранять для обеспечения более высокой точности.

Избегайте общих утверждений, которые не имеют конкретных доказательств. Q4_K_M невозможно отличить от BF16, либо то, что более крупный Q3 модель всегда превосходит меньший Q8 модель. Для получения точного значения чекпоинт следует использовать небольшую лестницу:

  1. артефакт высокой точности или надёжный эталонный образец
  2. один кандидат, близкий к пределу памяти
  3. один более мелкий кандидат с большим запасом памяти

Запустите на всех трёх вариантах те же проверки структурированного вывода промпты, тесты на работы с длинными контекстами и тесты латентность.

Процесс отбора, совместимый с новыми форматами

процесс выбора Чекпоинт, рантайм и квантизация

1. Исправить контракт задачи

Определите язык, модальность, длину контекста, интерфейс инструмента или схемы, ограничения безопасности, требования к лицензированию и сегменты оценки. Сравните чекпоинты в таком представлении, которое будет достаточно точным, чтобы избежать принятия решения на первом этапе со стороны квантизация.

2. Выберите чекпоинт

Выберите наименьший чекпоинт, который позволяет пройти обязательные проверки качества и поведения. Запишите точный адрес репозитория и версию, токенизатор, шаблон чата, а также любой необходимый парсер ризонинг.

3. Выберите рантайм

Проверьте поддержку архитектуры, аппаратного обеспечения бэкенд, возможности параллелизма, ядер квантизация, structured output, адаптеров и интерфейса управления. Что касается локальных GGUF инференс, llama.cpp этот источник — рантайм. Что касается GPU сервинг, необходимо сравнить текущие решения на основе vLLM, TGI, Transformerов или специализированных движков с фактическим результатом работы артефакта.

4. Определение умеренного бюджета памяти

Необходимо учитывать веса, KV cache, рантайм рабочего пространства, ожидаемую конкурентность, а также запас мощностей для операционной системы или расположенных рядом процессов. Достаточно лишь наличия файла, который помещается в ОЗУ или VRAM, но этого недостаточно для эффективной работы.

5. Выбор и проверка представления данных

Предпочтение следует отдавать artefaktам, предоставленным издателем и сопровождаемым документацией калибровка и происхождение. При использовании общедоступного инструмента конвертации необходимо задокументировать версию исходного кода и версию самого конвертера. квантизация рецепт калибровка или данные о важности, а также хэши.

6. Бенчмарк единица релиза

Оценивайте качество выполнения задачи, корректность схемы и вызовов инструментов, время до первого токен, результаты throughput, максимальное потребление памяти, а также количество сбоев в указанных условиях контекста и параллельности. Проводите повторную оценку после изменения любых настроек чекпоинт, рантайм, ядра или квантизация.

Рабочее название

Предположим, что репозиторий называется:

Acme-32B-A3B-Instruct-AWQ

Прочитайте это как набор вопросов:

Это название является индексом в документации, а не полным описанием деплой.

Заключение

Выбор Модель становится менее запутанным, когда метки больше не объединяются в одну группу. Роль обучения указывает на то, какое поведение было оптимизировано. Архитектура показывает, как организованы вычисления. Квантизация информирует о способах аппроксимации некоторых тензоров. Контейнеры отвечают за хранение результатов обработки. Рантаймы определяют, что будет выполняться с максимальной эффективностью на вашем оборудовании.

Выбирайте в таком порядке, сохраняйте исходную привязку данных, и пусть одна из процедур оценки сравнит результаты сборки. Наличие знакомого суффикса не является доказательством того, что модель соответствует требованиям, работает быстро или сохраняет необходимое поведение.

Список литературы