Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.
Форматы квантизации LLM: GGUF, AWQ, GPTQ, FP8 и NF4
GGUF, AWQ, GPTQ, FP8 и NF4 — это не пять взаимозаменяемых файловых форматов. GGUF — это контейнер модели и формат метаданных, который обычно используется в llama.cpp. AWQ и GPTQ — методы пост-трейнинг квантизации. FP8 — числовой формат, поддерживаемый некоторыми акселераторами и serving-ядрами. NF4 — четырёхбитный тип данных, разработанный для весов с нормальным распределением и широко используемый при обучении с QLoRA.
Сначала выберите рантайм и железо. Затем выберите представление, которое поддерживает зафиксированный рантайм для нужной архитектуры. Прежде чем принимать артефакт меньшего размера, измерьте качество на задачах, потребление памяти, время до первого токена, throughput и поддерживаемую конкурентность.
Последний пересмотр: 2026-08-10. В сравнении приоритет отдан совместимости с рантаймом, аппаратным ядрам, различию между обучением и сервингом, происхождению артефакта, памяти, латентности и измеренной потере качества.
Таблица решений
| Цель | С чего начать | Что проверить перед использованием |
|---|---|---|
| Локальный инференс на CPU, Metal или переносимом llama.cpp | GGUF с документированной квантизацией | Поддержку архитектуры, chat template, поведение контекстного окна, рецепт квантизации и ревизию исходников. |
| Инференс на GPU с калиброванной квантизацией весов | AWQ или GPTQ | Serving-движок, GPU, разрядность, размер группы, ядра и архитектуру модели. |
| Сервинг на поддерживаемом датацентровом GPU | FP8 | Возможности железа, реализацию в рантайме, режим калибровки и качество end-to-end. |
| Параметрически эффективное обучение с замороженными 4-битными весами | NF4 через bitsandbytes | Compute dtype, nested quantization, память оптимизатора и итоговый объединённый или adapter-артефакт. |
| Самый простой прототип на Transformers | bitsandbytes в 8- или 4-битном режиме | Поддержку бэкенда и соответствие прототипного пути production-серверу. |
GGUF не задаёт одну конкретную квантизацию
Расширение .gguf показывает, как упакованы тензоры и метаданные, но не задаёт точность каждого тензора. Такие имена, как Q4_K_M, обозначают рецепты квантизации llama.cpp, причём эти рецепты могут по-разному обрабатывать группы тензоров. Фиксируйте исходный чекпоинт, ревизию конвертера, команду квантизации, матрицу важности, если она использовалась, и хэши.
Для AWQ и GPTQ нужен совместимый serving-путь
Артефакты AWQ и GPTQ обычно используют Safetensors и конфигурацию, специфичную для метода. Модель может успешно скачаться, но при этом перейти на медленное ядро или завершиться ошибкой из-за неподдерживаемой архитектуры. Перед выбором артефакта проверьте актуальную матрицу поддержки Transformers, vLLM или фактической версии сервера.
FP8 и NF4 решают разные задачи
FP8 особенно привлекателен, когда акселератор и serving-стек эффективно его реализуют. NF4 в первую очередь связан с экономичным по памяти обучением адаптеров в пайплайнах в стиле QLoRA. Ни одна из этих меток не гарантирует одинаковые качество, скорость или потребление памяти для разных моделей и типов железа.
Чеклист оценки
- сравнивайте один и тот же исходный чекпоинт и набор промптов
- включайте длинный контекст и конкурентные запросы
- измеряйте корректность JSON Schema и tool call наряду с perplexity
- фиксируйте пиковое потребление памяти на устройстве и хосте
- проверяйте время до первого токена и throughput генерации
- анализируйте редкие или критичные срезы качества
- храните вместе с артефактом лицензию, ревизию исходников, конвертер, рецепт и хэш
Дополнительные материалы
- Руководство по квантизации моделей описывает алгоритмы, калибровку, ядра и компромиссы при деплое.
- Варианты LLM с открытыми весами разделяет назначение чекпоинта, архитектуру, контейнер, квантизацию, рантайм и железо.
- Локальные LLM на macOS показывает применение этих решений на Apple Silicon.