Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.

Форматы квантизации LLM: GGUF, AWQ, GPTQ, FP8 и NF4

GGUF, AWQ, GPTQ, FP8 и NF4 — это не пять взаимозаменяемых файловых форматов. GGUF — это контейнер модели и формат метаданных, который обычно используется в llama.cpp. AWQ и GPTQ — методы пост-трейнинг квантизации. FP8 — числовой формат, поддерживаемый некоторыми акселераторами и serving-ядрами. NF4 — четырёхбитный тип данных, разработанный для весов с нормальным распределением и широко используемый при обучении с QLoRA.

Сначала выберите рантайм и железо. Затем выберите представление, которое поддерживает зафиксированный рантайм для нужной архитектуры. Прежде чем принимать артефакт меньшего размера, измерьте качество на задачах, потребление памяти, время до первого токена, throughput и поддерживаемую конкурентность.

Последний пересмотр: 2026-08-10. В сравнении приоритет отдан совместимости с рантаймом, аппаратным ядрам, различию между обучением и сервингом, происхождению артефакта, памяти, латентности и измеренной потере качества.

Таблица решений

ЦельС чего начатьЧто проверить перед использованием
Локальный инференс на CPU, Metal или переносимом llama.cppGGUF с документированной квантизациейПоддержку архитектуры, chat template, поведение контекстного окна, рецепт квантизации и ревизию исходников.
Инференс на GPU с калиброванной квантизацией весовAWQ или GPTQServing-движок, GPU, разрядность, размер группы, ядра и архитектуру модели.
Сервинг на поддерживаемом датацентровом GPUFP8Возможности железа, реализацию в рантайме, режим калибровки и качество end-to-end.
Параметрически эффективное обучение с замороженными 4-битными весамиNF4 через bitsandbytesCompute dtype, nested quantization, память оптимизатора и итоговый объединённый или adapter-артефакт.
Самый простой прототип на Transformersbitsandbytes в 8- или 4-битном режимеПоддержку бэкенда и соответствие прототипного пути production-серверу.

GGUF не задаёт одну конкретную квантизацию

Расширение .gguf показывает, как упакованы тензоры и метаданные, но не задаёт точность каждого тензора. Такие имена, как Q4_K_M, обозначают рецепты квантизации llama.cpp, причём эти рецепты могут по-разному обрабатывать группы тензоров. Фиксируйте исходный чекпоинт, ревизию конвертера, команду квантизации, матрицу важности, если она использовалась, и хэши.

Для AWQ и GPTQ нужен совместимый serving-путь

Артефакты AWQ и GPTQ обычно используют Safetensors и конфигурацию, специфичную для метода. Модель может успешно скачаться, но при этом перейти на медленное ядро или завершиться ошибкой из-за неподдерживаемой архитектуры. Перед выбором артефакта проверьте актуальную матрицу поддержки Transformers, vLLM или фактической версии сервера.

FP8 и NF4 решают разные задачи

FP8 особенно привлекателен, когда акселератор и serving-стек эффективно его реализуют. NF4 в первую очередь связан с экономичным по памяти обучением адаптеров в пайплайнах в стиле QLoRA. Ни одна из этих меток не гарантирует одинаковые качество, скорость или потребление памяти для разных моделей и типов железа.

Чеклист оценки

Дополнительные материалы

Источники