Tradução automática Este artigo foi traduzido automaticamente a partir da versão original em inglês.

Formatos de quantização de LLM: GGUF, AWQ, GPTQ, FP8 e NF4

GGUF, AWQ, GPTQ, FP8 e NF4 não são cinco formatos de ficheiro intercambiáveis. GGUF é um formato de contentor e metadados utilizado habitualmente pelo llama.cpp. AWQ e GPTQ são métodos de quantização pós-treino. FP8 é um formato numérico utilizado por aceleradores e kernels de serving compatíveis. NF4 é um tipo de dados de quatro bits concebido para pesos com distribuição normal, utilizado habitualmente no treino com QLoRA.

Escolha primeiro o runtime e o hardware. Em seguida, escolha uma representação compatível com o runtime fixado para a arquitetura exata. Faça benchmark da qualidade da tarefa, memória, tempo até ao primeiro token, throughput e concorrência antes de aceitar o artefacto mais pequeno.

Última revisão: 2026-08-10. A comparação privilegia a compatibilidade com o runtime, os kernels do hardware, treino versus serving, a proveniência do artefacto, a memória, a latência e a perda de qualidade medida.

Tabela de decisão

ObjetivoMelhor ponto de partidaVerificar antes de utilizar
Inferência local em CPU, Metal ou llama.cpp portátilGGUF com uma quantização documentadaSuporte da arquitetura, chat template, comportamento com o contexto, receita de quantização e revisão da origem.
Inferência em GPU com quantização calibrada dos pesosAWQ ou GPTQO serving engine, a GPU, a largura em bits, o group size, os kernels e a arquitetura do modelo.
Serving em GPU de data center compatívelFP8Capacidade do hardware, implementação no runtime, modo de calibração e qualidade end-to-end.
Treino eficiente em parâmetros com pesos de 4 bits congeladosNF4 através de bitsandbytesCompute dtype, nested quantization, memória do optimizer e o artefacto final merged ou do adapter.
Protótipo mais simples com Transformersbitsandbytes em 8 ou 4 bitsSuporte do backend e se o percurso do protótipo corresponde ao servidor de produção.

GGUF não especifica uma única quantização

Uma extensão .gguf indica como os tensores e os metadados são empacotados, não a precisão de cada tensor. Nomes como Q4_K_M identificam receitas de quantização do llama.cpp, e essas receitas podem tratar os grupos de tensores de forma diferente. Registe o checkpoint original, a revisão da conversão, o comando de quantização, a matriz de importância, se utilizada, e os hashes.

AWQ e GPTQ precisam de um serving path compatível

Os artefactos AWQ e GPTQ utilizam normalmente Safetensors e configuração específica do método. Um modelo pode ser descarregado com sucesso e, ainda assim, recorrer a um kernel lento ou falhar numa arquitetura não suportada. Consulte a matriz de suporte atual do Transformers, vLLM ou da versão efetiva do servidor antes de selecionar o artefacto.

FP8 e NF4 resolvem problemas diferentes

FP8 é uma opção apelativa quando o acelerador e a stack de serving a implementam de forma eficiente. NF4 está sobretudo associado ao treino de adapters eficiente em memória através de workflows ao estilo QLoRA. Nenhuma das etiquetas garante a mesma qualidade, velocidade ou utilização de memória em todos os modelos e hardware.

Lista de verificação da avaliação

Leitura aprofundada

Referências