Tradução automática Este artigo foi traduzido automaticamente a partir da versão original em inglês.
Formatos de quantização de LLM: GGUF, AWQ, GPTQ, FP8 e NF4
GGUF, AWQ, GPTQ, FP8 e NF4 não são cinco formatos de ficheiro intercambiáveis. GGUF é um formato de contentor e metadados utilizado habitualmente pelo llama.cpp. AWQ e GPTQ são métodos de quantização pós-treino. FP8 é um formato numérico utilizado por aceleradores e kernels de serving compatíveis. NF4 é um tipo de dados de quatro bits concebido para pesos com distribuição normal, utilizado habitualmente no treino com QLoRA.
Escolha primeiro o runtime e o hardware. Em seguida, escolha uma representação compatível com o runtime fixado para a arquitetura exata. Faça benchmark da qualidade da tarefa, memória, tempo até ao primeiro token, throughput e concorrência antes de aceitar o artefacto mais pequeno.
Última revisão: 2026-08-10. A comparação privilegia a compatibilidade com o runtime, os kernels do hardware, treino versus serving, a proveniência do artefacto, a memória, a latência e a perda de qualidade medida.
Tabela de decisão
| Objetivo | Melhor ponto de partida | Verificar antes de utilizar |
|---|---|---|
| Inferência local em CPU, Metal ou llama.cpp portátil | GGUF com uma quantização documentada | Suporte da arquitetura, chat template, comportamento com o contexto, receita de quantização e revisão da origem. |
| Inferência em GPU com quantização calibrada dos pesos | AWQ ou GPTQ | O serving engine, a GPU, a largura em bits, o group size, os kernels e a arquitetura do modelo. |
| Serving em GPU de data center compatível | FP8 | Capacidade do hardware, implementação no runtime, modo de calibração e qualidade end-to-end. |
| Treino eficiente em parâmetros com pesos de 4 bits congelados | NF4 através de bitsandbytes | Compute dtype, nested quantization, memória do optimizer e o artefacto final merged ou do adapter. |
| Protótipo mais simples com Transformers | bitsandbytes em 8 ou 4 bits | Suporte do backend e se o percurso do protótipo corresponde ao servidor de produção. |
GGUF não especifica uma única quantização
Uma extensão .gguf indica como os tensores e os metadados são empacotados, não a precisão de cada tensor. Nomes como Q4_K_M identificam receitas de quantização do llama.cpp, e essas receitas podem tratar os grupos de tensores de forma diferente. Registe o checkpoint original, a revisão da conversão, o comando de quantização, a matriz de importância, se utilizada, e os hashes.
AWQ e GPTQ precisam de um serving path compatível
Os artefactos AWQ e GPTQ utilizam normalmente Safetensors e configuração específica do método. Um modelo pode ser descarregado com sucesso e, ainda assim, recorrer a um kernel lento ou falhar numa arquitetura não suportada. Consulte a matriz de suporte atual do Transformers, vLLM ou da versão efetiva do servidor antes de selecionar o artefacto.
FP8 e NF4 resolvem problemas diferentes
FP8 é uma opção apelativa quando o acelerador e a stack de serving a implementam de forma eficiente. NF4 está sobretudo associado ao treino de adapters eficiente em memória através de workflows ao estilo QLoRA. Nenhuma das etiquetas garante a mesma qualidade, velocidade ou utilização de memória em todos os modelos e hardware.
Lista de verificação da avaliação
- compare o mesmo checkpoint de origem e o mesmo conjunto de prompts
- inclua contexto longo e pedidos concorrentes
- meça a correção do schema e dos tool calls juntamente com a perplexidade
- registe o pico de memória do dispositivo e do host
- verifique o tempo até ao primeiro token e o throughput de saída
- analise slices de qualidade raros ou de custo elevado
- mantenha a licença, a revisão da origem, o conversor, a receita e o hash juntamente com o artefacto
Leitura aprofundada
- Guia de quantização de modelos aborda algoritmos, calibração, kernels e compromissos de deployment.
- Variantes de LLMs com pesos abertos distingue o papel do checkpoint, a arquitetura, o contentor, a quantização, o runtime e o hardware.
- LLMs locais no macOS aplica estas escolhas ao Apple Silicon.