Automatische vertaling Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

LLM-quantizationformaten: GGUF, AWQ, GPTQ, FP8 en NF4

GGUF, AWQ, GPTQ, FP8 en NF4 zijn geen vijf onderling uitwisselbare bestandsformaten. GGUF is een modelcontainer- en metadataformaat dat vaak wordt gebruikt door llama.cpp. AWQ en GPTQ zijn post-training quantization-methoden. FP8 is een numeriek formaat dat wordt gebruikt door ondersteunde accelerators en serving-kernels. NF4 is een datatype van vier bits dat is ontworpen voor normaal verdeelde weights en vaak wordt gebruikt voor QLoRA-training.

Kies eerst de runtime en hardware. Kies vervolgens een representatie die door de vastgelegde runtime voor de exacte architectuur wordt ondersteund. Benchmark taskkwaliteit, geheugen, time to first token, throughput en concurrency voordat je het kleinere artifact accepteert.

Laatst gecontroleerd: 2026-08-10. De vergelijking legt de nadruk op runtimecompatibiliteit, hardware-kernels, training versus serving, artifact-herkomst, geheugen, latency en gemeten kwaliteitsverlies.

Beslissingstabel

DoelBeste startpuntControleren vóór gebruik
Lokale inference op CPU, Metal of draagbare llama.cppGGUF met gedocumenteerde quantizationOndersteuning voor de architectuur, chat template, contextgedrag, quantization-recipe en bronrevisie.
GPU-inference met gekalibreerde weight quantizationAWQ of GPTQDe serving-engine, GPU, bitbreedte, group size, kernels en modelarchitectuur.
Serving op een ondersteunde datacenter-GPUFP8Hardwaremogelijkheden, runtime-implementatie, calibratiemodus en end-to-endkwaliteit.
Parameter-efficiënte training met bevroren 4-bit weightsNF4 via bitsandbytesCompute-dtype, nested quantization, optimizergeheugen en het uiteindelijke merged- of adapter-artifact.
Eenvoudigste Transformers-prototypebitsandbytes 8-bit of 4-bitBackendondersteuning en of het prototypepad overeenkomt met de production server.

GGUF specificeert niet één quantization

Een .gguf-extensie geeft aan hoe tensors en metadata worden verpakt, niet welke precisie elke tensor heeft. Namen zoals Q4_K_M identificeren llama.cpp-quantization-recepten; die recepten kunnen tensor-groepen verschillend behandelen. Leg het oorspronkelijke checkpoint, de conversierevisie, het quantization-commando, de importance matrix indien gebruikt en de hashes vast.

AWQ en GPTQ vereisen een bijpassend servingpad

AWQ- en GPTQ-artifacts gebruiken meestal Safetensors plus methode-specifieke configuratie. Een model kan zonder problemen worden gedownload en toch terugvallen op een trage kernel of mislukken op een niet-ondersteunde architectuur. Controleer de actuele supportmatrix voor Transformers, vLLM of de daadwerkelijke serverversie voordat je het artifact selecteert.

FP8 en NF4 lossen verschillende problemen op

FP8 is aantrekkelijk wanneer de accelerator en serving-stack het efficiënt implementeren. NF4 wordt vooral geassocieerd met geheugenefficiënte adaptertraining via QLoRA-achtige workflows. Geen van beide labels garandeert dezelfde kwaliteit, snelheid of geheugengebruik voor verschillende modellen en hardware.

Evaluatiechecklist

Verdiepende informatie

Referenties