Automatische vertaling Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
LLM-quantizationformaten: GGUF, AWQ, GPTQ, FP8 en NF4
GGUF, AWQ, GPTQ, FP8 en NF4 zijn geen vijf onderling uitwisselbare bestandsformaten. GGUF is een modelcontainer- en metadataformaat dat vaak wordt gebruikt door llama.cpp. AWQ en GPTQ zijn post-training quantization-methoden. FP8 is een numeriek formaat dat wordt gebruikt door ondersteunde accelerators en serving-kernels. NF4 is een datatype van vier bits dat is ontworpen voor normaal verdeelde weights en vaak wordt gebruikt voor QLoRA-training.
Kies eerst de runtime en hardware. Kies vervolgens een representatie die door de vastgelegde runtime voor de exacte architectuur wordt ondersteund. Benchmark taskkwaliteit, geheugen, time to first token, throughput en concurrency voordat je het kleinere artifact accepteert.
Laatst gecontroleerd: 2026-08-10. De vergelijking legt de nadruk op runtimecompatibiliteit, hardware-kernels, training versus serving, artifact-herkomst, geheugen, latency en gemeten kwaliteitsverlies.
Beslissingstabel
| Doel | Beste startpunt | Controleren vóór gebruik |
|---|---|---|
| Lokale inference op CPU, Metal of draagbare llama.cpp | GGUF met gedocumenteerde quantization | Ondersteuning voor de architectuur, chat template, contextgedrag, quantization-recipe en bronrevisie. |
| GPU-inference met gekalibreerde weight quantization | AWQ of GPTQ | De serving-engine, GPU, bitbreedte, group size, kernels en modelarchitectuur. |
| Serving op een ondersteunde datacenter-GPU | FP8 | Hardwaremogelijkheden, runtime-implementatie, calibratiemodus en end-to-endkwaliteit. |
| Parameter-efficiënte training met bevroren 4-bit weights | NF4 via bitsandbytes | Compute-dtype, nested quantization, optimizergeheugen en het uiteindelijke merged- of adapter-artifact. |
| Eenvoudigste Transformers-prototype | bitsandbytes 8-bit of 4-bit | Backendondersteuning en of het prototypepad overeenkomt met de production server. |
GGUF specificeert niet één quantization
Een .gguf-extensie geeft aan hoe tensors en metadata worden verpakt, niet welke precisie elke tensor heeft. Namen zoals Q4_K_M identificeren llama.cpp-quantization-recepten; die recepten kunnen tensor-groepen verschillend behandelen. Leg het oorspronkelijke checkpoint, de conversierevisie, het quantization-commando, de importance matrix indien gebruikt en de hashes vast.
AWQ en GPTQ vereisen een bijpassend servingpad
AWQ- en GPTQ-artifacts gebruiken meestal Safetensors plus methode-specifieke configuratie. Een model kan zonder problemen worden gedownload en toch terugvallen op een trage kernel of mislukken op een niet-ondersteunde architectuur. Controleer de actuele supportmatrix voor Transformers, vLLM of de daadwerkelijke serverversie voordat je het artifact selecteert.
FP8 en NF4 lossen verschillende problemen op
FP8 is aantrekkelijk wanneer de accelerator en serving-stack het efficiënt implementeren. NF4 wordt vooral geassocieerd met geheugenefficiënte adaptertraining via QLoRA-achtige workflows. Geen van beide labels garandeert dezelfde kwaliteit, snelheid of geheugengebruik voor verschillende modellen en hardware.
Evaluatiechecklist
- vergelijk hetzelfde source checkpoint en dezelfde promptset
- neem long-context- en concurrent requests op
- meet schema- en tool-call-correctheid naast perplexity
- registreer het piekgeheugen op device en host
- verifieer time to first token en output-throughput
- inspecteer zeldzame of kostbare quality slices
- bewaar licentie, bronrevisie, converter, recipe en hash bij het artifact
Verdiepende informatie
- Model Quantization Guide behandelt algoritmen, calibration, kernels en trade-offs bij deployment.
- Open-Weight LLM Variants maakt onderscheid tussen checkpointrol, architectuur, container, quantization, runtime en hardware.
- Local LLMs on macOS past deze keuzes toe op Apple Silicon.