Automatische Übersetzung Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

LLM-Quantization-Formate: GGUF, AWQ, GPTQ, FP8 und NF4

GGUF, AWQ, GPTQ, FP8 und NF4 sind keine fünf austauschbaren Dateiformate. GGUF ist ein Model-Container- und Metadatenformat, das häufig mit llama.cpp verwendet wird. AWQ und GPTQ sind Post-Training-Quantization-Methoden. FP8 ist ein numerisches Format, das von unterstützten Accelerators und Serving-Kernels verwendet wird. NF4 ist ein Four-Bit-Datentyp für normalverteilte Weights und wird häufig für QLoRA-Training eingesetzt.

Wählen Sie zuerst Runtime und Hardware. Wählen Sie anschließend eine Repräsentation, die die festgelegte Runtime für die exakte Architektur unterstützt. Messen Sie Task-Qualität, Speicherbedarf, Time to First Token, Throughput und Concurrency, bevor Sie das kleinere Artefakt akzeptieren.

Letzte Überprüfung: 2026-08-10. Der Vergleich priorisiert Runtime-Kompatibilität, Hardware-Kernels, Training gegenüber Serving, Artefakt-Provenance, Speicher, Latency und gemessenen Qualitätsverlust.

Entscheidungstabelle

ZielBester AusgangspunktVor der Verwendung prüfen
Lokale Inference auf CPU, Metal oder portablem llama.cppGGUF mit dokumentierter QuantizationArchitektur-Support, Chat-Template, Context-Verhalten, Quantization-Rezept und Source-Revision.
GPU-Inference mit kalibrierter Weight-QuantizationAWQ oder GPTQServing-Engine, GPU, Bitbreite, Group Size, Kernels und Model-Architektur.
Serving auf unterstützten Data-Center-GPUsFP8Hardware-Fähigkeiten, Runtime-Implementierung, Calibration-Modus und End-to-End-Qualität.
Parameter-effizientes Training mit eingefrorenen Four-Bit-WeightsNF4 über bitsandbytesCompute-Dtype, Nested Quantization, Optimizer-Speicher und das finale gemergte oder Adapter-Artefakt.
Einfachster Transformers-Prototypbitsandbytes mit 8 Bit oder 4 BitBackend-Support und ob der Prototyping-Pfad zum Production-Server passt.

GGUF legt keine einzelne Quantization fest

Eine .gguf-Extension gibt an, wie Tensors und Metadaten paketiert werden, nicht die Precision jedes einzelnen Tensors. Namen wie Q4_K_M identifizieren llama.cpp-Quantization-Rezepte; diese Rezepte können Tensor-Gruppen unterschiedlich behandeln. Dokumentieren Sie den ursprünglichen Checkpoint, die Conversion-Revision, den Quantization-Befehl, die gegebenenfalls verwendete Importance Matrix und die Hashes.

AWQ und GPTQ benötigen einen passenden Serving-Pfad

AWQ- und GPTQ-Artefakte verwenden üblicherweise Safetensors plus methodenspezifische Konfiguration. Ein Model kann erfolgreich heruntergeladen werden und trotzdem auf einen langsamen Kernel zurückfallen oder wegen einer nicht unterstützten Architektur fehlschlagen. Prüfen Sie vor der Auswahl des Artefakts die aktuelle Support-Matrix für Transformers, vLLM oder die tatsächlich verwendete Server-Version.

FP8 und NF4 lösen unterschiedliche Probleme

FP8 ist attraktiv, wenn der Accelerator und der Serving-Stack das Format effizient implementieren. NF4 wird primär mit speichereffizientem Adapter-Training über QLoRA-ähnliche Workflows verbunden. Keines der beiden Labels garantiert über verschiedene Models und Hardware hinweg dieselbe Qualität, Geschwindigkeit oder Speichernutzung.

Eval-Checkliste

Weiterführende Lektüre

Referenzen