Traduction automatique Cet article a été traduit automatiquement depuis la version originale en anglais.
Formats de quantification des LLM : GGUF, AWQ, GPTQ, FP8 et NF4
GGUF, AWQ, GPTQ, FP8 et NF4 ne sont pas cinq formats de fichiers interchangeables. GGUF est un conteneur de modèle et un format de métadonnées couramment utilisé par llama.cpp. AWQ et GPTQ sont des méthodes de quantification post-entraînement. FP8 est un format numérique pris en charge par certains accélérateurs et kernels de serving. NF4 est un type de données sur quatre bits conçu pour des poids suivant une distribution normale et couramment utilisé pour l’entraînement QLoRA.
Choisissez d’abord le runtime et le matériel. Sélectionnez ensuite une représentation prise en charge par le runtime retenu pour l’architecture exacte. Évaluez la qualité sur les tâches, la mémoire, le time to first token, le débit et la concurrence avant d’accepter l’artefact plus compact.
Dernière révision : 2026-08-10. La comparaison privilégie la compatibilité avec le runtime, les kernels matériels, l’entraînement par rapport au serving, la provenance de l’artefact, la mémoire, la latence et la perte de qualité mesurée.
Tableau de décision
| Objectif | Point de départ recommandé | Vérifications préalables |
|---|---|---|
| Inférence locale sur CPU, Metal ou llama.cpp portable | GGUF avec une quantification documentée | Prise en charge de l’architecture, chat template, comportement du contexte, recette de quantification et révision de la source. |
| Inférence sur GPU avec quantification calibrée des poids | AWQ ou GPTQ | Moteur de serving, GPU, largeur en bits, taille des groupes, kernels et architecture du modèle. |
| Serving sur GPU de datacenter compatible | FP8 | Capacités du matériel, implémentation du runtime, mode de calibration et qualité de bout en bout. |
| Entraînement parameter-efficient avec poids 4-bit gelés | NF4 via bitsandbytes | Compute dtype, quantification imbriquée, mémoire de l’optimizer et artefact final fusionné ou issu de l’adapter. |
| Prototype Transformers le plus simple | bitsandbytes en 8-bit ou 4-bit | Prise en charge du backend et adéquation entre le chemin du prototype et le serveur de production. |
GGUF ne définit pas une quantification unique
Une extension .gguf indique comment les tenseurs et les métadonnées sont empaquetés, et non la précision de chaque tenseur. Des noms tels que Q4_K_M identifient des recettes de quantification de llama.cpp, qui peuvent appliquer des traitements différents selon les groupes de tenseurs. Consignez le checkpoint d’origine, la révision de conversion, la commande de quantification, la matrice d’importance le cas échéant, ainsi que les hashes.
AWQ et GPTQ nécessitent un chemin de serving compatible
Les artefacts AWQ et GPTQ utilisent généralement Safetensors ainsi qu’une configuration propre à la méthode. Un modèle peut être téléchargé correctement tout en basculant vers un kernel lent ou en échouant sur une architecture non prise en charge. Consultez la matrice de compatibilité actuelle de Transformers, vLLM ou de la version réelle du serveur avant de sélectionner l’artefact.
FP8 et NF4 répondent à des besoins différents
FP8 est intéressant lorsque l’accélérateur et la stack de serving l’implémentent efficacement. NF4 est principalement associé à l’entraînement d’adapters économe en mémoire dans des workflows de type QLoRA. Aucun de ces labels ne garantit la même qualité, la même vitesse ou la même consommation mémoire d’un modèle ou d’un matériel à l’autre.
Checklist d’évaluation
- comparer le même checkpoint source et le même jeu de prompts
- inclure les contextes longs et les requêtes concurrentes
- mesurer la correction du JSON Schema et des tool calls en parallèle de la perplexité
- relever la mémoire maximale du device et de l’hôte
- vérifier le time to first token et le débit de génération
- examiner les segments de qualité rares ou à coût élevé
- conserver la licence, la révision de la source, le convertisseur, la recette et le hash avec l’artefact
Pour approfondir
- Le Guide de la quantification des modèles couvre les algorithmes, la calibration, les kernels et les compromis de déploiement.
- Variantes de LLMs à poids ouverts distingue le rôle du checkpoint, l’architecture, le conteneur, la quantification, le runtime et le matériel.
- LLMs locaux sur macOS applique ces choix aux Apple Silicon.