Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Formatos de cuantización de LLM: GGUF, AWQ, GPTQ, FP8 y NF4
GGUF, AWQ, GPTQ, FP8 y NF4 no son cinco formatos de archivo intercambiables. GGUF es un contenedor de modelos y un formato de metadatos utilizado habitualmente por llama.cpp. AWQ y GPTQ son métodos de cuantización post-entrenamiento. FP8 es un formato numérico compatible con determinados aceleradores y kernels de serving. NF4 es un tipo de datos de cuatro bits diseñado para pesos con distribución normal y utilizado habitualmente en el entrenamiento con QLoRA.
Elige primero el runtime y el hardware. Después, selecciona una representación compatible con el runtime fijado para la arquitectura concreta. Evalúa la calidad de las tareas, la memoria, el tiempo hasta el primer token, el throughput y la concurrencia antes de aceptar el artefacto más pequeño.
Última revisión: 10-08-2026. La comparación prioriza la compatibilidad con el runtime, los kernels del hardware, el entrenamiento frente al serving, la procedencia del artefacto, la memoria, la latencia y la pérdida de calidad medida.
Tabla de decisión
| Objetivo | Mejor punto de partida | Comprobaciones previas |
|---|---|---|
| Inferencia local en CPU, Metal o llama.cpp portable | GGUF con una cuantización documentada | Compatibilidad de la arquitectura, chat template, comportamiento del contexto, receta de cuantización y revisión de origen. |
| Inferencia en GPU con cuantización calibrada de pesos | AWQ o GPTQ | El motor de serving, la GPU, el número de bits, el group size, los kernels y la arquitectura del modelo. |
| Serving en GPU de centro de datos compatible | FP8 | Capacidad del hardware, implementación del runtime, modo de calibración y calidad end-to-end. |
| Entrenamiento eficiente en parámetros con pesos de 4 bits congelados | NF4 mediante bitsandbytes | Compute dtype, cuantización anidada, memoria del optimizador y el artefacto final fusionado o del adapter. |
| Prototipo más sencillo con Transformers | bitsandbytes de 8 o 4 bits | Compatibilidad del backend y si la ruta del prototipo coincide con el servidor de producción. |
GGUF no especifica una única cuantización
Una extensión .gguf indica cómo se empaquetan los tensores y los metadatos, no la precisión de cada tensor. Nombres como Q4_K_M identifican recetas de cuantización de llama.cpp, y esas recetas pueden tratar los grupos de tensores de forma diferente. Registra el checkpoint original, la revisión de conversión, el comando de cuantización, la matriz de importancia si se utiliza y los hashes.
AWQ y GPTQ necesitan una ruta de serving compatible
Los artefactos AWQ y GPTQ suelen utilizar Safetensors junto con una configuración específica del método. Un modelo puede descargarse correctamente y aun así recurrir a un kernel lento o fallar con una arquitectura no compatible. Consulta la matriz de compatibilidad actual de Transformers, vLLM o de la versión real del servidor antes de seleccionar el artefacto.
FP8 y NF4 resuelven problemas distintos
FP8 resulta atractivo cuando el acelerador y el stack de serving lo implementan de forma eficiente. NF4 se asocia principalmente al entrenamiento de adapters eficiente en memoria mediante workflows de estilo QLoRA. Ninguna de las dos etiquetas garantiza la misma calidad, velocidad o uso de memoria en todos los modelos y configuraciones de hardware.
Lista de comprobación para la evaluación
- compara el mismo checkpoint de origen y el mismo conjunto de prompts
- incluye contextos largos y peticiones concurrentes
- mide la corrección del schema y de los tool calls junto con la perplexity
- registra el pico de memoria del dispositivo y del host
- verifica el tiempo hasta el primer token y el throughput de salida
- examina los segmentos de calidad poco frecuentes o de alto coste
- conserva la licencia, la revisión de origen, el conversor, la receta y el hash junto con el artefacto
Lecturas recomendadas
- Guía de cuantización de modelos cubre algoritmos, calibración, kernels y compromisos de despliegue.
- Variantes de LLMs open-weight separa el papel del checkpoint, la arquitectura, el contenedor, la cuantización, el runtime y el hardware.
- LLMs locales en macOS aplica estas decisiones a Apple Silicon.