Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.

Formatos de cuantización de LLM: GGUF, AWQ, GPTQ, FP8 y NF4

GGUF, AWQ, GPTQ, FP8 y NF4 no son cinco formatos de archivo intercambiables. GGUF es un contenedor de modelos y un formato de metadatos utilizado habitualmente por llama.cpp. AWQ y GPTQ son métodos de cuantización post-entrenamiento. FP8 es un formato numérico compatible con determinados aceleradores y kernels de serving. NF4 es un tipo de datos de cuatro bits diseñado para pesos con distribución normal y utilizado habitualmente en el entrenamiento con QLoRA.

Elige primero el runtime y el hardware. Después, selecciona una representación compatible con el runtime fijado para la arquitectura concreta. Evalúa la calidad de las tareas, la memoria, el tiempo hasta el primer token, el throughput y la concurrencia antes de aceptar el artefacto más pequeño.

Última revisión: 10-08-2026. La comparación prioriza la compatibilidad con el runtime, los kernels del hardware, el entrenamiento frente al serving, la procedencia del artefacto, la memoria, la latencia y la pérdida de calidad medida.

Tabla de decisión

ObjetivoMejor punto de partidaComprobaciones previas
Inferencia local en CPU, Metal o llama.cpp portableGGUF con una cuantización documentadaCompatibilidad de la arquitectura, chat template, comportamiento del contexto, receta de cuantización y revisión de origen.
Inferencia en GPU con cuantización calibrada de pesosAWQ o GPTQEl motor de serving, la GPU, el número de bits, el group size, los kernels y la arquitectura del modelo.
Serving en GPU de centro de datos compatibleFP8Capacidad del hardware, implementación del runtime, modo de calibración y calidad end-to-end.
Entrenamiento eficiente en parámetros con pesos de 4 bits congeladosNF4 mediante bitsandbytesCompute dtype, cuantización anidada, memoria del optimizador y el artefacto final fusionado o del adapter.
Prototipo más sencillo con Transformersbitsandbytes de 8 o 4 bitsCompatibilidad del backend y si la ruta del prototipo coincide con el servidor de producción.

GGUF no especifica una única cuantización

Una extensión .gguf indica cómo se empaquetan los tensores y los metadatos, no la precisión de cada tensor. Nombres como Q4_K_M identifican recetas de cuantización de llama.cpp, y esas recetas pueden tratar los grupos de tensores de forma diferente. Registra el checkpoint original, la revisión de conversión, el comando de cuantización, la matriz de importancia si se utiliza y los hashes.

AWQ y GPTQ necesitan una ruta de serving compatible

Los artefactos AWQ y GPTQ suelen utilizar Safetensors junto con una configuración específica del método. Un modelo puede descargarse correctamente y aun así recurrir a un kernel lento o fallar con una arquitectura no compatible. Consulta la matriz de compatibilidad actual de Transformers, vLLM o de la versión real del servidor antes de seleccionar el artefacto.

FP8 y NF4 resuelven problemas distintos

FP8 resulta atractivo cuando el acelerador y el stack de serving lo implementan de forma eficiente. NF4 se asocia principalmente al entrenamiento de adapters eficiente en memoria mediante workflows de estilo QLoRA. Ninguna de las dos etiquetas garantiza la misma calidad, velocidad o uso de memoria en todos los modelos y configuraciones de hardware.

Lista de comprobación para la evaluación

Lecturas recomendadas

Referencias