La cuantización reduce un modelo guardando sus pesos con menos bits. Un modelo de 27 000 millones de parámetros ocupa 27 GB en Q8_0 y 16 GB en Q4_K_M: la diferencia entre caber o no en una tarjeta gráfica de 32 GB. Todas las guías dicen que el archivo más pequeño escribe un poco peor. Medimos cuánto, en español, con los mismos duelos a ciegas que construyen la clasificación principal. Las puntuaciones son las de la clasificación en español: 50 equivale a una probabilidad de una entre dos de superar al modelo medio. Los tamaños son los de los archivos GGUF; las velocidades, medianas medidas en nuestra máquina Strix Halo, tokens de razonamiento incluidos.

El mismo modelo, tres archivos, tres puntuaciones

Familia Cuantización Puntuación Archivo (GB) Velocidad (tok/s) Duelos
Qwen3.8 27B Q8_0 70,7 27,1 8,4 1150
Q6_K 62,2 20,9 7,0 1169
Q4_K_M 43,5 15,7 8,9 1025
Qwen3.6 27B Q8_0 46,9 26,6 7,5 1014
Q4_K_M 44,9 15,4 5,2 1152
Qwen3.6 35B A3B Q4_K_M 46,5 19,7 26,6 1671
Q8_0 41,1 34,4 22,1 1553
Gemma 4 31B Q8_0 67,2 30,4 4,8 1743
Q6_K 61,6 23,5 5,8 1166
QAT-Q4_0 58,7 16,4 10,0 1796
Gemma 4 26B A4B QAT-Q4_0 62,8 13,4 27,9 1876
Q6_K 56,4 21,1 20,2 1185
Q8_0 56,4 25,0 39,8 1616
Gemma 4 12B Q8_0 49,7 11,8 14,6 1590
QAT-Q4_0 42,7 6,5 11,0 1651
Q6_K 42,5 9,1 9,0 1077
Muse Glimmer 30B K-Quant 17GB (≈ Q4) 63,0 15,6 8,8 1535
K-Quant Dynamic (≈ Q5) 56,4 18,3 8,0 1471
Granite 4.2 30B Q6_K 12,9 22,4 6,6 931
Q8_0 8,8 29,0 4,9 1018
Q4_K_M 8,0 16,5 7,6 1013
Nemotron 3 Nano Omni 30B A3B Q4_K_M 8,0 22,8 25,1 1454
Q8_0 6,2 31,3 21,2 1013

Donde la cuantización sale gratis

Gemma 4 26B A4B es la sorpresa: su QAT-Q4_0 de 13 GB supera en seis puntos al Q8_0 de 25 GB, con más de 1 600 duelos cada uno, y es además el archivo más rápido de la familia. Google entrenó ese build para sobrevivir al almacenamiento en 4 bits y aquí se nota. Qwen3.6 27B y Qwen3.6 35B A3B cambian poco entre Q4 y Q8: dos y cinco puntos. Gemma 4 31B pierde ocho puntos de Q8_0 a QAT-Q4_0, un precio moderado por la mitad de memoria.

Donde sale cara

Qwen3.8 27B es el contraejemplo: Q8_0 llega a 70,7, Q6_K a 62,2 y Q4_K_M a 43,5. El mismo archivo que en francés es el mejor modelo local pierde 27 puntos en español. Muse Glimmer 30B prefiere, como en francés y alemán, el archivo pequeño: 17GB aventaja a K-Quant Dynamic en siete puntos. Granite 4.2 30B y Nemotron 3 Nano puntúan tan bajo en todas las cuantizaciones que la diferencia deja de importar.

El Q6 rara vez es la respuesta

En nueve familias, Q6_K solo es el mejor de su familia en Granite 4.2 30B, un modelo que puntúa por debajo de 13 en todas sus versiones, y a menudo es el peor. Ahorra menos memoria que el Q4 y rara vez conserva la calidad del Q8. Si hay que elegir a ciegas, elige Q8 cuando quepa, un Q4 QAT o K-Quant cuando no, y sáltate el Q6.

La misma tabla en otro idioma dice otra cosa

Esta es la edición en español. Las ediciones en inglés, francés y alemán de este artículo usan los mismos archivos y llegan a veredictos distintos: en inglés, Qwen3.8 27B en Q4_K_M es incluso mejor que en Q8_0. Una cuantización no es buena o mala en sí misma; es buena o mala para un modelo en un idioma, y por eso la medimos edición por edición.