Q4, Q6 o Q8: qué hace la cuantización con la calidad de escritura
A veces nada, a veces 27 puntos. En consignas en español, Gemma 4 26B A4B escribe mejor en QAT-Q4_0 que en Q8_0 con la mitad de archivo; Qwen3.8 27B pierde 27 puntos entre Q8_0 y Q4_K_M; Granite 4.2 30B pierde en todas. La regla general es que no hay regla general.
La cuantización reduce un modelo guardando sus pesos con menos bits. Un modelo de 27 000 millones de parámetros ocupa 27 GB en Q8_0 y 16 GB en Q4_K_M: la diferencia entre caber o no en una tarjeta gráfica de 32 GB. Todas las guías dicen que el archivo más pequeño escribe un poco peor. Medimos cuánto, en español, con los mismos duelos a ciegas que construyen la clasificación principal. Las puntuaciones son las de la clasificación en español: 50 equivale a una probabilidad de una entre dos de superar al modelo medio. Los tamaños son los de los archivos GGUF; las velocidades, medianas medidas en nuestra máquina Strix Halo, tokens de razonamiento incluidos.
El mismo modelo, tres archivos, tres puntuaciones
| Familia | Cuantización | Puntuación | Archivo (GB) | Velocidad (tok/s) | Duelos |
|---|---|---|---|---|---|
| Qwen3.8 27B | Q8_0 | 70,7 | 27,1 | 8,4 | 1150 |
| Q6_K | 62,2 | 20,9 | 7,0 | 1169 | |
| Q4_K_M | 43,5 | 15,7 | 8,9 | 1025 | |
| Qwen3.6 27B | Q8_0 | 46,9 | 26,6 | 7,5 | 1014 |
| Q4_K_M | 44,9 | 15,4 | 5,2 | 1152 | |
| Qwen3.6 35B A3B | Q4_K_M | 46,5 | 19,7 | 26,6 | 1671 |
| Q8_0 | 41,1 | 34,4 | 22,1 | 1553 | |
| Gemma 4 31B | Q8_0 | 67,2 | 30,4 | 4,8 | 1743 |
| Q6_K | 61,6 | 23,5 | 5,8 | 1166 | |
| QAT-Q4_0 | 58,7 | 16,4 | 10,0 | 1796 | |
| Gemma 4 26B A4B | QAT-Q4_0 | 62,8 | 13,4 | 27,9 | 1876 |
| Q6_K | 56,4 | 21,1 | 20,2 | 1185 | |
| Q8_0 | 56,4 | 25,0 | 39,8 | 1616 | |
| Gemma 4 12B | Q8_0 | 49,7 | 11,8 | 14,6 | 1590 |
| QAT-Q4_0 | 42,7 | 6,5 | 11,0 | 1651 | |
| Q6_K | 42,5 | 9,1 | 9,0 | 1077 | |
| Muse Glimmer 30B | K-Quant 17GB (≈ Q4) | 63,0 | 15,6 | 8,8 | 1535 |
| K-Quant Dynamic (≈ Q5) | 56,4 | 18,3 | 8,0 | 1471 | |
| Granite 4.2 30B | Q6_K | 12,9 | 22,4 | 6,6 | 931 |
| Q8_0 | 8,8 | 29,0 | 4,9 | 1018 | |
| Q4_K_M | 8,0 | 16,5 | 7,6 | 1013 | |
| Nemotron 3 Nano Omni 30B A3B | Q4_K_M | 8,0 | 22,8 | 25,1 | 1454 |
| Q8_0 | 6,2 | 31,3 | 21,2 | 1013 |
Donde la cuantización sale gratis
Gemma 4 26B A4B es la sorpresa: su QAT-Q4_0 de 13 GB supera en seis puntos al Q8_0 de 25 GB, con más de 1 600 duelos cada uno, y es además el archivo más rápido de la familia. Google entrenó ese build para sobrevivir al almacenamiento en 4 bits y aquí se nota. Qwen3.6 27B y Qwen3.6 35B A3B cambian poco entre Q4 y Q8: dos y cinco puntos. Gemma 4 31B pierde ocho puntos de Q8_0 a QAT-Q4_0, un precio moderado por la mitad de memoria.
Donde sale cara
Qwen3.8 27B es el contraejemplo: Q8_0 llega a 70,7, Q6_K a 62,2 y Q4_K_M a 43,5. El mismo archivo que en francés es el mejor modelo local pierde 27 puntos en español. Muse Glimmer 30B prefiere, como en francés y alemán, el archivo pequeño: 17GB aventaja a K-Quant Dynamic en siete puntos. Granite 4.2 30B y Nemotron 3 Nano puntúan tan bajo en todas las cuantizaciones que la diferencia deja de importar.
El Q6 rara vez es la respuesta
En nueve familias, Q6_K solo es el mejor de su familia en Granite 4.2 30B, un modelo que puntúa por debajo de 13 en todas sus versiones, y a menudo es el peor. Ahorra menos memoria que el Q4 y rara vez conserva la calidad del Q8. Si hay que elegir a ciegas, elige Q8 cuando quepa, un Q4 QAT o K-Quant cuando no, y sáltate el Q6.
La misma tabla en otro idioma dice otra cosa
Esta es la edición en español. Las ediciones en inglés, francés y alemán de este artículo usan los mismos archivos y llegan a veredictos distintos: en inglés, Qwen3.8 27B en Q4_K_M es incluso mejor que en Q8_0. Una cuantización no es buena o mala en sí misma; es buena o mala para un modelo en un idioma, y por eso la medimos edición por edición.