¿Escribe mejor la IA en español con o sin razonamiento?
El mismo archivo, las mismas consignas, un solo interruptor. En 21 modelos locales, el razonamiento aporta de media 25,6 puntos a la familia Qwen y 5,9 a los Gemma 4 grandes; los pequeños Gemma E2B y E4B apenas ganan nada y a veces pierden.
En julio planteamos esta pregunta con unas decenas de veredictos y respondimos con cautela: las respuestas con razonamiento obtenían la mayoría de los puntos, pero el intervalo incluía el empate. Dos meses y 63 000 veredictos después, la respuesta cauta se ha vuelto precisa. Cada modelo local de este baremo se ejecutó dos veces con las mismas 240 consignas en español, una con la fase de razonamiento activada y otra sin ella, y ambas variantes participaron en los mismos duelos a ciegas. Las puntuaciones son sus posiciones en la clasificación en español, donde 50 equivale a una probabilidad de una entre dos de superar al modelo medio.
Veintiún modelos, un interruptor
| Modelo local | Con razonamiento | Sin | Diferencia |
|---|---|---|---|
| Qwen3.6 35B A3B Q4_K_M | 46,5 | 11,1 | +35,4 |
| Qwen3.8 27B Q8_0 | 70,7 | 38,4 | +32,3 |
| Qwen3.6 27B Q8_0 | 46,9 | 15,0 | +31,9 |
| Qwen3.8 27B Q6_K | 62,2 | 34,7 | +27,5 |
| Gemma 4 26B A4B QAT-Q4_0 | 62,8 | 37,9 | +24,9 |
| Qwen3.6 35B A3B Q8_0 | 41,1 | 22,0 | +19,1 |
| Gemma 4 26B A4B Q6_K | 56,4 | 44,4 | +12,0 |
| Gemma 4 12B Q6_K | 42,5 | 34,4 | +8,1 |
| Qwen3.8 27B Q4_K_M | 43,5 | 36,1 | +7,4 |
| Gemma 4 E4B Q8_0 | 17,2 | 11,9 | +5,3 |
| Gemma 4 E2B Q6_K | 17,1 | 12,1 | +5,0 |
| Gemma 4 12B Q8_0 | 49,7 | 45,9 | +3,8 |
| Gemma 4 31B Q8_0 | 67,2 | 64,0 | +3,2 |
| Gemma 4 E2B Q8_0 | 16,9 | 14,4 | +2,5 |
| Gemma 4 12B QAT-Q4_0 | 42,7 | 40,4 | +2,3 |
| Gemma 4 31B QAT-Q4_0 | 58,7 | 57,7 | +1,0 |
| Gemma 4 E2B Q4_K_M | 14,2 | 13,5 | +0,7 |
| Gemma 4 E4B Q6_K | 13,9 | 13,7 | +0,2 |
| Gemma 4 31B Q6_K | 61,6 | 61,5 | +0,1 |
| Gemma 4 E4B Q4_K_M | 9,5 | 10,1 | -0,6 |
| Gemma 4 26B A4B Q8_0 | 56,4 | 58,4 | -2,0 |
Qwen necesita su razonamiento; Gemma, mucho menos
Todas las variantes de Qwen ganan entre 7,4 y 35,4 puntos con el razonamiento. Qwen3.8 27B Q8_0 pasa de 38,4 a 70,7: sin razonamiento es un modelo mediocre; con él, el mejor modelo local de la clasificación. Los Qwen parecen redactar el borrador en la fase de razonamiento y limitarse a pulirlo en la respuesta visible; quítales el borrador y la respuesta queda floja.
Los Gemma 4 grandes (12B, 26B A4B, 31B) dan un cuadro desigual: desde +24,9 puntos en el 26B A4B QAT-Q4_0 hasta −2,0 en el 26B A4B Q8_0, con una media de 5,9. Gemma escribe un texto digno sin razonar, y el 31B Q6_K no cambia en absoluto (0,1 puntos).
Los pequeños Gemma 4 E2B y E4B promedian 2,2 puntos, y 1 de sus 6 parejas son negativas: en estos modelos, la fase de razonamiento a veces produce un texto peor que ningún razonamiento.
Qué ha cambiado desde julio
El artículo de julio tenía cuatro variantes y 34 veredictos en inglés; encontró un 66,2 % de los puntos para el razonamiento, con un intervalo del 48,6 % al 80,6 %. La dirección era correcta y la cautela, justificada. Hoy cada pareja de la tabla se apoya en 1 000 a 1 800 duelos clasificatorios por variante, los intervalos miden dos o tres puntos y la división entre familias es el hallazgo: el razonamiento no es un ajuste general que ayude a escribir, es una propiedad de cada modelo.
El mismo experimento en otros tres idiomas
Las ediciones en inglés, francés y alemán ejecutan las mismas 21 parejas con sus propias consignas. Qwen gana en todas. Las ganancias de Gemma son menores y, en francés y alemán, varios archivos Gemma escriben mejor sin razonamiento. El ajuste se prueba modelo por modelo e idioma por idioma, que es justo lo que permite el filtro «Modo de generación» de las cuatro clasificaciones.