IA local

Una clasificación dinámica de modelos de pesos abiertos para escribir en español, con filtros de cuantización y orientación sobre memoria.

¿Escribe mejor la IA en español con o sin razonamiento?

El mismo archivo, las mismas consignas, un solo interruptor. En 21 modelos locales, el razonamiento aporta de media 25,6 puntos a la familia Qwen y 5,9 a los Gemma 4 grandes; los pequeños Gemma E2B y E4B apenas ganan nada y a veces pierden.

Q4, Q6 o Q8: qué hace la cuantización con la calidad de escritura

A veces nada, a veces 27 puntos. En consignas en español, Gemma 4 26B A4B escribe mejor en QAT-Q4_0 que en Q8_0 con la mitad de archivo; Qwen3.8 27B pierde 27 puntos entre Q8_0 y Q4_K_M; Granite 4.2 30B pierde en todas. La regla general es que no hay regla general.

¿Los jueces de IA prefieren su propio modelo?

Dos de nuestros cinco jueces dan una clara ventaja a su propio modelo: GPT-5.6 Sol concede a sus textos hasta 21 puntos más que los demás jueces, y Claude Opus 5 hasta 11. Los dos jueces Fable hacen lo contrario y se puntúan con más dureza.

¿Cuánto coinciden los jueces de IA entre sí?

Claude Opus 5 y GPT-5.6 Sol, que aportan la mayoría de los veredictos, apuntan en la misma dirección en unas nueve parejas de modelos de cada diez. Los desacuerdos están en otra parte: Sol casi nunca declara empate, Claude Fable 5.1 lo hace hasta una vez de cada seis, y Claude Opus 4.8 solo coincide con los demás dos veces de cada tres.

Un modelo, cuatro idiomas, cuatro puestos distintos

Noventa y un modelos están clasificados en los cuatro idiomas. La cabeza apenas se mueve: Claude Opus 5, Claude Fable 5 y Claude Fable 5.1 están entre los cuatro primeros en todas partes. Por debajo, GLM 5.3 Flash es 10.º en inglés y 53.º en alemán; Grok 4.6, 25.º en inglés y 61.º en francés.