Baremo IA mide la calidad de escritura de los principales modelos de IA a partir de un corpus de consignas concebido directamente en español. Las respuestas a una misma consigna se comparan a ciegas, sin mostrar el nombre de los modelos, y los veredictos se agregan en una clasificación específica para el español.
En cabeza en el conjunto de categorías
Los 10 mejores modelos
Los diez mejores modelos para escribir en español
#
Modelo
Puntuación
1
Claude Fable 5.1 💡 adaptive high
98.5
2
Claude Opus 5 💡 adaptive high
98.4
3
Claude Fable 5 💡 adaptive high
97.2
4
Kimi K3 💡 enabled
96.9
5
Claude Opus 4.8 💡 adaptive high
95.5
6
GLM 5.3 💡 max
95.2
7
GPT-6 Astra 💡 high
94.2
8
Muse Spark 1.2 💡 high
92.7
9
GPT-5.6 Sol 💡 high
91.7
10
DeepSeek V4.1 Flash 💡 high
89
Esta puntuación no es una nota porcentual: 50 equivale a una probabilidad estimada de una entre dos de superar al modelo medio en español.
La VRAM indicada es una estimación redondeada de la memoria gráfica necesaria para cargar el modelo completo.
Las diez mejores variantes ejecutadas en local
#
Modelo
Puntuación
VRAM estimada
1
Qwen3.8 27B Q8_0 💡 xhigh** 🏠
70.7
≈ 48 GB
2
Gemma 4 31B Q8_0 💡 on* 🏠
67.2
≈ 48 GB
3
Gemma 4 31B Q8_0 ↯ 🏠
64
≈ 48 GB
4
Muse Glimmer 30B K-Quant 17GB 💡 high 🏠
63
≈ 24 GB
5
Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠
62.8
≈ 24 GB
6
Qwen3.8 27B Q6_K 💡 xhigh** 🏠
62.2
≈ 32 GB
7
Gemma 4 31B Q6_K 💡 on* 🏠
61.6
≈ 32 GB
8
Gemma 4 31B Q6_K ↯ 🏠
61.5
≈ 32 GB
9
Gemma 4 31B QAT-Q4_0 💡 on* 🏠
58.7
≈ 24 GB
10
Gemma 4 26B A4B Q8_0 ↯ 🏠
58.4
≈ 32 GB
Según el programa utilizado, una parte del modelo puede permanecer en la memoria del sistema. Esto reduce la VRAM necesaria, pero suele ralentizar la ejecución.
La clasificación evalúa únicamente la calidad de escritura. Las consignas se conciben en el idioma evaluado y los nombres de los modelos permanecen ocultos hasta el veredicto, para que su reputación no influya en la evaluación. Este sitio es un proyecto personal. Ningún proveedor de modelos me paga y no tengo ningún interés en favorecer a uno.
El mismo archivo, las mismas consignas, un solo interruptor. En 21 modelos locales, el razonamiento aporta de media 25,6 puntos a la familia Qwen y 5,9 a los Gemma 4 grandes; los pequeños Gemma E2B y E4B apenas ganan nada y a veces pierden.
A veces nada, a veces 27 puntos. En consignas en español, Gemma 4 26B A4B escribe mejor en QAT-Q4_0 que en Q8_0 con la mitad de archivo; Qwen3.8 27B pierde 27 puntos entre Q8_0 y Q4_K_M; Granite 4.2 30B pierde en todas. La regla general es que no hay regla general.
Actualizado con 1 500 duelos clasificatorios por archivo e idioma. El archivo K-Quant Dynamic es el mejor modelo local para escribir en inglés, con 77,6 puntos; en francés, alemán y español conviene descargar el archivo 17GB, más pequeño.
Dos de nuestros cinco jueces dan una clara ventaja a su propio modelo: GPT-5.6 Sol concede a sus textos hasta 21 puntos más que los demás jueces, y Claude Opus 5 hasta 11. Los dos jueces Fable hacen lo contrario y se puntúan con más dureza.
Claude Opus 5 y GPT-5.6 Sol, que aportan la mayoría de los veredictos, apuntan en la misma dirección en unas nueve parejas de modelos de cada diez. Los desacuerdos están en otra parte: Sol casi nunca declara empate, Claude Fable 5.1 lo hace hasta una vez de cada seis, y Claude Opus 4.8 solo coincide con los demás dos veces de cada tres.
Noventa y un modelos están clasificados en los cuatro idiomas. La cabeza apenas se mueve: Claude Opus 5, Claude Fable 5 y Claude Fable 5.1 están entre los cuatro primeros en todas partes. Por debajo, GLM 5.3 Flash es 10.º en inglés y 53.º en alemán; Grok 4.6, 25.º en inglés y 61.º en francés.