Los modelos que mejor escriben en español

Baremo IA mide la calidad de escritura de los principales modelos de IA a partir de un corpus de consignas concebido directamente en español. Las respuestas a una misma consigna se comparan a ciegas, sin mostrar el nombre de los modelos, y los veredictos se agregan en una clasificación específica para el español.

En cabeza en el conjunto de categorías

Los 10 mejores modelos

Los diez mejores modelos para escribir en español
#ModeloPuntuación
1Claude Fable 5.1 💡 adaptive high98.5
2Claude Opus 5 💡 adaptive high98.4
3Claude Fable 5 💡 adaptive high97.2
4Kimi K3 💡 enabled96.9
5Claude Opus 4.8 💡 adaptive high95.5
6GLM 5.3 💡 max95.2
7GPT-6 Astra 💡 high94.2
8Muse Spark 1.2 💡 high92.7
9GPT-5.6 Sol 💡 high91.7
10DeepSeek V4.1 Flash 💡 high89

Esta puntuación no es una nota porcentual: 50 equivale a una probabilidad estimada de una entre dos de superar al modelo medio en español.

Última actualización: Ver la clasificación completa

Las 10 mejores variantes locales

La VRAM indicada es una estimación redondeada de la memoria gráfica necesaria para cargar el modelo completo.

Las diez mejores variantes ejecutadas en local
#ModeloPuntuaciónVRAM estimada
1Qwen3.8 27B Q8_0 💡 xhigh** 🏠70.7≈ 48 GB
2Gemma 4 31B Q8_0 💡 on* 🏠67.2≈ 48 GB
3Gemma 4 31B Q8_0 🏠64≈ 48 GB
4Muse Glimmer 30B K-Quant 17GB 💡 high 🏠63≈ 24 GB
5Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠62.8≈ 24 GB
6Qwen3.8 27B Q6_K 💡 xhigh** 🏠62.2≈ 32 GB
7Gemma 4 31B Q6_K 💡 on* 🏠61.6≈ 32 GB
8Gemma 4 31B Q6_K 🏠61.5≈ 32 GB
9Gemma 4 31B QAT-Q4_0 💡 on* 🏠58.7≈ 24 GB
10Gemma 4 26B A4B Q8_0 🏠58.4≈ 32 GB

Según el programa utilizado, una parte del modelo puede permanecer en la memoria del sistema. Esto reduce la VRAM necesaria, pero suele ralentizar la ejecución.

IA local →

92modelos comparados
62.263veredictos de IA publicados

La clasificación evalúa únicamente la calidad de escritura. Las consignas se conciben en el idioma evaluado y los nombres de los modelos permanecen ocultos hasta el veredicto, para que su reputación no influya en la evaluación. Este sitio es un proyecto personal. Ningún proveedor de modelos me paga y no tengo ningún interés en favorecer a uno.

Para saber más

¿Escribe mejor la IA en español con o sin razonamiento?

El mismo archivo, las mismas consignas, un solo interruptor. En 21 modelos locales, el razonamiento aporta de media 25,6 puntos a la familia Qwen y 5,9 a los Gemma 4 grandes; los pequeños Gemma E2B y E4B apenas ganan nada y a veces pierden.

Q4, Q6 o Q8: qué hace la cuantización con la calidad de escritura

A veces nada, a veces 27 puntos. En consignas en español, Gemma 4 26B A4B escribe mejor en QAT-Q4_0 que en Q8_0 con la mitad de archivo; Qwen3.8 27B pierde 27 puntos entre Q8_0 y Q4_K_M; Granite 4.2 30B pierde en todas. La regla general es que no hay regla general.

Muse Glimmer 30B a examen: cómo escribe frente a sus rivales locales

Actualizado con 1 500 duelos clasificatorios por archivo e idioma. El archivo K-Quant Dynamic es el mejor modelo local para escribir en inglés, con 77,6 puntos; en francés, alemán y español conviene descargar el archivo 17GB, más pequeño.

¿Los jueces de IA prefieren su propio modelo?

Dos de nuestros cinco jueces dan una clara ventaja a su propio modelo: GPT-5.6 Sol concede a sus textos hasta 21 puntos más que los demás jueces, y Claude Opus 5 hasta 11. Los dos jueces Fable hacen lo contrario y se puntúan con más dureza.

¿Cuánto coinciden los jueces de IA entre sí?

Claude Opus 5 y GPT-5.6 Sol, que aportan la mayoría de los veredictos, apuntan en la misma dirección en unas nueve parejas de modelos de cada diez. Los desacuerdos están en otra parte: Sol casi nunca declara empate, Claude Fable 5.1 lo hace hasta una vez de cada seis, y Claude Opus 4.8 solo coincide con los demás dos veces de cada tres.

Un modelo, cuatro idiomas, cuatro puestos distintos

Noventa y un modelos están clasificados en los cuatro idiomas. La cabeza apenas se mueve: Claude Opus 5, Claude Fable 5 y Claude Fable 5.1 están entre los cuatro primeros en todas partes. Por debajo, GLM 5.3 Flash es 10.º en inglés y 53.º en alemán; Grok 4.6, 25.º en inglés y 61.º en francés.