Última actualización:

Clasificación de modelos de escritura basada en resultados por pares
PuestoModeloPuntuación del juez IAPuntuación humana
1Claude Fable 5.1 💡 adaptive high98.5
2Claude Opus 5 💡 adaptive high98.4
4Kimi K3 💡 enabled96.9
6GLM 5.3 💡 max95.2
7GPT-6 Astra 💡 high94.2
9GPT-5.6 Sol 💡 high91.7
10DeepSeek V4.1 Flash 💡 high89
10Muse Spark 1.3 💡 high89
12Gemini 3.8 Flash 💡 high86.5
13Claude Sonnet 5 💡 adaptive high86.3
14Qwen3.8 Max 💡 xhigh85.7
16GPT-5.6 Terra 💡 high84.8
17MiniMax M3 💡 enabled81.7
18GPT-5.6 Luna 💡 high79.8
20DeepSeek V4 Pro 💡 enabled76.6
21Grok 4.6 💡 high74.3
22Qwen3.8 Flash 💡 high73.6
23Qwen3.8 27B Q8_0 💡 xhigh** 🏠70.7
24Inkling 💡 high69.5
26Hy4 Preview 💡 high68.7
27Gemma 4 31B Q8_0 💡 on* 🏠67.2
28Qwen3.7 Plus 💡 enabled65.7
29Gemma 4 31B Q8_0 🏠64
38Gemma 4 26B A4B Q8_0 🏠58.4
40Gemma 4 26B A4B Q8_0 💡 on* 🏠56.4
43Seed 2.1 Turbo53.6
44GLM 5.3 Flash 💡 high51.3
45Gemma 4 12B Q8_0 💡 on* 🏠49.7
46Aion 3.0 💡 mandatory48.1
47MiMo V2.5 Pro 💡 enabled47.4
49Hy3 💡 high46.5
51Gemma 4 12B Q8_0 🏠45.9
57Qwen3.6 35B A3B Q8_0 💡 on* 🏠41.1
59Qwen3.8 27B Q8_0 🏠38.4
67Mistral Medium 3.5 💡 high24.9
68Qwen3.6 35B A3B Q8_0 🏠22
70Gemma 4 E4B Q8_0 💡 on* 🏠17.2
72Gemma 4 E2B Q8_0 💡 on* 🏠16.9
74MiMo V2.5 💡 enabled14.8
75Gemma 4 E2B Q8_0 🏠14.4
82Gemma 4 E4B Q8_0 🏠11.9
86Granite 4.2 30B Q8_0 💡 full 🏠8.8
91Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠6.2
92Granite 4.2 8B Q8_0 💡 full 🏠2.4

92 modelos comparados62263 veredictos de IA publicados

Método: modelo de Bradley–Terry regularizado. La puntuación del juez IA determina el puesto; la puntuación humana es independiente y sigue siendo secundaria hasta que haya más votos de la comunidad. Una puntuación de 50 equivale a una probabilidad estimada de una entre dos de superar al modelo medio en este idioma y categoría.

Resultados de los duelos directos

Cada celda muestra la proporción de puntos posibles que obtiene el modelo de la fila frente al modelo de la columna: una victoria vale el 100 %, un empate el 50 % y una derrota el 0 %. Esta matriz solo usa los protocolos de evaluación compatibles con la clasificación principal.

Matriz direccional de los puntos obtenidos en duelos directos. Por encima del 50 % favorece al modelo de la fila; por debajo, al de la columna.

0 %100 %

💡 indica un modelo con razonamiento, ↯ uno sin razonamiento. 🏠 indica un modelo ejecutado localmente en el ordenador del autor de este sitio.« on* » indica que el razonamiento está activado o desactivado (modelos locales sin niveles intermedios): el ajuste fino solicitado no es compatible con el archivo local y se degrada al modo activado por defecto. En los modelos locales con razonamiento ajustable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), el nivel mostrado (xhigh**, high, full) es el nivel por defecto del modelo: el ajuste fino solicitado no es compatible con el archivo local, que se degrada a su comportamiento por defecto.

Ver como tabla
Puntos obtenidos en duelos directos por pareja de modelos
Modelo

Cobertura de duelos publicados

Cada celda muestra cuántos duelos juzgados por IA y publicados, en todos los protocolos, comparan los dos modelos para este idioma y categoría. Los modelos de ambos ejes son candidatos; la matriz no indica qué juez emitió cada veredicto.

Matriz simétrica del número de duelos publicados. La diagonal es cero porque un modelo no se compara consigo mismo.

0

💡 indica un modelo con razonamiento, ↯ uno sin razonamiento. 🏠 indica un modelo ejecutado localmente en el ordenador del autor de este sitio.« on* » indica que el razonamiento está activado o desactivado (modelos locales sin niveles intermedios): el ajuste fino solicitado no es compatible con el archivo local y se degrada al modo activado por defecto. En los modelos locales con razonamiento ajustable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), el nivel mostrado (xhigh**, high, full) es el nivel por defecto del modelo: el ajuste fino solicitado no es compatible con el archivo local, que se degrada a su comportamiento por defecto.

Ver como tabla
Duelos publicados por pareja de modelos
Modelo

Ayuda a elegir el mejor modelo para escribir en español

¿Qué modelo escribe el mejor texto? Juzga esta pareja anónima y contribuye a la clasificación humana. Durante el duelo no verás qué modelo escribió cada texto. Los nombres se revelan al terminar.

Duelo a ciegas