Las cuatro ediciones de este baremo comparten los mismos modelos, los mismos jueces y el mismo protocolo. Solo cambian las consignas: 240 por idioma, redactadas originalmente en cada lengua. Así que cuando un modelo es 10.º en inglés y 53.º en alemán, la diferencia no está en el método. Está en el modelo.

Noventa y una variantes tienen puntuación publicada en los cuatro idiomas (datos a 19 de septiembre de 2026). Esto es lo que viajan.

La cabeza no se mueve

Modelo Inglés Francés Alemán Español
Claude Fable 5 3 3 3 3
Claude Opus 5 2 1 1 2
Claude Fable 5.1 4 2 2 1
GPT-6 Astra 5 6 4 7
Kimi K3 1 5 5 4
Claude Opus 4.8 7 4 8 5

Seis modelos nunca salen de los ocho primeros. Kimi K3 es el único de pesos abiertos entre ellos: primero en inglés, cuarto o quinto en los demás. Las puntuaciones cuentan lo mismo con más matices: Claude Opus 5 obtiene 93,7 en inglés y 99,5 en francés, lo que significa que el pelotón francés le resulta más fácil de dominar, no que escriba mejor en francés que en inglés. Las puntuaciones solo se comparan dentro de un mismo idioma.

En el medio es donde los idiomas se contradicen

Modelo Inglés Francés Alemán Español Diferencia
GLM 5.3 Flash 10 27 53 44 43
Qwen3.8 27B Q4_K_M 🏠 27 17 58 54 41
Ling 3.0 Flash Q4_K_M 🏠 66 35 76 66 41
Grok 4.6 25 61 53 21 40
Hy3 14 43 24 49 35
Seed 2.1 Turbo ↯ 57 28 61 43 33
Laguna S 2.1 UD Q4_K_M 🏠 58 87 91 87 33

GLM 5.3 Flash es un modelo del top diez en inglés y de la mitad inferior en alemán. Grok 4.6 es fuerte en inglés y español, débil en francés y alemán. Hy3 es bueno en inglés y mediocre en todo lo demás. No son accidentes de muestreo: cada modelo tiene entre 1 000 y 1 800 duelos clasificatorios por idioma, y los intervalos de confianza miden unos pocos puntos.

Los modelos locales siguen el mismo patrón, con un giro. Qwen3.8 27B en Q4_K_M es el mejor modelo local en francés (17.º de la general) y uno de los más débiles en alemán (58.º). El mismo archivo, en la misma máquina, con el mismo ajuste de razonamiento. Lo que Qwen aprendió del francés no lo aprendió del alemán.

Los idiomas no son igual de difíciles

La distancia entre el mejor modelo en la nube y el mejor modelo local es mayor en alemán y en español:

Edición Mejor modelo Mejor modelo local Puesto del local
Inglés Kimi K3, 93,8 Muse Glimmer 30B K-Quant Dynamic, 77,6 18
Francés Claude Opus 5, 99,5 Qwen3.8 27B Q4_K_M, 76,5 17
Alemán Claude Opus 5, 98,2 Gemma 4 31B Q8_0, 71,8 26
Español Claude Fable 5.1, 98,5 Qwen3.8 27B Q8_0, 70,7 23

Y el mejor modelo local es distinto en cada idioma. Muse Glimmer gana en inglés, Qwen3.8 en francés y español, Gemma 4 31B en alemán. Nadie que lea una sola clasificación lo adivinaría.

Qué sacar de esto

Leer una clasificación en inglés para elegir un modelo que escriba en español es un error en aproximadamente un tercio del pelotón. Los modelos cerrados de frontera son seguros en todos los idiomas que probamos. Por debajo, consulta la edición de tu idioma, y si ejecutas modelos en local, comprueba la cuantización exacta: el archivo que gana en un idioma puede perder en el siguiente.