La clasificación reúne los veredictos de cinco jueces de IA. Eso solo tiene sentido si casi siempre coinciden. ¿Coinciden?

Lo medimos como lo haría un lector: para cada pareja de modelos que dos jueces han visto al menos cuatro veces cada uno, ¿dan ambos la mayoría de los puntos al mismo modelo? Las parejas que terminan exactamente igualadas con alguno de los jueces quedan fuera. Datos a 19 de septiembre de 2026.

Los dos grandes jueces coinciden nueve veces de cada diez

Claude Opus 5 y GPT-5.6 Sol han juzgado unas 2 750 parejas de modelos en común por idioma. Eligen el mismo modelo en el 88,5 % de los casos en inglés, el 91,6 % en francés, el 91,6 % en alemán y el 91,1 % en español.

Dos jueces creados por empresas distintas, con datos distintos, que llegan al mismo veredicto en nueve parejas de cada diez: es la prueba más sólida que tiene este baremo de que su clasificación mide algo real de la escritura y no el gusto de un solo modelo. En la décima pareja viven las preguntas interesantes, y publicaremos esos desacuerdos en forma de lista.

Los jueces más pequeños

Pareja de jueces Inglés Francés Alemán Español
Claude Fable 5.1 × Claude Opus 5 91,3 % (69) 95,8 % (71) 92,4 % (79) 88,6 % (70)
Claude Fable 5.1 × GPT-5.6 Sol 76,1 % (71) 82,2 % (73) 85,4 % (82) 76,4 % (72)
Claude Fable 5 × Claude Opus 5 75,5 % (49) 91,8 % (49) 91,5 % (47) 95,0 % (40)
Claude Fable 5 × GPT-5.6 Sol 86,0 % (50) 90,2 % (51) 91,3 % (46) 94,9 % (39)
Claude Opus 4.8 × Claude Opus 5 72,4 % (87) 66,7 % (24) 72,1 % (68) 81,1 % (95)
Claude Opus 4.8 × GPT-5.6 Sol 66,3 % (83) 71,4 % (21) 71,0 % (69) 75,0 % (96)
Muse Spark 1.3 × Claude Opus 5 93,5 % (108) 100 % (33) 90,8 % (65)
Muse Spark 1.3 × GPT-5.6 Sol 75,7 % (136) 92,1 % (38) 94,9 % (79)

El número entre paréntesis es la cantidad de parejas compartidas; por debajo de cien, lee los porcentajes como indicaciones. Destacan dos cosas. Claude Opus 4.8, la generación anterior de Opus, coincide con los jueces actuales solo dos veces de cada tres: sus veredictos parecen un gusto de antes, y por eso hoy es un juez retirado con una parte pequeña del total. Y Claude Fable 5.1 coincide más con Claude Opus 5 que con GPT-5.6 Sol, un aire de familia que un buen baremo debe vigilar.

No todos los jueces entienden lo mismo por «mejor»

Los jueces también difieren en la frecuencia con que se niegan a elegir:

Juez Veredictos por idioma Tasa de empate (EN / FR / DE / ES)
GPT-5.6 Sol ≈ 25 000 0,5 % / 0,1 % / 0,1 % / 0,2 %
Claude Opus 5 ≈ 28 000 5,4 % / 2,4 % / 3,3 % / 3,3 %
Claude Opus 4.8 400 – 1 100 3,7 % / 0,5 % / 1,5 % / 5,4 %
Muse Spark 1.3 ≈ 6 000 9,7 % / 6,9 % / 9,6 % / 9,7 %
Claude Fable 5 ≈ 1 000 10,2 % / 5,4 % / 4,0 % / 7,7 %
Claude Fable 5.1 ≈ 1 800 15,6 % / 6,6 % / 12,0 % / 9,5 %

GPT-5.6 Sol casi siempre elige un ganador. Claude Fable 5.1 declara empate en uno de cada seis duelos en inglés. Ninguno se equivoca: el empate es una respuesta legítima cuando dos textos valen lo mismo, y los duelos en inglés entre modelos de cabeza a menudo lo valen. Pero significa que una «victoria» con Sol es una afirmación más débil que una «victoria» con Fable 5.1. Es una de las razones por las que la clasificación principal usa un ajuste Bradley–Terry sobre veredictos, donde el empate cuenta media victoria para cada lado, en lugar de promediar las notas de 0 a 100 de los jueces.

Qué haremos con esto

Publicar la lista de parejas en las que Opus 5 y Sol discrepan, con los textos, para que los lectores sean el tercer juez. Mantener a Claude Opus 4.8 fuera de los nuevos veredictos. Y ponderar a los futuros jueces según su coincidencia con el conjunto antes de que sus veredictos cambien la clasificación, no después.