¿Cuánto coinciden los jueces de IA entre sí?
Claude Opus 5 y GPT-5.6 Sol, que aportan la mayoría de los veredictos, apuntan en la misma dirección en unas nueve parejas de modelos de cada diez. Los desacuerdos están en otra parte: Sol casi nunca declara empate, Claude Fable 5.1 lo hace hasta una vez de cada seis, y Claude Opus 4.8 solo coincide con los demás dos veces de cada tres.
La clasificación reúne los veredictos de cinco jueces de IA. Eso solo tiene sentido si casi siempre coinciden. ¿Coinciden?
Lo medimos como lo haría un lector: para cada pareja de modelos que dos jueces han visto al menos cuatro veces cada uno, ¿dan ambos la mayoría de los puntos al mismo modelo? Las parejas que terminan exactamente igualadas con alguno de los jueces quedan fuera. Datos a 19 de septiembre de 2026.
Los dos grandes jueces coinciden nueve veces de cada diez
Claude Opus 5 y GPT-5.6 Sol han juzgado unas 2 750 parejas de modelos en común por idioma. Eligen el mismo modelo en el 88,5 % de los casos en inglés, el 91,6 % en francés, el 91,6 % en alemán y el 91,1 % en español.
Dos jueces creados por empresas distintas, con datos distintos, que llegan al mismo veredicto en nueve parejas de cada diez: es la prueba más sólida que tiene este baremo de que su clasificación mide algo real de la escritura y no el gusto de un solo modelo. En la décima pareja viven las preguntas interesantes, y publicaremos esos desacuerdos en forma de lista.
Los jueces más pequeños
| Pareja de jueces | Inglés | Francés | Alemán | Español |
|---|---|---|---|---|
| Claude Fable 5.1 × Claude Opus 5 | 91,3 % (69) | 95,8 % (71) | 92,4 % (79) | 88,6 % (70) |
| Claude Fable 5.1 × GPT-5.6 Sol | 76,1 % (71) | 82,2 % (73) | 85,4 % (82) | 76,4 % (72) |
| Claude Fable 5 × Claude Opus 5 | 75,5 % (49) | 91,8 % (49) | 91,5 % (47) | 95,0 % (40) |
| Claude Fable 5 × GPT-5.6 Sol | 86,0 % (50) | 90,2 % (51) | 91,3 % (46) | 94,9 % (39) |
| Claude Opus 4.8 × Claude Opus 5 | 72,4 % (87) | 66,7 % (24) | 72,1 % (68) | 81,1 % (95) |
| Claude Opus 4.8 × GPT-5.6 Sol | 66,3 % (83) | 71,4 % (21) | 71,0 % (69) | 75,0 % (96) |
| Muse Spark 1.3 × Claude Opus 5 | 93,5 % (108) | 100 % (33) | 90,8 % (65) | — |
| Muse Spark 1.3 × GPT-5.6 Sol | 75,7 % (136) | 92,1 % (38) | 94,9 % (79) | — |
El número entre paréntesis es la cantidad de parejas compartidas; por debajo de cien, lee los porcentajes como indicaciones. Destacan dos cosas. Claude Opus 4.8, la generación anterior de Opus, coincide con los jueces actuales solo dos veces de cada tres: sus veredictos parecen un gusto de antes, y por eso hoy es un juez retirado con una parte pequeña del total. Y Claude Fable 5.1 coincide más con Claude Opus 5 que con GPT-5.6 Sol, un aire de familia que un buen baremo debe vigilar.
No todos los jueces entienden lo mismo por «mejor»
Los jueces también difieren en la frecuencia con que se niegan a elegir:
| Juez | Veredictos por idioma | Tasa de empate (EN / FR / DE / ES) |
|---|---|---|
| GPT-5.6 Sol | ≈ 25 000 | 0,5 % / 0,1 % / 0,1 % / 0,2 % |
| Claude Opus 5 | ≈ 28 000 | 5,4 % / 2,4 % / 3,3 % / 3,3 % |
| Claude Opus 4.8 | 400 – 1 100 | 3,7 % / 0,5 % / 1,5 % / 5,4 % |
| Muse Spark 1.3 | ≈ 6 000 | 9,7 % / 6,9 % / 9,6 % / 9,7 % |
| Claude Fable 5 | ≈ 1 000 | 10,2 % / 5,4 % / 4,0 % / 7,7 % |
| Claude Fable 5.1 | ≈ 1 800 | 15,6 % / 6,6 % / 12,0 % / 9,5 % |
GPT-5.6 Sol casi siempre elige un ganador. Claude Fable 5.1 declara empate en uno de cada seis duelos en inglés. Ninguno se equivoca: el empate es una respuesta legítima cuando dos textos valen lo mismo, y los duelos en inglés entre modelos de cabeza a menudo lo valen. Pero significa que una «victoria» con Sol es una afirmación más débil que una «victoria» con Fable 5.1. Es una de las razones por las que la clasificación principal usa un ajuste Bradley–Terry sobre veredictos, donde el empate cuenta media victoria para cada lado, en lugar de promediar las notas de 0 a 100 de los jueces.
Qué haremos con esto
Publicar la lista de parejas en las que Opus 5 y Sol discrepan, con los textos, para que los lectores sean el tercer juez. Mantener a Claude Opus 4.8 fuera de los nuevos veredictos. Y ponderar a los futuros jueces según su coincidencia con el conjunto antes de que sus veredictos cambien la clasificación, no después.