Cada juez de IA de este baremo ve dos textos anónimos y elige el mejor. Anónimos para el juez, se entiende. Nosotros sabemos quién escribió cada texto y podemos hacer una pregunta que el juez no puede hacerse: cuando uno de los dos textos procede de su propio modelo, ¿cambia el veredicto?

Cambia, en algunos jueces. La tabla compara, para cada juez, la proporción de puntos que obtiene su propio modelo cuando ese juez decide, con la proporción que obtiene el mismo modelo con todos los demás jueces. Una victoria vale un punto; un empate, medio. Datos: todos los duelos publicados a 19 de septiembre de 2026, unos 63 000 veredictos por idioma.

Sol y Opus 5 se favorecen; Fable, no

Juez (su modelo) Inglés Francés Alemán Español
GPT-5.6 Sol 87,9 % frente a 69,0 % 90,1 % frente a 74,6 % 93,4 % frente a 78,3 % 92,8 % frente a 72,1 %
Claude Opus 5 94,0 % frente a 82,6 % 99,6 % frente a 96,4 % 98,0 % frente a 90,5 % 96,9 % frente a 92,0 %
Muse Spark 1.3 82,6 % frente a 73,5 % 88,2 % frente a 84,4 % 84,1 % frente a 79,0 % 79,3 % frente a 80,4 %
Claude Fable 5 88,1 % frente a 89,8 % 90,7 % frente a 96,0 % 91,3 % frente a 92,8 % 91,0 % frente a 93,8 %
Claude Fable 5.1 84,4 % frente a 87,8 % 90,2 % frente a 95,6 % 90,7 % frente a 93,0 % 90,6 % frente a 96,5 %

Cada celda se lee como «con su propio juez frente a con los demás jueces». GPT-5.6 Sol es el caso más claro: sus textos recogen entre 15 y 21 puntos más cuando Sol es el juez, en todos los idiomas, sobre unos 1 000 duelos autojuzgados por idioma. Claude Opus 5 muestra la misma dirección con una diferencia menor, de 3 a 11 puntos. Muse Spark 1.3 se inclina hacia el mismo lado en tres idiomas de cuatro, con una muestra pequeña de 135 a 172 duelos.

Claude Fable 5 y Claude Fable 5.1 van en sentido contrario. Con sus propios veredictos, sus textos obtienen de 2 a 6 puntos menos que con los demás jueces, en los cuatro idiomas. Sea cual sea la razón, no se halagan.

Qué hace esto con las clasificaciones

Cada juez publica también su propia tabla, ordenada por victorias. En ella, GPT-5.6 Sol coloca a su modelo segundo en los cuatro idiomas. En la clasificación principal, que reúne a todos los jueces, el mismo modelo es noveno en inglés, décimo en francés, sexto en alemán y noveno en español. Claude Opus 5 es primero o segundo en todas partes, tanto en su propia tabla como en la principal; su ventaja cambia poco la cabeza, pero infla igualmente su puntuación.

Donde la ventaja importa es en la clasificación conjunta. Claude Opus 5 y GPT-5.6 Sol aportan juntos cerca del 85 % de los veredictos, así que sus duelos autojuzgados no son una nota al pie: unos 800 duelos Opus-sobre-Opus y 1 000 Sol-sobre-Sol por idioma entran en el ajuste Bradley–Terry junto con todos los demás.

Por qué todavía no lo llamamos sesgo

Dos reservas impiden convertirlo en un veredicto. Primero, los duelos no son los mismos. El modelo de un juez se enfrenta, con ese juez, a una mezcla de rivales distinta de la que encuentra con los demás, y esa mezcla cambia la proporción esperada. Las diferencias de Sol son demasiado grandes para que los rivales lo expliquen todo, pero pueden explicar una parte. Segundo, «los demás jueces» no es un instrumento neutral: es sobre todo Opus 5 cuando miramos a Sol, y sobre todo Sol cuando miramos a Opus 5. Si uno es severo con el otro, esa severidad aparece en la misma fila.

La prueba limpia es una muestra controlada: las mismas parejas juzgadas por todos los jueces. Hemos empezado a construirla.

Qué cambia en el sitio

Tres cosas. La tabla de cada juez ya permite leer sus veredictos por separado, y ahora sabes cuáles leer con una ceja levantada. Publicaremos una variante de la clasificación principal que excluya todo duelo en el que el juez y uno de los candidatos compartan fabricante, para compararla con la actual. Y cuando se añada un nuevo juez, su autopreferencia se medirá antes de sumar sus veredictos a los demás.