Resultados de los jueces IA
Consulta la clasificación de cada juez de IA y descubre en qué difieren sus resultados.
Los modelos se ordenan por la calidad de sus textos en español. Usa los filtros para acotar la lista. Para las categorías de escritura seleccionadas, los puestos se calculan antes de aplicar los filtros de proveedor, tamaño, acceso, razonamiento y cuantización; por eso los modelos ocultos pueden dejar huecos.
Última actualización:
| Puesto | Modelo | Puntuación del juez IA | Puntuación humana |
|---|---|---|---|
| 1 | 98.5 | — | |
| 2 | 98.4 | — | |
| 4 | 96.9 | — | |
| 6 | 95.2 | — | |
| 7 | 94.2 | — | |
| 9 | 91.7 | — | |
| 10 | 89 | — | |
| 10 | 89 | — | |
| 12 | 86.5 | — | |
| 13 | 86.3 | — | |
| 14 | 85.7 | — | |
| 16 | 84.8 | — | |
| 17 | 81.7 | — | |
| 18 | 79.8 | — | |
| 20 | 76.6 | — | |
| 21 | 74.3 | — | |
| 22 | 73.6 | — | |
| 23 | 70.7 | — | |
| 24 | 69.5 | — | |
| 26 | 68.7 | — | |
| 27 | 67.2 | — | |
| 28 | 65.7 | — | |
| 29 | 64 | — | |
| 38 | 58.4 | — | |
| 40 | 56.4 | — | |
| 43 | 53.6 | — | |
| 44 | 51.3 | — | |
| 45 | 49.7 | — | |
| 46 | 48.1 | — | |
| 47 | 47.4 | — | |
| 49 | 46.5 | — | |
| 51 | 45.9 | — | |
| 57 | 41.1 | — | |
| 59 | 38.4 | — | |
| 67 | 24.9 | — | |
| 68 | 22 | — | |
| 70 | 17.2 | — | |
| 72 | 16.9 | — | |
| 74 | 14.8 | — | |
| 75 | 14.4 | — | |
| 82 | 11.9 | — | |
| 86 | 8.8 | — | |
| 91 | 6.2 | — | |
| 92 | 2.4 | — |
Un modelo aparece tras su primera evaluación individual publicada; su puntuación de clasificación aparece tras su primer duelo admisible.
92 modelos comparados62263 veredictos de IA publicados
Método: modelo de Bradley–Terry regularizado. La puntuación del juez IA determina el puesto; la puntuación humana es independiente y sigue siendo secundaria hasta que haya más votos de la comunidad. Una puntuación de 50 equivale a una probabilidad estimada de una entre dos de superar al modelo medio en este idioma y categoría.
Cada celda muestra la proporción de puntos posibles que obtiene el modelo de la fila frente al modelo de la columna: una victoria vale el 100 %, un empate el 50 % y una derrota el 0 %. Esta matriz solo usa los protocolos de evaluación compatibles con la clasificación principal.
Matriz direccional de los puntos obtenidos en duelos directos. Por encima del 50 % favorece al modelo de la fila; por debajo, al de la columna.
0 %100 %
💡 indica un modelo con razonamiento, ↯ uno sin razonamiento. 🏠 indica un modelo ejecutado localmente en el ordenador del autor de este sitio.« on* » indica que el razonamiento está activado o desactivado (modelos locales sin niveles intermedios): el ajuste fino solicitado no es compatible con el archivo local y se degrada al modo activado por defecto. En los modelos locales con razonamiento ajustable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), el nivel mostrado (xhigh**, high, full) es el nivel por defecto del modelo: el ajuste fino solicitado no es compatible con el archivo local, que se degrada a su comportamiento por defecto.
| Modelo |
|---|
Cada celda muestra cuántos duelos juzgados por IA y publicados, en todos los protocolos, comparan los dos modelos para este idioma y categoría. Los modelos de ambos ejes son candidatos; la matriz no indica qué juez emitió cada veredicto.
Matriz simétrica del número de duelos publicados. La diagonal es cero porque un modelo no se compara consigo mismo.
0
💡 indica un modelo con razonamiento, ↯ uno sin razonamiento. 🏠 indica un modelo ejecutado localmente en el ordenador del autor de este sitio.« on* » indica que el razonamiento está activado o desactivado (modelos locales sin niveles intermedios): el ajuste fino solicitado no es compatible con el archivo local y se degrada al modo activado por defecto. En los modelos locales con razonamiento ajustable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), el nivel mostrado (xhigh**, high, full) es el nivel por defecto del modelo: el ajuste fino solicitado no es compatible con el archivo local, que se degrada a su comportamiento por defecto.
| Modelo |
|---|
¿Qué modelo escribe el mejor texto? Juzga esta pareja anónima y contribuye a la clasificación humana. Durante el duelo no verás qué modelo escribió cada texto. Los nombres se revelan al terminar.
Consulta la clasificación de cada juez de IA y descubre en qué difieren sus resultados.
Resultados provisionales de las comparaciones a ciegas en este idioma.