Clasificación de IA local

Puntuaciones de la clasificación general en español. Los puestos se recalculan entre todas las variantes locales admisibles antes de aplicar los filtros de visualización; por eso puede haber saltos en la numeración.

Última actualización:

Clasificación de modelos locales por calidad de escritura
PuestoModeloNota juez IAArchivo+128K+256K
1Qwen3.8 27B Q8_0 💡 xhigh** 🏠70.727.1 GB59.1 GB91.1 GB
2Gemma 4 31B Q8_0 💡 on* 🏠67.230.4 GB78.4 GB126.4 GB
3Gemma 4 31B Q8_0 🏠6430.4 GB78.4 GB126.4 GB
4Muse Glimmer 30B K-Quant 17GB 💡 high 🏠6315.6 GB22.1 GB22.1 GB
5Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠62.813.4 GB43.4 GB73.4 GB
9Gemma 4 31B QAT-Q4_0 💡 on* 🏠58.716.4 GB64.4 GB112.4 GB
10Gemma 4 26B A4B Q8_0 🏠58.425 GB55 GB85 GB
11Gemma 4 31B QAT-Q4_0 🏠57.716.4 GB64.4 GB112.4 GB
13Gemma 4 26B A4B Q8_0 💡 on* 🏠56.425 GB55 GB85 GB
14Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠56.418.3 GB24.8 GB24.8 GB
15Gemma 4 12B Q8_0 💡 on* 🏠49.711.8 GB35.8 GB59.8 GB
17Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠46.519.7 GB35.7 GB51.7 GB
18Gemma 4 12B Q8_0 🏠45.911.8 GB35.8 GB59.8 GB
21Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠43.515.7 GB47.7 GB79.7 GB
22Gemma 4 12B QAT-Q4_0 💡 on* 🏠42.76.5 GB30.5 GB54.5 GB
24Qwen3.6 35B A3B Q8_0 💡 on* 🏠41.134.4 GB50.4 GB66.4 GB
25Gemma 4 12B QAT-Q4_0 🏠40.46.5 GB30.5 GB54.5 GB
26Qwen3.8 27B Q8_0 🏠38.427.1 GB59.1 GB91.1 GB
27Gemma 4 26B A4B QAT-Q4_0 🏠37.913.4 GB43.4 GB73.4 GB
28Qwen3.8 27B Q4_K_M 🏠36.115.7 GB47.7 GB79.7 GB
31Nemotron 3 Super 120B A12B Q4_K_M 💡 full 🏠26.280.1 GB81.1 GB82.1 GB
32Ling 3.0 Flash Q4_K_M 💡 high 🏠25.271.7 GB155.7 GB239.7 GB
33Qwen3.6 35B A3B Q8_0 🏠2234.4 GB50.4 GB66.4 GB
34Ling 3.0 Flash Q4_K_M 🏠21.271.7 GB155.7 GB239.7 GB
35Gemma 4 E4B Q8_0 💡 on* 🏠17.27.5 GB18 GB18 GB
37Gemma 4 E2B Q8_0 💡 on* 🏠16.94.6 GB13.6 GB13.6 GB
39Gemma 4 E2B Q8_0 🏠14.44.6 GB13.6 GB13.6 GB
40Gemma 4 E2B Q4_K_M 💡 on* 🏠14.23.2 GB12.2 GB12.2 GB
43Gemma 4 E2B Q4_K_M 🏠13.53.2 GB12.2 GB12.2 GB
46Gemma 4 E4B Q8_0 🏠11.97.5 GB18 GB18 GB
47Qwen3.6 35B A3B Q4_K_M 🏠11.119.7 GB35.7 GB51.7 GB
48Gemma 4 E4B Q4_K_M 🏠10.15 GB15.5 GB15.5 GB
49Gemma 4 E4B Q4_K_M 💡 on* 🏠9.55 GB15.5 GB15.5 GB
50Granite 4.2 30B Q8_0 💡 full 🏠8.829 GB61 GB61 GB
51Laguna S 2.1 UD Q4_K_M 💡 on* 🏠8.468.1 GB92.1 GB116.1 GB
52Granite 4.2 30B Q4_K_M 💡 full 🏠816.5 GB48.5 GB48.5 GB
53Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 on* 🏠822.8 GB23.6 GB24.3 GB
54Granite 4.2 8B Q4_K_M 💡 full 🏠7.45 GB25 GB25 GB
55Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠6.231.3 GB32 GB32.8 GB
56Granite 4.2 8B Q8_0 💡 full 🏠2.48.7 GB28.7 GB28.7 GB

Esta puntuación usa la escala de la clasificación general y no es una nota porcentual: para la selección de categorías activa, 50 equivale a una probabilidad estimada de una entre dos de superar al modelo medio en español.

56 variantes locales clasificadas62263 veredictos de IA publicados en la clasificación general

Resultados de los duelos directos

Cada celda muestra la proporción de puntos posibles que obtiene el modelo de la fila frente al modelo de la columna: una victoria vale el 100 %, un empate el 50 % y una derrota el 0 %. Esta matriz solo usa los protocolos de evaluación compatibles con la clasificación principal.

Matriz direccional de los puntos obtenidos en duelos directos. Por encima del 50 % favorece al modelo de la fila; por debajo, al de la columna.

0 %100 %

💡 indica un modelo con razonamiento, ↯ uno sin razonamiento. 🏠 indica un modelo ejecutado localmente en el ordenador del autor de este sitio.« on* » indica que el razonamiento está activado o desactivado (modelos locales sin niveles intermedios): el ajuste fino solicitado no es compatible con el archivo local y se degrada al modo activado por defecto. En los modelos locales con razonamiento ajustable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), el nivel mostrado (xhigh**, high, full) es el nivel por defecto del modelo: el ajuste fino solicitado no es compatible con el archivo local, que se degrada a su comportamiento por defecto.

Ver como tabla
Puntos obtenidos en duelos directos por pareja de modelos
Modelo

Cobertura de duelos publicados

Cada celda muestra cuántos duelos juzgados por IA y publicados, en todos los protocolos, comparan los dos modelos para este idioma y categoría. Los modelos de ambos ejes son candidatos; la matriz no indica qué juez emitió cada veredicto.

Matriz simétrica del número de duelos publicados. La diagonal es cero porque un modelo no se compara consigo mismo.

0

💡 indica un modelo con razonamiento, ↯ uno sin razonamiento. 🏠 indica un modelo ejecutado localmente en el ordenador del autor de este sitio.« on* » indica que el razonamiento está activado o desactivado (modelos locales sin niveles intermedios): el ajuste fino solicitado no es compatible con el archivo local y se degrada al modo activado por defecto. En los modelos locales con razonamiento ajustable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), el nivel mostrado (xhigh**, high, full) es el nivel por defecto del modelo: el ajuste fino solicitado no es compatible con el archivo local, que se degrada a su comportamiento por defecto.

Ver como tabla
Duelos publicados por pareja de modelos
Modelo

¿Cuál es la mejor IA local para escribir en español?

La respuesta está en la tabla y cambia cuando entran nuevos modelos o nuevas comparaciones, así que no la fijamos por escrito.

Qué es la cuantización y qué efecto tiene

La cuantización consiste en representar los pesos del modelo con menos bits. El efecto inmediato es mecánico: el archivo ocupa menos y la huella en memoria baja. En inferencia local, donde el cuello de botella suele ser el ancho de banda de memoria, esa reducción también puede traducirse en más velocidad.

El efecto sobre la calidad es donde hay que ser honesto. La cuantización puede degradar el texto, y cuánto depende del modelo, del método, de la tarea, del idioma, de la longitud del contexto y del nivel de cuantización. No existe un porcentaje universal de «calidad conservada», y desconfía de cualquier cifra que se presente así.

Estos son los niveles que verás en el filtro:

Las dos variantes K-Quant de Muse Glimmer

Meta publica Muse Glimmer 30B en dos archivos GGUF poco habituales, con aproximadamente cuatro bits por peso de media. K-Quant Dynamic conserva ciertos tensores con mayor precisión y apunta a 32 GB de VRAM; K-Quant 17GB comprime más y apunta a 24 GB. No son archivos Q4_K_M, así que mantenemos sus nombres exactos y los evaluamos como variantes separadas. Ambos aparecen bajo el filtro amplio Q4, que agrupa descargas de la clase de cuatro bits sin afirmar que usen una codificación idéntica.

Meta comunica una degradación media del 0,2 % y del 1,0 %, respectivamente, en quince benchmarks comunes. Son mediciones del editor, no puntuaciones de escritura de AIWB ni garantías para la prosa en español, inglés, francés o alemán. Nuestro ranking y la comparación directa miden los dos archivos por separado con consignas redactadas de forma nativa.

Recomendaciones por hardware

8 GB

Gemma 4 E2B Q8_0 💡 on* 🏠

16.9 · posición local 37

Gemma 4 E2B Q4_K_M 💡 on* 🏠

39.4 tok/s · medición de AIWB en Strix Halo

16 GB

Gemma 4 12B Q8_0 💡 on* 🏠

49.7 · posición local 15

Gemma 4 E2B Q4_K_M 💡 on* 🏠

39.4 tok/s · medición de AIWB en Strix Halo

32 GB

Muse Glimmer 30B K-Quant 17GB 💡 high 🏠

63 · posición local 4

Gemma 4 26B A4B Q8_0 🏠

39.8 tok/s · medición de AIWB en Strix Halo

Son referencias de carga, no garantías: contexto, caché KV, lote y runtime cambian la huella. Las velocidades de AIWB se midieron en el equipo Strix Halo descrito en «Sobre el autor» y no predicen otra plataforma.

Calidad frente a velocidad

Son dos ejes independientes y esta página los mantiene separados a propósito. El ranking mide calidad de escritura en español; las pestañas de hardware hablan de si el modelo cabe y a qué ritmo genera. Un modelo excelente que produce texto muy despacio puede ser perfectamente razonable para redactar y revisar sin prisa, y un modelo más modesto pero fluido puede ser mejor compañero para el trabajo iterativo. Decidir cuál te conviene requiere ambos datos, no uno solo.

Por qué usar una IA local

Los motivos son concretos. Cuando el runtime y sus integraciones funcionan enteramente en local, tus textos no tienen por qué salir de tu equipo, lo que importa cuando trabajas con material confidencial, inédito o sujeto a acuerdos de cliente. Funciona sin conexión. No dependes de que un proveedor cambie el modelo bajo el mismo nombre, ajuste sus filtros o retire una versión. Y el coste de uso, una vez descargado el modelo, no está ligado al número de peticiones.

También hay una precisión de vocabulario que conviene hacer, porque en las búsquedas se usa «open source» para casi todo. El criterio técnico de esta página son los pesos abiertos: que puedas descargar y ejecutar el modelo. Eso no equivale por sí solo a una licencia open source; la aplicación de ese marco al conjunto de artefactos de un modelo sigue siendo objeto de debate, y muchas licencias restringen ciertos usos comerciales. La licencia es un asunto legal que debes comprobar para tu caso; no dice nada sobre la calidad del texto, y nosotros no la puntuamos.

Preguntas frecuentes

¿Qué modelo local escribe mejor en español? El que encabeza la tabla de esta página con los filtros por defecto. Cambia cuando se incorporan modelos o comparaciones nuevas, así que la respuesta vive en el ranking dinámico y no en este texto.

¿Cuánta VRAM necesito? Depende del modelo, de la cuantización y del contexto que quieras usar. La pestaña de GPU dedicada indica para 8, 16 y 32 GB si una variante evaluada cabe con el margen aplicado; si no hay una recomendación defendible, la tarjeta queda vacía.

¿La cuantización estropea el texto? Puede afectarlo, y el efecto varía según el modelo, el método, la tarea y el idioma. No damos porcentajes universales: solo publicamos conclusiones cuando disponemos de comparaciones emparejadas entre variantes del mismo modelo.

¿Q4 QAT y Q4_K_M son lo mismo? No. Q4 QAT es un checkpoint preparado o entrenado contando con la ejecución en cuatro bits; Q4_K_M es una cuantización GGUF aplicada después del entrenamiento, con precisión mixta. Van en filas separadas.

¿Por qué hay modelos en la nube entre los adversarios? Porque conservamos las puntuaciones del ranking general en español. Eso mantiene una escala común entre ambas páginas y aporta muchos más datos por modelo del que tendría un torneo cerrado entre modelos locales.

¿Puedo ejecutar un modelo con más de 256 000 millones de parámetros? Técnicamente sí, con hardware suficiente, pero queda fuera de esta página. El umbral marca lo que consideramos razonablemente ejecutable en un equipo personal.

¿Por qué algunos modelos aparecen sin puntuación? Porque cumplen los requisitos de admisión pero todavía no acumulan suficientes comparaciones. Están en la lista de modelos pendientes de evaluación, sin posición, para que su ausencia del ranking no se lea como un resultado negativo.

¿Qué significan los iconos 💡 y ↯? 💡 indica que el modelo generó con el razonamiento activado y ↯ que lo hizo sin él. Cuando las pruebas técnicas no permiten determinarlo, el estado queda como desconocido en lugar de asumirlo.