Me llamo Johannes Eva y creo sitios web desde hace 27 años. Baremo IA nació para cubrir una carencia: ninguna clasificación medía lo que me interesaba, la calidad de escritura de los modelos de IA en español.

Los benchmarks públicos se centran en el código, las matemáticas y el razonamiento. La pequeña parte que dedican a la escritura casi siempre se evalúa en inglés. Aquí solo importa la calidad de los textos generados. Las consignas se conciben directamente en español y las respuestas se comparan a ciegas.

Los modelos que pueden ejecutarse en casa ocupan un lugar especial. Gemma 4, Qwen 3.6 y 3.8, Ling 3.0 Flash, Muse Glimmer y Granite 4.2 son algunas de las familias marcadas con 🏠. Se han ejecutado localmente con varias cuantizaciones, con el razonamiento activado y desactivado.

Este sitio es un proyecto personal. Ningún proveedor de modelos me paga y no tengo ningún interés en favorecer a uno.

Los equipos utilizados para los modelos locales

Framework Desktop utilizado para ejecutar los modelos de lenguaje locales de Baremo IA
Ordenador
Framework Desktop, AMD Ryzen AI Max serie 300, revisión A6
Procesador
AMD Ryzen AI Max+ 395, 16 núcleos y 32 hilos, hasta 5,19 GHz
Gráficos
AMD Radeon 8060S integrada
Memoria
128 GB de memoria unificada, compartida por el procesador y la unidad gráfica

Los modelos locales se ejecutan en un Framework Desktop con un AMD Ryzen AI Max+ 395. Sus 128 GB de memoria unificada están disponibles tanto para el procesador como para la unidad gráfica, lo que permite cargar modelos más grandes que en la mayoría de las tarjetas gráficas de consumo. Un segundo equipo con una NVIDIA GeForce RTX 5070 Ti aporta los modelos más ligeros.

Velocidad de generación local observada (Strix Halo)

Mediana de tokens generados por segundo en la máquina Strix Halo (Framework Desktop, Ryzen AI Max+ 395), calculada a partir de las respuestas válidas del benchmark generadas en ella e incluidos los tokens de razonamiento. La velocidad varía según la longitud del contexto y el programa utilizado. Los modelos sin suficientes mediciones en Strix Halo no aparecen en la lista.

ModeloCuantizaciónVelocidad medianaRespuestas
Gemma 4 26B A4BQ8_039.8 tokens/s465
Gemma 4 E2BQ4_K_M39.4 tokens/s224
Gemma 4 E4BQ8_035.9 tokens/s542
Gemma 4 E2BQ6_K33.2 tokens/s216
Ling 3.0 FlashQ4_K_M31.6 tokens/s277
Ling 3.0 FlashQ4_K_M30.5 tokens/s240
Gemma 4 E2BQ8_029.2 tokens/s224
Gemma 4 26B A4B QATQAT-Q4_027.9 tokens/s118
Qwen3.6 35B A3BQ4_K_M26.6 tokens/s347
Nemotron 3 Nano OmniQ4_K_M25.1 tokens/s960
Gemma 4 E4BQ4_K_M22.4 tokens/s221
Qwen3.6 35B A3BQ8_022.1 tokens/s312
Nemotron 3 Nano OmniQ8_021.2 tokens/s391
Nemotron 3 SuperQ4_K_M21.1 tokens/s413
Gemma 4 26B A4BQ6_K20.2 tokens/s539
Gemma 4 E4BQ6_K18.6 tokens/s218
Granite 4.2 8BQ4_K_M16.9 tokens/s36
Gemma 4 12BQ8_014.6 tokens/s124
Gemma 4 12B QATQAT-Q4_011 tokens/s752
Gemma 4 31B QATQAT-Q4_010 tokens/s548
Gemma 4 12BQ6_K9 tokens/s216
Qwen3.8 27BQ4_K_M8.9 tokens/s546
Muse Glimmer 30B Kquant 17gbK-Quant 17GB8.8 tokens/s394
Qwen3.8 27BQ8_08.4 tokens/s498
Muse Glimmer 30B Kquant DynamicK-Quant Dynamic8 tokens/s397
Granite 4.2 30BQ4_K_M7.6 tokens/s423
Qwen3.6 27BQ8_07.5 tokens/s190
Qwen3.8 27BQ6_K7 tokens/s504
Granite 4.2 30BQ6_K6.6 tokens/s397
Gemma 4 31BQ6_K5.8 tokens/s527
Qwen3.6 27BQ4_K_M5.2 tokens/s588
Granite 4.2 30BQ8_04.9 tokens/s447
Gemma 4 31BQ8_04.8 tokens/s316

Benchmarks publicados comparables para Ryzen AI Max+ 395