Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

Explicación de los benchmarks de IA (2026): qué mide cada uno y quién lidera

Un benchmark de IA es un conjunto fijo de tareas utilizado para calificar la capacidad de un modelo, de modo que
se puedan comparar distintos modelos en la misma prueba.
No existe un único benchmark que
determine cuál modelo es el mejor: cada uno mide algo muy específico, y varios de los más conocidos
ya están casi saturados. El enfoque práctico consiste en consultar los dos o tres benchmarks que coincidan con su
carga de trabajo real y desconfiar de cualquier cifra destacada aislada.

¿Quién lidera actualmente?

Ordenado según el Índice de Inteligencia Artificial de Artificial Analysis, una combinación de varias evaluaciones independientes en lugar de una única prueba. La última columna es la que la mayoría de comparaciones omiten: la puntuación
dividida por el precio combinado, que es lo que realmente está adquiriendo.
Puntuación de inteligencia

#ModelosDesarrolladorPuntuación por dólarDólares por millón combinadosLas puntuaciones corresponden a la escala del Índice de Inteligencia Artificial de Artificial Analysis, una combinación de varias evaluaciones independientes en lugar de una única prueba —lo cual es la forma adecuada de interpretar una afirmación titular como "mejor modelo". La entrada de mayor rendimiento entre los modelos de pesos abiertos es
1Claude Opus 5Anthropic61$9.006.8
2Claude Fable 5Anthropic60$18.003.3
3GPT-5.6 SolOpenAI59$10.005.9
4Kimi K3 pesos abiertosMoonshot AI57$5.4010.6
5Claude Opus 4.8Anthropic55.7$9.006.2
6GPT-5.5OpenAI54.8$10.005.5
7GLM 5.2 pesos abiertosZhipu AI51.1$2.0025.6
8Gemini 3.5 FlashGoogle50.2$3.0016.7
9Claude Sonnet 4.6Anthropic47$5.408.7
10Gemini 3.1 ProGoogle46.5$4.0011.6
11DeepSeek V4-Pro pesos abiertosDeepSeek44.3$0.52284.9
12Kimi K2.7 Code pesos abiertosMoonshot AI42$0.98042.9

con 57 puntos. Ordene usted mismo el conjunto completo en la Kimi K3 Los benchmarks que importan en 2026 Clasificación de modelos de lenguaje grande (LLM).

MMLU (Comprensión masiva de lenguaje multitarea)

Preguntas de opción múltiple en 57 materias, desde matemáticas elementales hasta derecho profesional.

Durante años fue la cifra principal por defecto, y ese es ahora el problema: los modelos punteros se agrupan tan estrechamente en la cima que las diferencias entre ellos caen dentro del margen de ruido. El MMLU sigue siendo
útil para comparar un modelo abierto pequeño con uno grande, pero casi inútil para distinguir entre
dos modelos punteros. Trate cualquier afirmación sobre MMLU en 2026 como una verificación mínima, no como una clasificación.
GPQA (Preguntas y respuestas de nivel doctoral, resistente a Google)
Elaborado por doctores especializados en biología, física y química, y diseñado expresamente para que buscar en internet no ayude. Responde una pregunta distinta de la del MMLU: no «¿ha leído mucho el modelo?», sino «¿puede razonar paso a paso ante un problema genuinamente difícil en un campo técnico?». Al resistirse tanto a la memorización como a la recuperación de información, ha mantenido mejor su utilidad como discriminador que el MMLU.

Informes reales de errores procedentes de repositorios reales de GitHub, evaluados según si el parche generado por el modelo

Escrito por doctorados especializados en biología, física y química, y diseñado deliberadamente de modo que
buscar en la web no ayude. Responde una pregunta distinta de la de MMLU: no «¿ha leído mucho el modelo?», sino «¿puede razonar
sobre un problema genuinamente difícil en un campo técnico?». Debido a que
resiste tanto la memorización como la recuperación, ha envejecido mejor que MMLU como prueba discriminatoria.

SWE-bench Verificado

informes reales de errores procedentes de repositorios reales de GitHub, evaluados según si el parche generado por el modelo
las pruebas propias del proyecto pasan. El subconjunto Verificado es la porción validada por humanos, filtrada para eliminar
tareas que estaban rotas o eran imposibles; por eso debe comprobarse cuál SWE-bench una
empresa está cotizando. Este es el único benchmark cuyo resultado resulta decisivo si está eligiendo un
modelo para un agente de programación, porque tanto la tarea como la calificación son auténticas. Claude Sonnet 5
obtiene un 85,2 % en SWE-bench Verificado y un 63,2 % en el más difícil SWE-bench Pro.

Terminal-Bench

Tareas agénicas realizadas en una terminal real: instalar algo, diagnosticar un fallo, escribir un script para
corregirlo. Mide una habilidad distinta de la escritura de un parche: tolerancia al trabajo multietapa en el que
el modelo debe leer su propia salida de error y recuperarse. Claude Sonnet 5 obtiene un 80,4 % en
Terminal-Bench 2.1. Si su caso de uso es un agente autónomo y no un asistente de código integrado, este y OSWorld le informan mejor que SWE-bench.
asistente, esta prueba y OSWorld revelan más información que SWE-bench.

OSWorld

Uso del ordenador en un entorno de escritorio real: abrir aplicaciones, hacer clic en interfaces,
completar una tarea que una persona haría con el ratón. Las puntuaciones aquí son considerablemente más bajas que en los benchmarks textuales, lo cual constituye una señal honesta sobre el grado de inmadurez que aún presentan los agentes capaces de usar un ordenador.
Claude Sonnet 5 obtiene un 81,2 % en OSWorld-Verificado; Nemotron 3 Nano Omni de NVIDIA,
un modelo abierto de 30 mil millones de parámetros, obtiene un 47,4 % en OSWorld, un resultado razonable para su tamaño.
un modelo abierto de 30 000 millones de parámetros, obtiene un 47,4 % en OSWorld, lo cual es un resultado razonable para su tamaño.

ARC-AGI

Puzzles abstractos de razonamiento visual diseñados de modo que la coincidencia de patrones a partir de los datos de entrenamiento no se transfiera. Cada tarea consiste en unas pocas transformaciones de cuadrícula que el modelo debe inferir a partir de un par de ejemplos.
transferencia. Cada tarea consiste en unas pocas transformaciones de cuadrícula que el modelo debe inferir a partir de un par de
ARC-AGI es lo más cercano que existe en el campo a una prueba de generalización genuina, en lugar de mera recuperación de información memorizada, razón por la cual los avances en esta prueba son lentos y los saltos significativos se consideran importantes.
que el recuerdo, razón por la cual los avances son lentos y los saltos significativos se consideran importantes.
Claude Opus 5 obtiene aproximadamente el triple de puntuación que el siguiente mejor modelo en ARC-AGI 3.

El último examen de la humanidad

Preguntas redactadas por expertos en múltiples disciplinas, específicamente concebidas para resistir la saturación que afectó a MMLU.
El objetivo de diseño es crear un benchmark que siga siendo difícil a medida que los modelos mejoren,
por lo que sus puntuaciones son intencionalmente bajas y pequeños incrementos son significativos.
Interprételo como un discriminador de frontera, no como una medida de utilidad para trabajos cotidianos.

Índice de Inteligencia Artificial de Artificial Analysis

No es una prueba, sino una combinación compuesta que integra varias evaluaciones independientes en una única puntuación. Esa es su ventaja: cualquier benchmark individual puede ser objeto de optimización específica, mientras que una combinación es mucho más difícil de manipular.
Es la escala utilizada en la tabla anterior. Claude Opus 5 es el líder actual con 61 puntos, seguido de Claude Fable 5 con 60 y GPT-5.6 Sol con 59; Kimi K3 obtiene 57, el mejor resultado registrado hasta ahora entre los modelos de pesos abiertos, situándose a tan solo cuatro puntos del mejor modelo cerrado.
escala utilizada en la tabla anterior. Claude Opus 5 es el actual líder con una puntuación de 61, seguido de Claude Fable 5 con
60 y GPT-5.6 Sol con 59; Kimi K3 obtiene 57, el mejor resultado registrado hasta la fecha para un modelo de pesos abiertos, situándose
a tan solo cuatro puntos del mejor modelo cerrado.

Cómo interpretar una afirmación sobre un benchmark

Pregunte quién lo ejecutó. Una puntuación reportada por el fabricante en su propia página de lanzamiento y una evaluación independiente constituyen tipos distintos de evidencia. Los rankings independientes aplican el mismo marco (harness) a todos los modelos; el fabricante elige sus propias condiciones.
evaluación independiente son tipos distintos de evidencia. Los rankings independientes aplican las mismas
herramientas a todos los modelos; el proveedor elige sus propias condiciones.

Verifique la posible contaminación. Si las preguntas de un benchmark preceden a la fecha límite de entrenamiento de un modelo y están disponibles públicamente, es muy probable que algunas de ellas formen parte de sus datos de entrenamiento. Esta es la razón principal por la que los benchmarks antiguos tienden a inflarse con el tiempo y por la que los nuevos se diseñan para ser «a prueba de Google» o se reservan completamente.
fecha límite de entrenamiento y están disponibles públicamente; es probable que algunos de ellos formen parte de los datos de entrenamiento. Esta es la
razón principal por la que las métricas antiguas se inflan con el tiempo y por la que las nuevas se diseñan para ser
«a prueba de Google» o completamente excluidas.

Atención a los postes de meta desplazados. «SWE-bench» sin la especificación «Verificado», un subconjunto sin nombre,
un número distinto de intentos o una puntuación obtenida con herramientas comparada con otra sin ellas: estas son las formas habituales en que una comparación deja de ser equitativa.
son las formas habituales en que una comparación deja de ser «manzana con manzana».

Precaución ante la saturación. Cuando todos los modelos serios superan el 90 % en una prueba, dicha prueba ha dejado de clasificar efectivamente nada.
Las diferencias de uno o dos puntos en la parte superior de un benchmark saturado son ruido, no señal.
métrica del benchmark son ruido, no señal.

El precio forma parte de la puntuación. Un modelo que obtiene dos puntos más pero cuesta seis veces más no es mejor para la mayoría de las cargas de trabajo. Por ello, la tabla anterior incluye una columna de «puntuación por dólar» y existe el
caro no implica mejor rendimiento para la mayoría de las cargas de trabajo. Por eso, la tabla anterior incluye una columna de puntuación por dólar
y por qué la índice de relación precio-rendimiento
(price-performance index)
.

¿Qué benchmark debería importarle realmente?

Para construir un agente de programación: primero SWE-bench Verificado, segundo Terminal-Bench.
Ignore MMLU por completo.

Construcción de un agente para uso informático o de escritorio: OSWorld y, a continuación, Terminal-Bench.
Espere que los valores absolutos sean bajos.

Respuesta a preguntas técnicas o científicas: GPQA y «El último examen de la humanidad» si
sus preguntas son realmente de nivel experto.

Asistente general o chat: un índice compuesto resulta más informativo que cualquier
prueba individual, ya que ningún benchmark reproduce fielmente la diversidad de consultas que formulan los usuarios reales.

Elección de un modelo pequeño para autoalojamiento: los benchmarks importan menos que la compatibilidad. Verifique primero
qué modelos pueden ejecutarse físicamente en su hardware y,
Calculadora de VRAM solo después, compare
los resultados de los benchmarks únicamente entre los modelos compatibles.

Resultados de benchmarks publicados en nuestra base de datos

ModelosResultados publicados
GPT-5.6 SolÍndice de Inteligencia Artificial de Artificial Analysis: 59.
Claude Sonnet 5SWE-Bench Verificado: 85,2 %; SWE-Bench Pro: 63,2 %; Terminal-Bench 2.1: 80,4 %; OSWorld-Verificado: 81,2 %.
Claude Opus 5Índice de Inteligencia Artificial de Artificial Analysis: 61 (clasificado en el puesto n.º 1 de 170 modelos). Más del doble que Opus 4.8 en Frontier-Bench v0.1; aproximadamente tres veces el resultado del siguiente mejor modelo en ARC-AGI 3.
NVIDIA Nemotron 3 Nano OmniOCRBench V2: 67,04 | Video-MME: 72,2 | OSWorld: 47,4 | Speech IF: 89,39

Solo se enumeran los modelos cuyos desarrolladores publican cifras específicas. Su ausencia aquí significa que no hemos verificado un valor publicado, no que el modelo tenga un rendimiento deficiente —lo cual, por sí mismo, también es información valiosa cuando un proveedor destaca una afirmación basada en un benchmark.

Preguntas frecuentes

¿Qué es un benchmark de IA?

Un conjunto fijo de tareas con un método de puntuación definido, utilizado para comparar distintos modelos con entradas idénticas. Los benchmarks abarcan desde pruebas de conocimiento de opción múltiple, como MMLU,
hasta tareas agénicas, como resolver incidencias reales de GitHub en SWE-Bench; cada uno mide una faceta muy específica de las capacidades, no la calidad general.
hasta tareas agénicas, como resolver incidencias reales de GitHub en SWE-Bench; cada uno mide una faceta muy específica de las capacidades, no la calidad general.
hasta tareas agénicas, como resolver incidencias reales de GitHub en SWE-Bench; cada uno mide una faceta muy específica de las capacidades, no la calidad general.

¿Cuál es el benchmark de IA más fiable?

Ninguno individual. Los índices compuestos constituyen la cifra resumen más fiable, porque combinar varias evaluaciones es mucho más difícil de optimizar intencionadamente que centrarse en una sola prueba. Para una decisión específica, el benchmark más fiable es aquel cuya estructura se asemeje más a su carga de trabajo real: SWE-Bench Verificado para agentes de programación, OSWorld para uso informático y GPQA para razonamiento técnico.
several evaluations is much harder to target than optimising for one test. For a specific
decision, the most reliable benchmark is whichever one most closely resembles your workload —
SWE-bench Verified for coding agents, OSWorld for computer use, GPQA for technical reasoning.

¿Qué puntuación en MMLU se considera buena en 2026?

MMLU está prácticamente saturado entre los modelos punteros, por lo que una puntuación alta ya no los distingue entre sí.
Sigue siendo útil para ubicar modelos abiertos más pequeños, donde la dispersión de resultados sigue siendo amplia. Si está comparando dos modelos punteros, MMLU no los diferenciará, y deberá recurrir a GPQA o a un índice compuesto.
will.
will.

¿Pueden manipularse los benchmarks de IA?

Sí, de dos maneras. Los datos de entrenamiento pueden incluir las preguntas de un benchmark, lo que infla artificialmente las puntuaciones sin aportar ninguna mejora real de capacidad —razón por la cual los benchmarks más recientes están diseñados para resistir tanto la búsqueda como la memorización. Además, las condiciones de evaluación pueden elegirse de forma favorable: un subconjunto distinto, más intentos o el uso de herramientas frente a un modelo que no las utiliza. Los rankings independientes y los índices compuestos mitigan ambos riesgos.
any real capability gain — which is why newer benchmarks are designed to resist search and
memorisation. And evaluation conditions can be chosen favourably: a different subset, more
attempts, or tool use compared against a model without it. Independently run leaderboards and
composite indices mitigate both.

¿Las puntuaciones de los benchmarks predicen el rendimiento en entornos reales?

Parcialmente. Los benchmarks con tareas auténticas, como SWE-Bench Verificado y OSWorld, predicen razonablemente bien porque la tarea evaluada coincide con la tarea real. En cambio, los benchmarks académicos de opción múltiple predicen mal, ya que responder preguntas de exámenes no es lo que hacen la mayoría de las aplicaciones. El predictor más fiable sigue siendo una evaluación que usted mismo diseñe con sus propios datos.
because answering exam questions is not what most applications do. The strongest predictor is
still an evaluation you build on your own data.
still an evaluation you build on your own data.

¿Qué modelo de peso abierto obtiene la puntuación más alta?

Kimi K3, con 57 puntos en el Índice de Inteligencia Artificial de Artificial Analysis, el mejor resultado registrado hasta la fecha para un modelo de peso abierto, a solo cuatro puntos del mejor modelo cerrado. La tabla de líderes anterior marca explícitamente todas las entradas de modelos de peso abierto, y el conjunto completo es ordenable en la
registrada, dentro de cuatro puntos del mejor modelo cerrado. La tabla de líderes anterior marca cada
modelo de código abierto, y el conjunto completo es ordenable según la
Clasificación de modelos de lenguaje grande (LLM).

Scroll to Top
Featured on There's An AI For That