{"id":2102,"date":"2026-08-03T19:59:47","date_gmt":"2026-08-03T19:59:47","guid":{"rendered":"https:\/\/convly.ai\/ai-benchmarks\/"},"modified":"2026-08-03T19:59:47","modified_gmt":"2026-08-03T19:59:47","slug":"ai-benchmarks","status":"publish","type":"page","link":"https:\/\/convly.ai\/es\/ai-benchmarks\/","title":{"rendered":"Explicaci\u00f3n de los benchmarks de IA (2026): qu\u00e9 mide cada uno y qui\u00e9n lidera"},"content":{"rendered":"<p><strong>Un benchmark de IA es un conjunto fijo de tareas utilizado para calificar la capacidad de un modelo, de modo que<br \/>\nse puedan comparar distintos modelos en la misma prueba.<\/strong> No existe un \u00fanico benchmark que<br \/>\ndetermine cu\u00e1l modelo es el mejor: cada uno mide algo muy espec\u00edfico, y varios de los m\u00e1s conocidos<br \/>\nya est\u00e1n casi saturados. El enfoque pr\u00e1ctico consiste en consultar los dos o tres benchmarks que coincidan con su<br \/>\ncarga de trabajo real y desconfiar de cualquier cifra destacada aislada.<\/p>\n<h2>\u00bfQui\u00e9n lidera actualmente?<\/h2>\n<p>Ordenado seg\u00fan el \u00cdndice de Inteligencia Artificial de Artificial Analysis, una combinaci\u00f3n de varias evaluaciones independientes en lugar de una \u00fanica prueba. La \u00faltima columna es la que la mayor\u00eda de comparaciones omiten: la puntuaci\u00f3n<br \/>\ndividida por el precio combinado, que es lo que realmente est\u00e1 adquiriendo.<br \/>\nPuntuaci\u00f3n de inteligencia<\/p>\n<div class=\"cbm\">\n  <table class=\"cm-table cbm-lead\">\n    <thead><tr><th>#<\/th><th>Modelos<\/th><th>Desarrollador<\/th><th>Puntuaci\u00f3n por d\u00f3lar<\/th>\n      <th>D\u00f3lares por mill\u00f3n combinados<\/th><th>Las puntuaciones corresponden a la escala del \u00cdndice de Inteligencia Artificial de Artificial Analysis, una combinaci\u00f3n de varias evaluaciones independientes en lugar de una \u00fanica prueba \u2014lo cual es la forma adecuada de interpretar una afirmaci\u00f3n titular como \"mejor modelo\". La entrada de mayor rendimiento entre los modelos de pesos abiertos es<\/th><\/tr><\/thead>\n    <tbody>\n          <tr>\n        <td data-label=\"#\">1<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/claude-opus-5\/\">Claude Opus 5<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>61<\/strong><\/td>\n        <td data-label=\"Blended\">$9.00<\/td>\n        <td data-label=\"Score per $\">6.8<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">2<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/claude-fable-5\/\">Claude Fable 5<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>60<\/strong><\/td>\n        <td data-label=\"Blended\">$18.00<\/td>\n        <td data-label=\"Score per $\">3.3<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">3<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/gpt-5-6-sol\/\">GPT-5.6 Sol<\/a><\/td>\n        <td data-label=\"Developer\">OpenAI<\/td>\n        <td data-label=\"Score\"><strong>59<\/strong><\/td>\n        <td data-label=\"Blended\">$10.00<\/td>\n        <td data-label=\"Score per $\">5.9<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">4<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/kimi-k3\/\">Kimi K3<\/a> <span class=\"cbm-tag\">pesos abiertos<\/span><\/td>\n        <td data-label=\"Developer\">Moonshot AI<\/td>\n        <td data-label=\"Score\"><strong>57<\/strong><\/td>\n        <td data-label=\"Blended\">$5.40<\/td>\n        <td data-label=\"Score per $\">10.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">5<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/claude-opus-4-8\/\">Claude Opus 4.8<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>55.7<\/strong><\/td>\n        <td data-label=\"Blended\">$9.00<\/td>\n        <td data-label=\"Score per $\">6.2<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">6<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/gpt-5-5\/\">GPT-5.5<\/a><\/td>\n        <td data-label=\"Developer\">OpenAI<\/td>\n        <td data-label=\"Score\"><strong>54.8<\/strong><\/td>\n        <td data-label=\"Blended\">$10.00<\/td>\n        <td data-label=\"Score per $\">5.5<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">7<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/glm-5-2\/\">GLM 5.2<\/a> <span class=\"cbm-tag\">pesos abiertos<\/span><\/td>\n        <td data-label=\"Developer\">Zhipu AI<\/td>\n        <td data-label=\"Score\"><strong>51.1<\/strong><\/td>\n        <td data-label=\"Blended\">$2.00<\/td>\n        <td data-label=\"Score per $\">25.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">8<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/gemini-3-5-flash\/\">Gemini 3.5 Flash<\/a><\/td>\n        <td data-label=\"Developer\">Google<\/td>\n        <td data-label=\"Score\"><strong>50.2<\/strong><\/td>\n        <td data-label=\"Blended\">$3.00<\/td>\n        <td data-label=\"Score per $\">16.7<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">9<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/claude-sonnet-4-6\/\">Claude Sonnet 4.6<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>47<\/strong><\/td>\n        <td data-label=\"Blended\">$5.40<\/td>\n        <td data-label=\"Score per $\">8.7<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">10<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/gemini-3-1-pro\/\">Gemini 3.1 Pro<\/a><\/td>\n        <td data-label=\"Developer\">Google<\/td>\n        <td data-label=\"Score\"><strong>46.5<\/strong><\/td>\n        <td data-label=\"Blended\">$4.00<\/td>\n        <td data-label=\"Score per $\">11.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">11<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/deepseek-v4-pro\/\">DeepSeek V4-Pro<\/a> <span class=\"cbm-tag\">pesos abiertos<\/span><\/td>\n        <td data-label=\"Developer\">DeepSeek<\/td>\n        <td data-label=\"Score\"><strong>44.3<\/strong><\/td>\n        <td data-label=\"Blended\">$0.522<\/td>\n        <td data-label=\"Score per $\">84.9<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">12<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/kimi-k2-7-code\/\">Kimi K2.7 Code<\/a> <span class=\"cbm-tag\">pesos abiertos<\/span><\/td>\n        <td data-label=\"Developer\">Moonshot AI<\/td>\n        <td data-label=\"Score\"><strong>42<\/strong><\/td>\n        <td data-label=\"Blended\">$0.980<\/td>\n        <td data-label=\"Score per $\">42.9<\/td>\n      <\/tr>\n        <\/tbody>\n  <\/table>\n  <p class=\"cbm-note\">con 57 puntos. Ordene usted mismo el conjunto completo en la\n     <a href=\"https:\/\/convly.ai\/es\/model\/kimi-k3\/\">Kimi K3<\/a>\n     Los benchmarks que importan en 2026\n     <a href=\"https:\/\/convly.ai\/es\/llm-leaderboard\/\">Clasificaci\u00f3n de modelos de lenguaje grande (LLM)<\/a>.<\/p>\n<\/div>\n\n<h2>MMLU (Comprensi\u00f3n masiva de lenguaje multitarea)<\/h2>\n<h3>Preguntas de opci\u00f3n m\u00faltiple en 57 materias, desde matem\u00e1ticas elementales hasta derecho profesional.<\/h3>\n<p>Durante a\u00f1os fue la cifra principal por defecto, y ese es ahora el problema: los modelos punteros se agrupan tan estrechamente en la cima que las diferencias entre ellos caen dentro del margen de ruido. El MMLU sigue siendo<br \/>\n\u00fatil para comparar un modelo abierto peque\u00f1o con uno grande, pero casi in\u00fatil para distinguir entre<br \/>\ndos modelos punteros. Trate cualquier afirmaci\u00f3n sobre MMLU en 2026 como una verificaci\u00f3n m\u00ednima, no como una clasificaci\u00f3n.<br \/>\nGPQA (Preguntas y respuestas de nivel doctoral, resistente a Google)<br \/>\nElaborado por doctores especializados en biolog\u00eda, f\u00edsica y qu\u00edmica, y dise\u00f1ado expresamente para que buscar en internet no ayude. Responde una pregunta distinta de la del MMLU: no \u00ab\u00bfha le\u00eddo mucho el modelo?\u00bb, sino \u00ab\u00bfpuede razonar paso a paso ante un problema genuinamente dif\u00edcil en un campo t\u00e9cnico?\u00bb. Al resistirse tanto a la memorizaci\u00f3n como a la recuperaci\u00f3n de informaci\u00f3n, ha mantenido mejor su utilidad como discriminador que el MMLU.<\/p>\n<h3>Informes reales de errores procedentes de repositorios reales de GitHub, evaluados seg\u00fan si el parche generado por el modelo<\/h3>\n<p>Escrito por doctorados especializados en biolog\u00eda, f\u00edsica y qu\u00edmica, y dise\u00f1ado deliberadamente de modo que<br \/>\nbuscar en la web no ayude. Responde una pregunta distinta de la de MMLU: no \u00ab\u00bfha le\u00eddo mucho el modelo?\u00bb, sino \u00ab\u00bfpuede razonar<br \/>\nsobre un problema genuinamente dif\u00edcil en un campo t\u00e9cnico?\u00bb. Debido a que<br \/>\nresiste tanto la memorizaci\u00f3n como la recuperaci\u00f3n, ha envejecido mejor que MMLU como prueba discriminatoria.<\/p>\n<h3>SWE-bench Verificado<\/h3>\n<p>informes reales de errores procedentes de repositorios reales de GitHub, evaluados seg\u00fan si el parche generado por el modelo<br \/>\nlas pruebas propias del proyecto pasan. El subconjunto Verificado es la porci\u00f3n validada por humanos, filtrada para eliminar<br \/>\ntareas que estaban rotas o eran imposibles; por eso debe comprobarse <em>cu\u00e1l<\/em> SWE-bench una<br \/>\nempresa est\u00e1 cotizando. Este es el \u00fanico benchmark cuyo resultado resulta decisivo si est\u00e1 eligiendo un<br \/>\nmodelo para un agente de programaci\u00f3n, porque tanto la tarea como la calificaci\u00f3n son aut\u00e9nticas. Claude Sonnet 5<br \/>\nobtiene un 85,2 % en SWE-bench Verificado y un 63,2 % en el m\u00e1s dif\u00edcil SWE-bench Pro.<\/p>\n<h3>Terminal-Bench<\/h3>\n<p>Tareas ag\u00e9nicas realizadas en una terminal real: instalar algo, diagnosticar un fallo, escribir un script para<br \/>\ncorregirlo. Mide una habilidad distinta de la escritura de un parche: tolerancia al trabajo multietapa en el que<br \/>\nel modelo debe leer su propia salida de error y recuperarse. Claude Sonnet 5 obtiene un 80,4 % en<br \/>\nTerminal-Bench 2.1. Si su caso de uso es un agente aut\u00f3nomo y no un asistente de c\u00f3digo integrado, este y OSWorld le informan mejor que SWE-bench.<br \/>\nasistente, esta prueba y OSWorld revelan m\u00e1s informaci\u00f3n que SWE-bench.<\/p>\n<h3>OSWorld<\/h3>\n<p>Uso del ordenador en un entorno de escritorio real: abrir aplicaciones, hacer clic en interfaces,<br \/>\ncompletar una tarea que una persona har\u00eda con el rat\u00f3n. Las puntuaciones aqu\u00ed son considerablemente m\u00e1s bajas que en los benchmarks textuales, lo cual constituye una se\u00f1al honesta sobre el grado de inmadurez que a\u00fan presentan los agentes capaces de usar un ordenador.<br \/>\nClaude Sonnet 5 obtiene un 81,2 % en OSWorld-Verificado; Nemotron 3 Nano Omni de NVIDIA,<br \/>\nun modelo abierto de 30 mil millones de par\u00e1metros, obtiene un 47,4 % en OSWorld, un resultado razonable para su tama\u00f1o.<br \/>\nun modelo abierto de 30\u202f000 millones de par\u00e1metros, obtiene un 47,4 % en OSWorld, lo cual es un resultado razonable para su tama\u00f1o.<\/p>\n<h3>ARC-AGI<\/h3>\n<p>Puzzles abstractos de razonamiento visual dise\u00f1ados de modo que la coincidencia de patrones a partir de los datos de entrenamiento no se transfiera. Cada tarea consiste en unas pocas transformaciones de cuadr\u00edcula que el modelo debe inferir a partir de un par de ejemplos.<br \/>\ntransferencia. Cada tarea consiste en unas pocas transformaciones de cuadr\u00edcula que el modelo debe inferir a partir de un par de<br \/>\nARC-AGI es lo m\u00e1s cercano que existe en el campo a una prueba de generalizaci\u00f3n genuina, en lugar de mera recuperaci\u00f3n de informaci\u00f3n memorizada, raz\u00f3n por la cual los avances en esta prueba son lentos y los saltos significativos se consideran importantes.<br \/>\nque el recuerdo, raz\u00f3n por la cual los avances son lentos y los saltos significativos se consideran importantes.<br \/>\nClaude Opus 5 obtiene aproximadamente el triple de puntuaci\u00f3n que el siguiente mejor modelo en ARC-AGI 3.<\/p>\n<h3>El \u00faltimo examen de la humanidad<\/h3>\n<p>Preguntas redactadas por expertos en m\u00faltiples disciplinas, espec\u00edficamente concebidas para resistir la saturaci\u00f3n que afect\u00f3 a MMLU.<br \/>\nEl objetivo de dise\u00f1o es crear un benchmark que siga siendo dif\u00edcil a medida que los modelos mejoren,<br \/>\npor lo que sus puntuaciones son intencionalmente bajas y peque\u00f1os incrementos son significativos.<br \/>\nInterpr\u00e9telo como un discriminador de frontera, no como una medida de utilidad para trabajos cotidianos.<\/p>\n<h3>\u00cdndice de Inteligencia Artificial de Artificial Analysis<\/h3>\n<p>No es una prueba, sino una combinaci\u00f3n compuesta que integra varias evaluaciones independientes en una \u00fanica puntuaci\u00f3n. Esa es su ventaja: cualquier benchmark individual puede ser objeto de optimizaci\u00f3n espec\u00edfica, mientras que una combinaci\u00f3n es mucho m\u00e1s dif\u00edcil de manipular.<br \/>\nEs la escala utilizada en la tabla anterior. Claude Opus 5 es el l\u00edder actual con 61 puntos, seguido de Claude Fable 5 con 60 y GPT-5.6 Sol con 59; Kimi K3 obtiene 57, el mejor resultado registrado hasta ahora entre los modelos de pesos abiertos, situ\u00e1ndose a tan solo cuatro puntos del mejor modelo cerrado.<br \/>\nescala utilizada en la tabla anterior. Claude Opus 5 es el actual l\u00edder con una puntuaci\u00f3n de 61, seguido de Claude Fable 5 con<br \/>\n60 y GPT-5.6 Sol con 59; Kimi K3 obtiene 57, el mejor resultado registrado hasta la fecha para un modelo de pesos abiertos, situ\u00e1ndose<br \/>\na tan solo cuatro puntos del mejor modelo cerrado.<\/p>\n<h2>C\u00f3mo interpretar una afirmaci\u00f3n sobre un benchmark<\/h2>\n<p><strong>Pregunte qui\u00e9n lo ejecut\u00f3.<\/strong> Una puntuaci\u00f3n reportada por el fabricante en su propia p\u00e1gina de lanzamiento y una evaluaci\u00f3n independiente constituyen tipos distintos de evidencia. Los rankings independientes aplican el mismo marco (harness) a todos los modelos; el fabricante elige sus propias condiciones.<br \/>\nevaluaci\u00f3n independiente son tipos distintos de evidencia. Los rankings independientes aplican las mismas<br \/>\nherramientas a todos los modelos; el proveedor elige sus propias condiciones.<\/p>\n<p><strong>Verifique la posible contaminaci\u00f3n.<\/strong> Si las preguntas de un benchmark preceden a la fecha l\u00edmite de entrenamiento de un modelo y est\u00e1n disponibles p\u00fablicamente, es muy probable que algunas de ellas formen parte de sus datos de entrenamiento. Esta es la raz\u00f3n principal por la que los benchmarks antiguos tienden a inflarse con el tiempo y por la que los nuevos se dise\u00f1an para ser \u00aba prueba de Google\u00bb o se reservan completamente.<br \/>\nfecha l\u00edmite de entrenamiento y est\u00e1n disponibles p\u00fablicamente; es probable que algunos de ellos formen parte de los datos de entrenamiento. Esta es la<br \/>\nraz\u00f3n principal por la que las m\u00e9tricas antiguas se inflan con el tiempo y por la que las nuevas se dise\u00f1an para ser<br \/>\n\u00aba prueba de Google\u00bb o completamente excluidas.<\/p>\n<p><strong>Atenci\u00f3n a los postes de meta desplazados.<\/strong> \u00abSWE-bench\u00bb sin la especificaci\u00f3n \u00abVerificado\u00bb, un subconjunto sin nombre,<br \/>\nun n\u00famero distinto de intentos o una puntuaci\u00f3n obtenida con herramientas comparada con otra sin ellas: estas son las formas habituales en que una comparaci\u00f3n deja de ser equitativa.<br \/>\nson las formas habituales en que una comparaci\u00f3n deja de ser \u00abmanzana con manzana\u00bb.<\/p>\n<p><strong>Precauci\u00f3n ante la saturaci\u00f3n.<\/strong> Cuando todos los modelos serios superan el 90 % en una prueba, dicha prueba ha dejado de clasificar efectivamente nada.<br \/>\nLas diferencias de uno o dos puntos en la parte superior de un benchmark saturado son ruido, no se\u00f1al.<br \/>\nm\u00e9trica del benchmark son ruido, no se\u00f1al.<\/p>\n<p><strong>El precio forma parte de la puntuaci\u00f3n.<\/strong> Un modelo que obtiene dos puntos m\u00e1s pero cuesta seis veces m\u00e1s no es mejor para la mayor\u00eda de las cargas de trabajo. Por ello, la tabla anterior incluye una columna de \u00abpuntuaci\u00f3n por d\u00f3lar\u00bb y existe el<br \/>\ncaro no implica mejor rendimiento para la mayor\u00eda de las cargas de trabajo. Por eso, la tabla anterior incluye una columna de puntuaci\u00f3n por d\u00f3lar<br \/>\ny por qu\u00e9 la <a href=\"https:\/\/convly.ai\/es\/ai-price-performance-index-2026\/\">\u00edndice de relaci\u00f3n precio-rendimiento<br \/>\n(price-performance index)<\/a> .<\/p>\n<h2>\u00bfQu\u00e9 benchmark deber\u00eda importarle realmente?<\/h2>\n<p><strong>Para construir un agente de programaci\u00f3n:<\/strong> primero SWE-bench Verificado, segundo Terminal-Bench.<br \/>\nIgnore MMLU por completo.<\/p>\n<p><strong>Construcci\u00f3n de un agente para uso inform\u00e1tico o de escritorio:<\/strong> OSWorld y, a continuaci\u00f3n, Terminal-Bench.<br \/>\nEspere que los valores absolutos sean bajos.<\/p>\n<p><strong>Respuesta a preguntas t\u00e9cnicas o cient\u00edficas:<\/strong> GPQA y \u00abEl \u00faltimo examen de la humanidad\u00bb si<br \/>\nsus preguntas son realmente de nivel experto.<\/p>\n<p><strong>Asistente general o chat:<\/strong> un \u00edndice compuesto resulta m\u00e1s informativo que cualquier<br \/>\nprueba individual, ya que ning\u00fan benchmark reproduce fielmente la diversidad de consultas que formulan los usuarios reales.<\/p>\n<p><strong>Elecci\u00f3n de un modelo peque\u00f1o para autoalojamiento:<\/strong> los benchmarks importan menos que la compatibilidad. Verifique primero<br \/>\nqu\u00e9 modelos pueden ejecutarse f\u00edsicamente en su hardware y,<br \/>\n<a href=\"https:\/\/convly.ai\/es\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> solo despu\u00e9s, compare<br \/>\nlos resultados de los benchmarks \u00fanicamente entre los modelos compatibles.<\/p>\n<h2>Resultados de benchmarks publicados en nuestra base de datos<\/h2>\n<div class=\"cbm\">\n  <table class=\"cm-table cbm-scores\">\n    <thead><tr><th>Modelos<\/th><th>Resultados publicados<\/th><\/tr><\/thead>\n    <tbody>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/gpt-5-6-sol\/\">GPT-5.6 Sol<\/a><\/td>\n        <td data-label=\"Results\">\u00cdndice de Inteligencia Artificial de Artificial Analysis: 59.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/claude-sonnet-5\/\">Claude Sonnet 5<\/a><\/td>\n        <td data-label=\"Results\">SWE-Bench Verificado: 85,2 %; SWE-Bench Pro: 63,2 %; Terminal-Bench 2.1: 80,4 %; OSWorld-Verificado: 81,2 %.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/claude-opus-5\/\">Claude Opus 5<\/a><\/td>\n        <td data-label=\"Results\">\u00cdndice de Inteligencia Artificial de Artificial Analysis: 61 (clasificado en el puesto n.\u00ba 1 de 170 modelos). M\u00e1s del doble que Opus 4.8 en Frontier-Bench v0.1; aproximadamente tres veces el resultado del siguiente mejor modelo en ARC-AGI 3.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/es\/model\/nvidia-nemotron-3-nano-omni\/\">NVIDIA Nemotron 3 Nano Omni<\/a><\/td>\n        <td data-label=\"Results\">OCRBench V2: 67,04 | Video-MME: 72,2 | OSWorld: 47,4 | Speech IF: 89,39<\/td>\n      <\/tr>\n        <\/tbody>\n  <\/table>\n  <p class=\"cbm-note\">Solo se enumeran los modelos cuyos desarrolladores publican cifras espec\u00edficas. Su ausencia aqu\u00ed significa que no hemos verificado un valor publicado, no que el modelo tenga un rendimiento deficiente \u2014lo cual, por s\u00ed mismo, tambi\u00e9n es informaci\u00f3n valiosa cuando un proveedor destaca una afirmaci\u00f3n basada en un benchmark.<\/p>\n<\/div>\n\n<h2>Preguntas frecuentes<\/h2>\n<div class=\"cbm-faq\">\n<details class=\"cmp-q\">\n<summary>\u00bfQu\u00e9 es un benchmark de IA?<\/summary>\n<p>Un conjunto fijo de tareas con un m\u00e9todo de puntuaci\u00f3n definido, utilizado para comparar distintos modelos con entradas id\u00e9nticas. Los benchmarks abarcan desde pruebas de conocimiento de opci\u00f3n m\u00faltiple, como MMLU,<br \/>\nhasta tareas ag\u00e9nicas, como resolver incidencias reales de GitHub en SWE-Bench; cada uno mide una faceta muy espec\u00edfica de las capacidades, no la calidad general.<br \/>\nhasta tareas ag\u00e9nicas, como resolver incidencias reales de GitHub en SWE-Bench; cada uno mide una faceta muy espec\u00edfica de las capacidades, no la calidad general.<br \/>\nhasta tareas ag\u00e9nicas, como resolver incidencias reales de GitHub en SWE-Bench; cada uno mide una faceta muy espec\u00edfica de las capacidades, no la calidad general.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>\u00bfCu\u00e1l es el benchmark de IA m\u00e1s fiable?<\/summary>\n<p>Ninguno individual. Los \u00edndices compuestos constituyen la cifra resumen m\u00e1s fiable, porque combinar varias evaluaciones es mucho m\u00e1s dif\u00edcil de optimizar intencionadamente que centrarse en una sola prueba. Para una decisi\u00f3n espec\u00edfica, el benchmark m\u00e1s fiable es aquel cuya estructura se asemeje m\u00e1s a su carga de trabajo real: SWE-Bench Verificado para agentes de programaci\u00f3n, OSWorld para uso inform\u00e1tico y GPQA para razonamiento t\u00e9cnico.<br \/>\nseveral evaluations is much harder to target than optimising for one test. For a specific<br \/>\ndecision, the most reliable benchmark is whichever one most closely resembles your workload \u2014<br \/>\nSWE-bench Verified for coding agents, OSWorld for computer use, GPQA for technical reasoning.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>\u00bfQu\u00e9 puntuaci\u00f3n en MMLU se considera buena en 2026?<\/summary>\n<p>MMLU est\u00e1 pr\u00e1cticamente saturado entre los modelos punteros, por lo que una puntuaci\u00f3n alta ya no los distingue entre s\u00ed.<br \/>\nSigue siendo \u00fatil para ubicar modelos abiertos m\u00e1s peque\u00f1os, donde la dispersi\u00f3n de resultados sigue siendo amplia. Si est\u00e1 comparando dos modelos punteros, MMLU no los diferenciar\u00e1, y deber\u00e1 recurrir a GPQA o a un \u00edndice compuesto.<br \/>\nwill.<br \/>\nwill.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>\u00bfPueden manipularse los benchmarks de IA?<\/summary>\n<p>S\u00ed, de dos maneras. Los datos de entrenamiento pueden incluir las preguntas de un benchmark, lo que infla artificialmente las puntuaciones sin aportar ninguna mejora real de capacidad \u2014raz\u00f3n por la cual los benchmarks m\u00e1s recientes est\u00e1n dise\u00f1ados para resistir tanto la b\u00fasqueda como la memorizaci\u00f3n. Adem\u00e1s, las condiciones de evaluaci\u00f3n pueden elegirse de forma favorable: un subconjunto distinto, m\u00e1s intentos o el uso de herramientas frente a un modelo que no las utiliza. Los rankings independientes y los \u00edndices compuestos mitigan ambos riesgos.<br \/>\nany real capability gain \u2014 which is why newer benchmarks are designed to resist search and<br \/>\nmemorisation. And evaluation conditions can be chosen favourably: a different subset, more<br \/>\nattempts, or tool use compared against a model without it. Independently run leaderboards and<br \/>\ncomposite indices mitigate both.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>\u00bfLas puntuaciones de los benchmarks predicen el rendimiento en entornos reales?<\/summary>\n<p>Parcialmente. Los benchmarks con tareas aut\u00e9nticas, como SWE-Bench Verificado y OSWorld, predicen razonablemente bien porque la tarea evaluada coincide con la tarea real. En cambio, los benchmarks acad\u00e9micos de opci\u00f3n m\u00faltiple predicen mal, ya que responder preguntas de ex\u00e1menes no es lo que hacen la mayor\u00eda de las aplicaciones. El predictor m\u00e1s fiable sigue siendo una evaluaci\u00f3n que usted mismo dise\u00f1e con sus propios datos.<br \/>\nbecause answering exam questions is not what most applications do. The strongest predictor is<br \/>\nstill an evaluation you build on your own data.<br \/>\nstill an evaluation you build on your own data.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>\u00bfQu\u00e9 modelo de peso abierto obtiene la puntuaci\u00f3n m\u00e1s alta?<\/summary>\n<p>Kimi K3, con 57 puntos en el \u00cdndice de Inteligencia Artificial de Artificial Analysis, el mejor resultado registrado hasta la fecha para un modelo de peso abierto, a solo cuatro puntos del mejor modelo cerrado. La tabla de l\u00edderes anterior marca expl\u00edcitamente todas las entradas de modelos de peso abierto, y el conjunto completo es ordenable en la<br \/>\nregistrada, dentro de cuatro puntos del mejor modelo cerrado. La tabla de l\u00edderes anterior marca cada<br \/>\nmodelo de c\u00f3digo abierto, y el conjunto completo es ordenable seg\u00fan la<br \/>\n<a href=\"https:\/\/convly.ai\/es\/llm-leaderboard\/\">Clasificaci\u00f3n de modelos de lenguaje grande (LLM)<\/a>.<\/p>\n<\/details>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>An AI benchmark is a fixed set of tasks used to score a model&#8217;s ability, so that different models can [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"parent":0,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"class_list":["post-2102","page","type-page","status-publish","hentry"],"_links":{"self":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/pages\/2102","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/comments?post=2102"}],"version-history":[{"count":0,"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/pages\/2102\/revisions"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/es\/wp-json\/wp\/v2\/media?parent=2102"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}