En 2026, Claude Opus 4.8 lidera nuestro índice de inteligencia con una puntuación de 55,7, ligeramente por encima de GPT-5.5 de OpenAI (54,8). Gemini 3.5 Flash de Google (50,2) y GLM-5.2, de código abierto (51,1), le siguen de cerca, mientras que Gemini 3.1 Pro (46,5) y DeepSeek V4 Pro (44,3) completan el grupo de modelos punteros. Si su elección realmente se limita a comparar los dos asistentes y no los modelos subyacentes en bruto, la comparación Claude frente a ChatGPT analiza esa confrontación directa. El único modelo «mejor» depende de cómo equilibre usted la inteligencia frente al precio y la velocidad.
La columna Inteligencia muestra una puntuación compuesta de 0 a 100 basada en el Índice de Inteligencia Artificial Analysis v4.1, que combina nueve evaluaciones rigurosas que abarcan razonamiento, programación, uso agente de herramientas y conocimientos científicos. Una puntuación más alta indica mayor inteligencia, pero una diferencia de dos puntos en la parte superior del ranking rara vez afecta la calidad real de la salida; por tanto, trate los grupos de modelos como aproximadamente equivalentes, en lugar de considerar diferencias mínimas como definitivas. que abarcan el razonamiento, la programación, el uso de herramientas por agentes y los conocimientos científicos. Cuanto mayor sea la puntuación, más inteligente será el modelo; sin embargo, una diferencia de dos puntos en la parte superior casi nunca afecta la calidad real de la salida, por lo que conviene considerar a los modelos agrupados como aproximadamente equivalentes, en lugar de interpretar diferencias mínimas como decisivas.
Evalúe la inteligencia junto con el precio y la velocidad. Un modelo de vanguardia como Opus 4.8 cuesta mucho más por token que DeepSeek V4 Flash (40,3) o GLM-5.2, los cuales ofrecen del 70 al 90 % de la inteligencia a una fracción del costo. Para trabajos de alto volumen o sensibles a la latencia, suele imponerse un modelo más económico y rápido; para las tareas de razonamiento y agencia más exigentes, la parte superior de la tabla justifica su prima. Ordene según la métrica que mejor se adapte a su caso de uso.
| # | Modelo ↓ | Desarrollador | Inteligencia ↓ | Contexto ↓ | Entrada: $/1 millón ↓ | Salida: $/1 millón ↓ | Pesos abiertos |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 61 | 1 millón | $5.00 | $25.00 | No |
| 2 | GPT-6 Astra | OpenAI | 61 | 1,05 millones | $10.00 | $50.00 | No |
| 3 | Claude Fable 5 | Anthropic | 60 | 1 millón | $10.00 | $50.00 | No |
| 4 | GPT-5.6 Sol | OpenAI | 59 | 1,05 millones | $5.00 | $30.00 | No |
| 5 | Kimi K3 | Moonshot AI | 57 | 1 millón | $3.00 | $15.00 | Sí |
| 6 | Claude Opus 4.8 | Anthropic | 55.7 | 1 millón | $5.00 | $25.00 | No |
| 7 | GPT-5.5 | OpenAI | 54.8 | 1,05 millones | $5.00 | $30.00 | No |
| 8 | GLM 5.2 | Zhipu AI | 51.1 | 1 millón | $1.40 | $4.40 | Sí |
| 9 | Gemini 3.5 Flash | 50.2 | 1 millón | $1.50 | $9.00 | No | |
| 10 | Claude Sonnet 4.6 | Anthropic | 47 | 1 millón | $3.00 | $15.00 | No |
| 11 | Gemini 3.1 Pro | 46.5 | 1,05 millones | $2.00 | $12.00 | No | |
| 12 | DeepSeek V4-Pro | DeepSeek | 44.3 | 1 millón | $0.44 | $0.87 | Sí |
| 13 | Kimi K2.7 Code | Moonshot AI | 42 | 256K | $0.60 | $2.50 | Sí |
| 14 | DeepSeek V4-Flash | DeepSeek | 40.3 | 1 millón | $0.14 | $0.28 | Sí |
| 15 | Claude Haiku 4.5 | Anthropic | 37 | 200 000 | $1.00 | $5.00 | No |
| 16 | DeepSeek R1 | DeepSeek | 20.1 | 128 K | $0.50 | $2.15 | Sí |
| 17 | Mistral Large 3 | Mistral AI | 15.9 | 256K | $2.00 | $6.00 | Sí |
| 18 | Llama 4 Maverick | Meta | 14.3 | 1 millón | $0.20 | $0.80 | Sí |
| 19 | Qwen3 235B-A22B | Alibaba | 13 | 128 K | $0.45 | $1.80 | Sí |
| 20 | Qwen3 32B | Alibaba | 12 | 128 K | $0.08 | $0.28 | Sí |
| 21 | Llama 4 Scout | Meta | 10.0 | 10M | $0.10 | $0.30 | Sí |
| 22 | Gemma 3 27B | 7.4 | 128 K | $0.08 | $0.16 | Sí | |
| 23 | Phi-4 | Microsoft | 4.9 | 16K | $0.07 | $0.14 | Sí |
| 24 | Claude Opus 5.5 | Anthropic | — | — | $4.00 | $20.00 | No |
| 25 | Claude Sonnet 5 | Anthropic | — | 1 millón | $2.00 | $10.00 | No |
| 26 | Claude Sonnet 5.5 | Anthropic | — | — | $2.00 | $10.00 | No |
| 27 | DeepSeek R1 Distill Llama 70B | DeepSeek | — | 128 K | $0.80 | $0.80 | Sí |
| 28 | Gemini 2.5 Pro | — | 1 millón (1 048 576 tokens) | $1.25 | $10.00 | No | |
| 29 | Gemini 3.6 Flash | — | 1 millón | $1.50 | $7.50 | No | |
| 30 | Gemini 3.8 Flash | — | 1 millón | $0.75 | $3.75 | No | |
| 31 | Gemini 4 Argon | Google DeepMind | — | — | $2.00 | $10.00 | No |
| 32 | Gemma 3 12B | — | 128 K | $0.05 | $0.15 | Sí | |
| 33 | Gemma 3 4B | — | 128 K | $0.05 | $0.10 | Sí | |
| 34 | GPT-6 Luna | OpenAI | — | 1,05 millones | $0.10 | $0.50 | No |
| 35 | GPT-6 Sol | OpenAI | — | 1,05 millones | $2.00 | $10.00 | No |
| 36 | GPT-6.1 Sol | OpenAI | — | — | $2.00 | $10.00 | No |
| 37 | Grok 4 | xAI | — | 256 000 tokens | $3.00 | $15.00 | No |
| 38 | Kling 2.5 Turbo Pro | Kuaishou | — | — | — | — | No |
| 39 | Llama 3.1 8B | Meta | — | 128 K | $0.02 | $0.03 | Sí |
| 40 | Llama 3.3 70B | Meta | — | 128 K | $0.10 | $0.32 | Sí |
| 41 | MiniMax H3 (Hailuo 3.0) | MiniMax | — | — | — | — | Sí |
| 42 | Mistral 7B | Mistral AI | — | 32K | $0.02 | $0.03 | Sí |
| 43 | Mistral NeMo 12B | Mistral AI | — | 128 K | $0.02 | $0.04 | Sí |
| 44 | NVIDIA Nemotron 3 Nano Omni | NVIDIA | — | 256K | — | — | Sí |
| 45 | Qwen3 14B | Alibaba | — | 128 K | $0.12 | $0.24 | Sí |
| 46 | Qwen3 30B-A3B | Alibaba | — | 128 K | $0.12 | $0.50 | Sí |
| 47 | Qwen3 8B | Alibaba | — | 128 K | $0.04 | $0.14 | Sí |
| 48 | Seedance 2.5 | ByteDance | — | — | — | — | No |
| 49 | Sora 2 | OpenAI | — | — | — | — | No |
| 50 | Sora 2 Pro | OpenAI | — | — | — | — | No |
| 51 | Veo 3.1 | — | — | — | — | No | |
| 52 | Wan 2.5 | Alibaba | — | — | — | — | No |
Click any column heading to re-sort. Intelligence = a 0–100 composite of public reasoning/knowledge benchmarks; — means not yet scored. Prices are USD per 1M tokens. Updated October 2026.
Preguntas frecuentes
¿Cuál es el mejor modelo de lenguaje grande (LLM) actualmente?
A mediados de 2026, Claude Opus 4.8 es el modelo con la puntuación más alta en el Índice de Inteligencia Artificial Analysis (55,7), ligeramente por delante de GPT-5.5 (54,8). Ambos lideran en razonamiento, programación y tareas agénticas, por lo que la elección práctica entre ellos suele depender del precio, la velocidad y el ecosistema, más que de una diferencia significativa en inteligencia.
¿Cuál es el modelo de código abierto más inteligente?
GLM-5.2 es actualmente el modelo de pesos abiertos más inteligente, con una puntuación de 51,1 en el índice de inteligencia, superando a DeepSeek V4 Pro (44,3) y DeepSeek V4 Flash (40,3). Esto sitúa a los mejores modelos abiertos a tan solo unos cuatro puntos de los modelos propietarios de vanguardia, como GPT-5.5, al tiempo que permanecen libres para ser alojados localmente o ejecutados mediante APIs de bajo costo.
¿Qué modelo de IA ofrece la mejor relación calidad-precio?
DeepSeek V4 Flash y GLM-5.2 ofrecen la mejor relación entre inteligencia y costo. DeepSeek V4 Flash obtiene una puntuación de 40,3 a una fracción mínima del precio de Opus 4.8, entregando aproximadamente el 70 % de la puntuación máxima por un porcentaje muy pequeño del costo. Para cargas de trabajo de alto volumen y sensibles al presupuesto, estos modelos abiertos son claramente los líderes en valor.
¿Cómo se calcula la puntuación de inteligencia?
Nuestras puntuaciones siguen el Índice de Inteligencia Artificial Analysis v4.1, una puntuación compuesta de 0 a 100 basada en nueve evaluaciones exigentes —entre ellas Humanity's Last Exam, GPQA Diamond, Terminal-Bench, SciCode y tareas de uso de herramientas agénticas—. Mide razonamiento, conocimientos, programación y capacidad agéntica en un solo número, de modo que una puntuación más alta indica una mayor capacidad general en tareas difíciles y reales.
