Saturday, 10 October 2026 | Updating Daily AI insight, written for builders

Clasificación de LLM 2026 — Índice de Inteligencia de Modelos de IA

En 2026, Claude Opus 4.8 lidera nuestro índice de inteligencia con una puntuación de 55,7, ligeramente por encima de GPT-5.5 de OpenAI (54,8). Gemini 3.5 Flash de Google (50,2) y GLM-5.2, de código abierto (51,1), le siguen de cerca, mientras que Gemini 3.1 Pro (46,5) y DeepSeek V4 Pro (44,3) completan el grupo de modelos punteros. Si su elección realmente se limita a comparar los dos asistentes y no los modelos subyacentes en bruto, la comparación Claude frente a ChatGPT analiza esa confrontación directa. El único modelo «mejor» depende de cómo equilibre usted la inteligencia frente al precio y la velocidad.

La columna Inteligencia muestra una puntuación compuesta de 0 a 100 basada en el Índice de Inteligencia Artificial Analysis v4.1, que combina nueve evaluaciones rigurosas que abarcan razonamiento, programación, uso agente de herramientas y conocimientos científicos. Una puntuación más alta indica mayor inteligencia, pero una diferencia de dos puntos en la parte superior del ranking rara vez afecta la calidad real de la salida; por tanto, trate los grupos de modelos como aproximadamente equivalentes, en lugar de considerar diferencias mínimas como definitivas. que abarcan el razonamiento, la programación, el uso de herramientas por agentes y los conocimientos científicos. Cuanto mayor sea la puntuación, más inteligente será el modelo; sin embargo, una diferencia de dos puntos en la parte superior casi nunca afecta la calidad real de la salida, por lo que conviene considerar a los modelos agrupados como aproximadamente equivalentes, en lugar de interpretar diferencias mínimas como decisivas.

Evalúe la inteligencia junto con el precio y la velocidad. Un modelo de vanguardia como Opus 4.8 cuesta mucho más por token que DeepSeek V4 Flash (40,3) o GLM-5.2, los cuales ofrecen del 70 al 90 % de la inteligencia a una fracción del costo. Para trabajos de alto volumen o sensibles a la latencia, suele imponerse un modelo más económico y rápido; para las tareas de razonamiento y agencia más exigentes, la parte superior de la tabla justifica su prima. Ordene según la métrica que mejor se adapte a su caso de uso.

# Modelo ↓ Desarrollador Inteligencia ↓ Contexto ↓ Entrada: $/1 millón ↓ Salida: $/1 millón ↓ Pesos abiertos
1 Claude Opus 5 Anthropic 61 1 millón $5.00 $25.00 No
2 GPT-6 Astra OpenAI 61 1,05 millones $10.00 $50.00 No
3 Claude Fable 5 Anthropic 60 1 millón $10.00 $50.00 No
4 GPT-5.6 Sol OpenAI 59 1,05 millones $5.00 $30.00 No
5 Kimi K3 Moonshot AI 57 1 millón $3.00 $15.00 Sí
6 Claude Opus 4.8 Anthropic 55.7 1 millón $5.00 $25.00 No
7 GPT-5.5 OpenAI 54.8 1,05 millones $5.00 $30.00 No
8 GLM 5.2 Zhipu AI 51.1 1 millón $1.40 $4.40 Sí
9 Gemini 3.5 Flash Google 50.2 1 millón $1.50 $9.00 No
10 Claude Sonnet 4.6 Anthropic 47 1 millón $3.00 $15.00 No
11 Gemini 3.1 Pro Google 46.5 1,05 millones $2.00 $12.00 No
12 DeepSeek V4-Pro DeepSeek 44.3 1 millón $0.44 $0.87 Sí
13 Kimi K2.7 Code Moonshot AI 42 256K $0.60 $2.50 Sí
14 DeepSeek V4-Flash DeepSeek 40.3 1 millón $0.14 $0.28 Sí
15 Claude Haiku 4.5 Anthropic 37 200 000 $1.00 $5.00 No
16 DeepSeek R1 DeepSeek 20.1 128 K $0.50 $2.15 Sí
17 Mistral Large 3 Mistral AI 15.9 256K $2.00 $6.00 Sí
18 Llama 4 Maverick Meta 14.3 1 millón $0.20 $0.80 Sí
19 Qwen3 235B-A22B Alibaba 13 128 K $0.45 $1.80 Sí
20 Qwen3 32B Alibaba 12 128 K $0.08 $0.28 Sí
21 Llama 4 Scout Meta 10.0 10M $0.10 $0.30 Sí
22 Gemma 3 27B Google 7.4 128 K $0.08 $0.16 Sí
23 Phi-4 Microsoft 4.9 16K $0.07 $0.14 Sí
24 Claude Opus 5.5 Anthropic — — $4.00 $20.00 No
25 Claude Sonnet 5 Anthropic — 1 millón $2.00 $10.00 No
26 Claude Sonnet 5.5 Anthropic — — $2.00 $10.00 No
27 DeepSeek R1 Distill Llama 70B DeepSeek — 128 K $0.80 $0.80 Sí
28 Gemini 2.5 Pro Google — 1 millón (1 048 576 tokens) $1.25 $10.00 No
29 Gemini 3.6 Flash Google — 1 millón $1.50 $7.50 No
30 Gemini 3.8 Flash Google — 1 millón $0.75 $3.75 No
31 Gemini 4 Argon Google DeepMind — — $2.00 $10.00 No
32 Gemma 3 12B Google — 128 K $0.05 $0.15 Sí
33 Gemma 3 4B Google — 128 K $0.05 $0.10 Sí
34 GPT-6 Luna OpenAI — 1,05 millones $0.10 $0.50 No
35 GPT-6 Sol OpenAI — 1,05 millones $2.00 $10.00 No
36 GPT-6.1 Sol OpenAI — — $2.00 $10.00 No
37 Grok 4 xAI — 256 000 tokens $3.00 $15.00 No
38 Kling 2.5 Turbo Pro Kuaishou — — — — No
39 Llama 3.1 8B Meta — 128 K $0.02 $0.03 Sí
40 Llama 3.3 70B Meta — 128 K $0.10 $0.32 Sí
41 MiniMax H3 (Hailuo 3.0) MiniMax — — — — Sí
42 Mistral 7B Mistral AI — 32K $0.02 $0.03 Sí
43 Mistral NeMo 12B Mistral AI — 128 K $0.02 $0.04 Sí
44 NVIDIA Nemotron 3 Nano Omni NVIDIA — 256K — — Sí
45 Qwen3 14B Alibaba — 128 K $0.12 $0.24 Sí
46 Qwen3 30B-A3B Alibaba — 128 K $0.12 $0.50 Sí
47 Qwen3 8B Alibaba — 128 K $0.04 $0.14 Sí
48 Seedance 2.5 ByteDance — — — — No
49 Sora 2 OpenAI — — — — No
50 Sora 2 Pro OpenAI — — — — No
51 Veo 3.1 Google — — — — No
52 Wan 2.5 Alibaba — — — — No

Click any column heading to re-sort. Intelligence = a 0–100 composite of public reasoning/knowledge benchmarks; — means not yet scored. Prices are USD per 1M tokens. Updated October 2026.

Preguntas frecuentes

¿Cuál es el mejor modelo de lenguaje grande (LLM) actualmente?

A mediados de 2026, Claude Opus 4.8 es el modelo con la puntuación más alta en el Índice de Inteligencia Artificial Analysis (55,7), ligeramente por delante de GPT-5.5 (54,8). Ambos lideran en razonamiento, programación y tareas agénticas, por lo que la elección práctica entre ellos suele depender del precio, la velocidad y el ecosistema, más que de una diferencia significativa en inteligencia.

¿Cuál es el modelo de código abierto más inteligente?

GLM-5.2 es actualmente el modelo de pesos abiertos más inteligente, con una puntuación de 51,1 en el índice de inteligencia, superando a DeepSeek V4 Pro (44,3) y DeepSeek V4 Flash (40,3). Esto sitúa a los mejores modelos abiertos a tan solo unos cuatro puntos de los modelos propietarios de vanguardia, como GPT-5.5, al tiempo que permanecen libres para ser alojados localmente o ejecutados mediante APIs de bajo costo.

¿Qué modelo de IA ofrece la mejor relación calidad-precio?

DeepSeek V4 Flash y GLM-5.2 ofrecen la mejor relación entre inteligencia y costo. DeepSeek V4 Flash obtiene una puntuación de 40,3 a una fracción mínima del precio de Opus 4.8, entregando aproximadamente el 70 % de la puntuación máxima por un porcentaje muy pequeño del costo. Para cargas de trabajo de alto volumen y sensibles al presupuesto, estos modelos abiertos son claramente los líderes en valor.

¿Cómo se calcula la puntuación de inteligencia?

Nuestras puntuaciones siguen el Índice de Inteligencia Artificial Analysis v4.1, una puntuación compuesta de 0 a 100 basada en nueve evaluaciones exigentes —entre ellas Humanity's Last Exam, GPQA Diamond, Terminal-Bench, SciCode y tareas de uso de herramientas agénticas—. Mide razonamiento, conocimientos, programación y capacidad agéntica en un solo número, de modo que una puntuación más alta indica una mayor capacidad general en tareas difíciles y reales.

Scroll to Top