Saturday, 10 October 2026 | Updating Daily AI insight, written for builders

Ranking de LLMs 2026 — Índice de Inteligência de Modelos de IA

Em 2026, o Claude Opus 4.8 lidera nosso índice de inteligência com 55,7 pontos, ligeiramente à frente do GPT-5.5 da OpenAI (54,8). O Gemini 3.5 Flash da Google (50,2) e o modelo de peso aberto GLM-5.2 (51,1) ficam logo atrás, seguidos pelo Gemini 3.1 Pro (46,5) e pelo DeepSeek V4 Pro (44,3), que completam o grupo de modelos de ponta. Se sua escolha for realmente entre os dois assistentes, e não entre os modelos brutos, a comparação Claude vs ChatGPT aborda essa questão diretamente. O único modelo considerado "melhor" depende de como você pondera inteligência, preço e velocidade.

A coluna Inteligência apresenta uma pontuação composta de 0 a 100, baseada no Artificial Analysis Intelligence Index v4.1, que combina nove avaliações exigentes avaliações abrangendo raciocínio, programação, uso agente de ferramentas e conhecimento científico. Quanto maior a pontuação, mais inteligente o modelo — contudo, uma diferença de dois pontos no topo da escala raramente altera a qualidade real da saída; portanto, trate grupos de modelos com pontuações próximas como aproximadamente equivalentes, em vez de interpretar pequenas diferenças como decisivas.

Leia a inteligência em conjunto com preço e velocidade. Um modelo de vanguarda como o Opus 4.8 custa muito mais por token do que o DeepSeek V4 Flash (40,3) ou o GLM-5.2, que oferecem 70–90% da inteligência a uma fração do custo. Para cargas de trabalho de alto volume ou sensíveis à latência, um modelo mais barato e rápido normalmente se sai melhor; já para as tarefas mais difíceis de raciocínio e agência, o topo da tabela justifica seu custo premium. Ordene pela métrica que corresponde ao seu caso de uso.

# Modelo ↓ Desenvolvedor Inteligência ↓ Contexto ↓ Entrada: US$ por 1 milhão ↓ Saída: US$ por 1 milhão ↓ Pesos abertos
1 Claude Opus 5 Anthropic 61 1 milhão $5.00 $25.00 Não
2 GPT-6 Astra OpenAI 61 1,05 milhão $10.00 $50.00 Não
3 Claude Fable 5 Anthropic 60 1 milhão $10.00 $50.00 Não
4 GPT-5.6 Sol OpenAI 59 1,05 milhão $5.00 $30.00 Não
5 Kimi K3 Moonshot AI 57 1 milhão $3.00 $15.00 Sim
6 Claude Opus 4.8 Anthropic 55.7 1 milhão $5.00 $25.00 Não
7 GPT-5.5 OpenAI 54.8 1,05 milhão $5.00 $30.00 Não
8 GLM 5.2 Zhipu AI 51.1 1 milhão $1.40 $4.40 Sim
9 Gemini 3.5 Flash Google 50.2 1 milhão $1.50 $9.00 Não
10 Claude Sonnet 4.6 Anthropic 47 1 milhão $3.00 $15.00 Não
11 Gemini 3.1 Pro Google 46.5 1,05 milhão $2.00 $12.00 Não
12 DeepSeek V4-Pro DeepSeek 44.3 1 milhão $0.44 $0.87 Sim
13 Kimi K2.7 Code Moonshot AI 42 256K $0.60 $2.50 Sim
14 DeepSeek V4-Flash DeepSeek 40.3 1 milhão $0.14 $0.28 Sim
15 Claude Haiku 4.5 Anthropic 37 200 mil $1.00 $5.00 Não
16 DeepSeek R1 DeepSeek 20.1 128K $0.50 $2.15 Sim
17 Mistral Large 3 Mistral AI 15.9 256K $2.00 $6.00 Sim
18 Llama 4 Maverick Meta 14.3 1 milhão $0.20 $0.80 Sim
19 Qwen3 235B-A22B Alibaba 13 128K $0.45 $1.80 Sim
20 Qwen3 32B Alibaba 12 128K $0.08 $0.28 Sim
21 Llama 4 Scout Meta 10.0 10 milhões $0.10 $0.30 Sim
22 Gemma 3 27B Google 7.4 128K $0.08 $0.16 Sim
23 Phi-4 Microsoft 4.9 16K $0.07 $0.14 Sim
24 Claude Opus 5.5 Anthropic — — $4.00 $20.00 Não
25 Claude Sonnet 5 Anthropic — 1 milhão $2.00 $10.00 Não
26 Claude Sonnet 5.5 Anthropic — — $2.00 $10.00 Não
27 DeepSeek R1 Distill Llama 70B DeepSeek — 128K $0.80 $0.80 Sim
28 Gemini 2.5 Pro Google — 1 milhão (1.048.576 tokens) $1.25 $10.00 Não
29 Gemini 3.6 Flash Google — 1 milhão $1.50 $7.50 Não
30 Gemini 3.8 Flash Google — 1 milhão $0.75 $3.75 Não
31 Gemini 4 Argon Google DeepMind — — $2.00 $10.00 Não
32 Gemma 3 12B Google — 128K $0.05 $0.15 Sim
33 Gemma 3 4B Google — 128K $0.05 $0.10 Sim
34 GPT-6 Luna OpenAI — 1,05 milhão $0.10 $0.50 Não
35 GPT-6 Sol OpenAI — 1,05 milhão $2.00 $10.00 Não
36 GPT-6.1 Sol OpenAI — — $2.00 $10.00 Não
37 Grok 4 xAI — 256.000 tokens $3.00 $15.00 Não
38 Kling 2.5 Turbo Pro Kuaishou — — — — Não
39 Llama 3.1 8B Meta — 128K $0.02 $0.03 Sim
40 Llama 3.3 70B Meta — 128K $0.10 $0.32 Sim
41 MiniMax H3 (Hailuo 3.0) MiniMax — — — — Sim
42 Mistral 7B Mistral AI — 32K $0.02 $0.03 Sim
43 Mistral NeMo 12B Mistral AI — 128K $0.02 $0.04 Sim
44 NVIDIA Nemotron 3 Nano Omni NVIDIA — 256K — — Sim
45 Qwen3 14B Alibaba — 128K $0.12 $0.24 Sim
46 Qwen3 30B-A3B Alibaba — 128K $0.12 $0.50 Sim
47 Qwen3 8B Alibaba — 128K $0.04 $0.14 Sim
48 Seedance 2.5 ByteDance — — — — Não
49 Sora 2 OpenAI — — — — Não
50 Sora 2 Pro OpenAI — — — — Não
51 Veo 3.1 Google — — — — Não
52 Wan 2.5 Alibaba — — — — Não

Click any column heading to re-sort. Intelligence = a 0–100 composite of public reasoning/knowledge benchmarks; — means not yet scored. Prices are USD per 1M tokens. Updated October 2026.

Perguntas frequentes

Qual é o melhor LLM atualmente?

Na metade de 2026, o Claude Opus 4.8 é o modelo com a maior pontuação no Índice de Inteligência Artificial Analysis (55,7), ligeiramente à frente do GPT-5.5 (54,8). Ambos lideram em raciocínio, programação e tarefas agênticas, de modo que a escolha prática entre eles geralmente depende de preço, velocidade e ecossistema, e não de uma diferença significativa de inteligência.

Qual é o modelo de código aberto mais inteligente?

O GLM-5.2 é atualmente o modelo de pesos abertos mais inteligente, obtendo 51,1 pontos no índice de inteligência — à frente do DeepSeek V4 Pro (44,3) e do DeepSeek V4 Flash (40,3). Isso posiciona os melhores modelos abertos a cerca de quatro pontos dos modelos proprietários de vanguarda, como o GPT-5.5, mantendo-se gratuitos para hospedagem própria ou executáveis por meio de APIs de baixo custo.

Qual modelo de IA oferece o melhor custo-benefício?

O DeepSeek V4 Flash e o GLM-5.2 oferecem a melhor relação inteligência-por-dólar. O DeepSeek V4 Flash obtém 40,3 pontos a uma fração mínima do preço do Opus 4.8, entregando cerca de 70% da pontuação máxima por apenas uma pequena porcentagem do custo. Para cargas de trabalho com orçamento limitado e alto volume, esses modelos abertos são claramente os líderes em valor.

Como é calculada a pontuação de inteligência?

Nossas pontuações seguem o Índice de Inteligência Artificial Analysis v4.1, uma pontuação composta de 0 a 100 derivada de nove avaliações exigentes — incluindo o Humanity's Last Exam, o GPQA Diamond, o Terminal-Bench, o SciCode e tarefas de uso agêntico de ferramentas. Ela mede raciocínio, conhecimento, programação e capacidade agêntica em um único número, de modo que uma pontuação mais alta indica maior capacidade geral em tarefas difíceis e do mundo real.

Scroll to Top