Thursday, 6 August 2026 | Updating Daily AI insight, written for builders

Explicação dos Benchmarks de IA (2026): O que cada um mede e quem lidera

Um benchmark de IA é um conjunto fixo de tarefas usado para avaliar a capacidade de um modelo, de modo que
modelos diferentes possam ser comparados no mesmo teste.
Não existe um único benchmark que
defina qual modelo é o melhor — cada um mede algo específico, e diversos benchmarks conhecidos
já estão quase saturados. A abordagem prática consiste em analisar os dois ou três benchmarks que correspondem à sua
carga de trabalho real e tratar qualquer número isolado divulgado como título com ceticismo.

Quem lidera atualmente

Classificados pelo Índice de Inteligência Artificial da Artificial Analysis, uma composição de diversas
avaliações independentes, em vez de um único teste. A última coluna é aquela que a maioria das comparações omite: o resultado
dividido pelo preço médio ponderado, que é, afinal, o que você realmente está comprando.

#ModeloDesenvolvedorPontuação de inteligênciaCusto médio ponderado por US$ 1 milhãoPontuação por dólar
1Claude Opus 5Anthropic61$9.006.8
2Claude Fable 5Anthropic60$18.003.3
3GPT-5.6 SolOpenAI59$10.005.9
4Kimi K3 pesos abertosMoonshot AI57$5.4010.6
5Claude Opus 4.8Anthropic55.7$9.006.2
6GPT-5.5OpenAI54.8$10.005.5
7GLM 5.2 pesos abertosZhipu AI51.1$2.0025.6
8Gemini 3.5 FlashGoogle50.2$3.0016.7
9Claude Sonnet 4.6Anthropic47$5.408.7
10Gemini 3.1 ProGoogle46.5$4.0011.6
11DeepSeek V4-Pro pesos abertosDeepSeek44.3$0.52284.9
12Kimi K2.7 Code pesos abertosMoonshot AI42$0.98042.9

As pontuações seguem a escala do Índice de Inteligência Artificial da Artificial Analysis, uma composição de diversas avaliações independentes, em vez de um único teste — essa é a maneira correta de interpretar uma afirmação de título como "melhor modelo". A entrada mais forte com pesos abertos é Kimi K3 com 57 pontos. Ordene o conjunto completo conforme sua preferência na Ranking de LLMs.

Benchmarks relevantes em 2026

MMLU (Compreensão Massiva de Linguagem em Múltiplas Tarefas)

Questões de múltipla escolha em 57 áreas distintas, desde matemática elementar até direito profissional.
Durante anos, foi o principal indicador divulgado, mas esse agora é justamente o problema: modelos de ponta apresentam resultados tão próximos no topo que as diferenças entre eles caem dentro da margem de ruído. O MMLU ainda é
útil para comparar um modelo aberto menor com um modelo maior, mas praticamente inútil para distinguir
dois modelos de ponta. Trate qualquer afirmação sobre o MMLU em 2026 como uma verificação mínima de desempenho, não como uma classificação definitiva.
dois modelos de ponta. Trate uma alegação de MMLU de 2026 como um teste de limite inferior, não como uma classificação.

GPQA (Perguntas e Respostas de Nível de Pós-Graduação, resistente ao Google)

Elaborado por doutores especializados em biologia, física e química, e intencionalmente projetado para que
buscar informações na web não ajude. Ele responde a uma pergunta diferente da do MMLU: não "o modelo leu muito?", mas sim "o modelo consegue raciocinar sobre um problema genuinamente difícil em uma área técnica?". Como
resiste tanto à memorização quanto à recuperação de informações, o GPQA envelheceu melhor do que o MMLU como discriminador.
ele resiste tanto à memorização quanto à recuperação, tendo envelhecido melhor do que o MMLU como discriminador.

SWE-bench Verificado

Relatórios reais de bugs provenientes de repositórios reais do GitHub, avaliados com base na capacidade do patch gerado pelo modelo de corrigir o
os testes próprios do projeto passam. O subconjunto Verificado é a porção validada por humanos, filtrada para remover
tarefas que estavam quebradas ou impossíveis — razão pela qual você deve verificar qual o SWE-bench um
fornecedor está cotando. Este é o benchmark mais relevante para tomada de decisão se você estiver escolhendo um
modelo para um agente de programação, pois tanto a tarefa quanto a avaliação são autênticas. O Claude Sonnet 5
registra 85,2% no SWE-bench Verificado e 63,2% no mais difícil SWE-bench Pro.

Terminal-Bench

Tarefas agênticas executadas em um terminal real: instalar algo, diagnosticar uma falha, criar um script para
corrigi-la. Ele mede uma habilidade distinta da escrita de um patch — tolerância a trabalhos multietapa nos quais
o modelo deve ler sua própria saída de erro e se recuperar. O Claude Sonnet 5 registra 80,4% no
Terminal-Bench 2.1. Se seu caso de uso for um agente autônomo, e não um assistente de código embutido, este e o OSWorld revelam mais do que o SWE-bench.
assistente, este e o OSWorld revelam mais do que o SWE-bench.

OSWorld

Uso do computador em um ambiente de desktop real — abrir aplicativos, clicar em interfaces,
concluir uma tarefa que uma pessoa faria com um mouse. Os resultados aqui são muito inferiores aos obtidos em benchmarks textuais em toda a linha, o que constitui um sinal honesto sobre o quão imaturos ainda são os agentes de uso computacional.
Claude Sonnet 5 registra 81,2% no OSWorld-Verificado; o Nemotron 3 Nano Omni, da NVIDIA,
um modelo aberto de 30 bilhões de parâmetros, registra 47,4% no OSWorld — um resultado razoável para seu tamanho.
um modelo aberto de 30 bilhões de parâmetros, registra 47,4% no OSWorld, um resultado razoável para seu tamanho.

ARC-AGI

Quebra-cabeças abstratos de raciocínio visual projetados de modo que a correspondência de padrões a partir dos dados de treinamento não seja transferível. Cada tarefa consiste em poucas transformações de grade que o modelo deve inferir a partir de alguns exemplos.
O ARC-AGI é o teste mais próximo que o campo possui de uma avaliação de generalização genuína, em vez de mera recuperação de memória, razão pela qual o progresso nele é lento e saltos significativos são tratados como eventos importantes.
O Claude Opus 5 é relatado com desempenho aproximadamente três vezes superior ao do segundo melhor modelo no ARC-AGI 3.
Perguntas elaboradas por especialistas em diversas áreas, criadas especificamente para resistir à saturação que afetou o MMLU. O objetivo de projeto é um benchmark que permaneça desafiador à medida que os modelos evoluem,
de modo que as pontuações sejam intencionalmente baixas e pequenos ganhos sejam significativos. Leia-o como um discriminador de fronteira, não como uma medida de utilidade para tarefas cotidianas.

O Último Exame da Humanidade

Não é um teste, mas uma composição que combina várias avaliações independentes em uma única pontuação. Esse é seu valor: qualquer benchmark individual pode ser alvo de otimização específica, enquanto uma combinação é muito mais difícil de manipular. É a escala utilizada na tabela acima. O Claude Opus 5 é o atual líder com 61 pontos, seguido pelo Claude Fable 5 com 60 e pelo GPT-5.6 Sol com 59 — e o Kimi K3 com 57, o melhor resultado registrado entre modelos de pesos abertos, situando-se apenas quatro pontos abaixo do melhor modelo fechado.
saturação que superou o MMLU. O objetivo de projeto é um benchmark que permaneça desafiador à medida que os modelos evoluem,
de modo que as pontuações sejam intencionalmente baixas e pequenos ganhos sejam significativos. Interprete-o como um discriminador de ponta,
não como uma medida de utilidade para tarefas cotidianas.

Índice de Inteligência Artificial da Artificial Analysis

Não é um teste isolado, mas uma composição que combina várias avaliações independentes em uma única pontuação. Esse é
seu valor: qualquer benchmark individual pode ser alvo de otimização específica, enquanto uma combinação é muito mais difícil de ser manipulada. É a
escala utilizada na tabela acima. O Claude Opus 5 é o atual líder com 61 pontos, seguido pelo Claude Fable 5 com 60 e pelo GPT-5.6 Sol com 59 — e o Kimi K3 com 57, o melhor resultado registrado até agora entre modelos de peso aberto, situando-se
a apenas quatro pontos do melhor modelo fechado.
a menos de quatro pontos do melhor modelo fechado.

Como interpretar uma alegação de desempenho em benchmark

Pergunte quem o executou. Uma pontuação divulgada pelo próprio fornecedor em sua página de lançamento e uma avaliação independente são tipos distintos de evidência. Os leaderboards independentes aplicam o mesmo 'harness' (estrutura de avaliação) a todos os modelos; já o fornecedor escolhe suas próprias condições.
Verifique a contaminação.
Se as perguntas de um benchmark forem anteriores ao corte de dados de treinamento de um modelo e estiverem publicamente disponíveis, é provável que algumas delas façam parte dos dados de treinamento. Essa é a principal razão pela qual benchmarks antigos tendem a inflacionar ao longo do tempo e por que os mais recentes são construídos para serem "à prova do Google" ou totalmente reservados.

Atente-se à mudança de critério. "SWE-bench" sem a especificação "Verificado", um subconjunto não nomeado,
um número diferente de tentativas ou uma pontuação obtida com uso de ferramentas comparada a outra sem esse recurso — essas são as formas habituais pelas quais uma comparação deixa de ser 'lado a lado'.
Cuidado com a saturação.
Quando todos os modelos sérios obtêm mais de 90 pontos em um teste, esse teste deixou de classificar qualquer coisa. Diferenças de um ou dois pontos no topo de um benchmark saturado são ruído, não sinal.

O preço faz parte da pontuação. Um modelo com dois pontos a mais de desempenho, mas seis vezes mais caro, não é melhor para a maioria das cargas de trabalho. É por isso que a tabela acima inclui uma coluna de 'pontuação por dólar' e por que o
índice de desempenho por custo
existe.

Qual benchmark você realmente deveria considerar? Construção de um agente de programação:
SWE-bench Verificado em primeiro lugar, Terminal-Bench em segundo.
os benchmarks são ruído, não sinal.

O preço faz parte da pontuação. Um modelo dois pontos melhor, mas seis vezes mais
caro, não é melhor para a maioria das cargas de trabalho. É por isso que a tabela acima inclui uma coluna de pontuação por dólar
e por que o índice de desempenho por preço
existe.
existe.

Qual benchmark você realmente deve levar em conta?

Construindo um agente de programação: SWE-bench Verified em primeiro lugar, Terminal-Bench em segundo.
Ignore completamente o MMLU.

Construir um agente para uso de computador ou desktop: OSWorld, seguido por Terminal-Bench.
Espere que os valores absolutos sejam baixos.

Resposta a perguntas técnicas ou científicas: GPQA e Humanity’s Last Exam, caso
suas perguntas sejam realmente de nível especializado.

Assistente geral ou chat: um índice composto é mais informativo do que qualquer
único teste, pois nenhum benchmark individual reflete a diversidade de tarefas que usuários reais solicitam.

Escolher um modelo pequeno para hospedagem própria: os benchmarks importam menos do que a adequação. Verifique
o que realmente roda em seu hardware com
Calculadora de VRAM primeiro lugar e, só então, compare
os resultados dos benchmarks apenas entre os modelos compatíveis.

Resultados de benchmarks publicados em nossa base de dados

ModeloResultados publicados
GPT-5.6 SolÍndice de Inteligência Artificial da Artificial Analysis: 59.
Claude Sonnet 5SWE-Bench Verified: 85,2%; SWE-Bench Pro: 63,2%; Terminal-Bench 2.1: 80,4%; OSWorld-Verified: 81,2%.
Claude Opus 5Índice de Inteligência Artificial da Artificial Analysis: 61 (classificado em #1 entre 170 modelos). Mais do que duplica o desempenho do Opus 4.8 no Frontier-Bench v0.1; cerca de três vezes o desempenho do próximo melhor modelo no ARC-AGI 3.
NVIDIA Nemotron 3 Nano OmniOCRBench V2: 67,04 | Video-MME: 72,2 | OSWorld: 47,4 | Speech IF: 89,39

Apenas modelos cujos desenvolvedores publicam dados específicos estão listados. A ausência aqui significa que não verificamos um número publicado, não que o modelo tenha desempenho ruim — o que, por si só, já é uma informação relevante quando um fornecedor destaca uma afirmação baseada em benchmark.

Perguntas frequentes

O que é um benchmark de IA?

Um conjunto fixo de tarefas com um método de pontuação definido, usado para permitir que diferentes modelos sejam
comparados com entradas idênticas. Os benchmarks variam desde testes de conhecimento de múltipla escolha, como o MMLU,
até tarefas agênticas, como resolver problemas reais no GitHub no SWE-bench, medindo cada um uma fatia estreita de habilidade, em vez de avaliar a qualidade geral.
qualquer única avaliação. Índices compostos são a métrica mais confiável para resumo geral, pois combinar

Qual benchmark de IA é o mais confiável?

Nenhum único. Índices compostos são a métrica mais confiável para resumo geral, pois combinar
várias avaliações é muito mais difícil de manipular do que otimizar para um único teste. Para uma decisão específica, o benchmark mais confiável é aquele que mais se assemelha à sua carga de trabalho real —
SWE-bench Verified para agentes de programação, OSWorld para uso de computador e GPQA para raciocínio técnico.
SWE-bench Verified para agentes de programação, OSWorld para uso de computador e GPQA para raciocínio técnico.

Qual é uma boa pontuação no MMLU em 2026?

O MMLU está amplamente saturado entre os modelos de ponta, portanto, uma alta pontuação já não os distingue.
Continua sendo útil para posicionar modelos abertos menores, nos quais a variação ainda é ampla. Se você estiver
comparando dois modelos de ponta, o MMLU não os diferenciará, e o GPQA ou um índice composto serão mais indicados.
comparando dois modelos de ponta, o MMLU não os diferenciará, e o GPQA ou um índice composto serão mais indicados.

É possível manipular benchmarks de IA?

Sim, de duas maneiras. Os dados de treinamento podem incluir as perguntas de um benchmark, inflando artificialmente as pontuações sem
nenhum ganho real de capacidade — razão pela qual benchmarks mais recentes são projetados para resistir à busca e
à memorização. Além disso, as condições de avaliação podem ser escolhidas de forma favorável: um subconjunto diferente, mais
tentativas ou o uso de ferramentas comparado contra um modelo que não as utiliza. Leaderboards independentes e
índices compostos mitigam ambos os problemas.

As pontuações em benchmarks preveem o desempenho no mundo real?

Parcialmente. Benchmarks com tarefas autênticas, como o SWE-bench Verified e o OSWorld, predizem razoavelmente
bem, pois a tarefa avaliada é exatamente a tarefa real. Já benchmarks acadêmicos de múltipla escolha predizem mal,
porque responder questões de provas não é o que a maioria das aplicações faz. O preditor mais forte continua sendo
uma avaliação personalizada que você constrói com seus próprios dados.

Qual modelo de peso aberto obtém a maior pontuação?

Kimi K3, com 57 no Índice de Inteligência Artificial da Artificial Analysis — o melhor resultado registrado para modelos de peso aberto, a apenas quatro pontos do melhor modelo fechado. A tabela de líderes acima marca todas as entradas de modelos de peso aberto, e o conjunto completo é ordenável na
registrado, dentro de quatro pontos do melhor modelo fechado. A tabela de líderes acima marca todos os
entrada de código aberto e o conjunto completo é classificável na
Ranking de LLMs.

Scroll to Top
Featured on There's An AI For That