{"id":2102,"date":"2026-08-03T19:59:47","date_gmt":"2026-08-03T19:59:47","guid":{"rendered":"https:\/\/convly.ai\/ai-benchmarks\/"},"modified":"2026-08-03T19:59:47","modified_gmt":"2026-08-03T19:59:47","slug":"ai-benchmarks","status":"publish","type":"page","link":"https:\/\/convly.ai\/pt\/ai-benchmarks\/","title":{"rendered":"Explica\u00e7\u00e3o dos Benchmarks de IA (2026): O que cada um mede e quem lidera"},"content":{"rendered":"<p><strong>Um benchmark de IA \u00e9 um conjunto fixo de tarefas usado para avaliar a capacidade de um modelo, de modo que<br \/>\nmodelos diferentes possam ser comparados no mesmo teste.<\/strong> N\u00e3o existe um \u00fanico benchmark que<br \/>\ndefina qual modelo \u00e9 o melhor \u2014 cada um mede algo espec\u00edfico, e diversos benchmarks conhecidos<br \/>\nj\u00e1 est\u00e3o quase saturados. A abordagem pr\u00e1tica consiste em analisar os dois ou tr\u00eas benchmarks que correspondem \u00e0 sua<br \/>\ncarga de trabalho real e tratar qualquer n\u00famero isolado divulgado como t\u00edtulo com ceticismo.<\/p>\n<h2>Quem lidera atualmente<\/h2>\n<p>Classificados pelo \u00cdndice de Intelig\u00eancia Artificial da Artificial Analysis, uma composi\u00e7\u00e3o de diversas<br \/>\navalia\u00e7\u00f5es independentes, em vez de um \u00fanico teste. A \u00faltima coluna \u00e9 aquela que a maioria das compara\u00e7\u00f5es omite: o resultado<br \/>\ndividido pelo pre\u00e7o m\u00e9dio ponderado, que \u00e9, afinal, o que voc\u00ea realmente est\u00e1 comprando.<\/p>\n<div class=\"cbm\">\n  <table class=\"cm-table cbm-lead\">\n    <thead><tr><th>#<\/th><th>Modelo<\/th><th>Desenvolvedor<\/th><th>Pontua\u00e7\u00e3o de intelig\u00eancia<\/th>\n      <th>Custo m\u00e9dio ponderado por US$ 1 milh\u00e3o<\/th><th>Pontua\u00e7\u00e3o por d\u00f3lar<\/th><\/tr><\/thead>\n    <tbody>\n          <tr>\n        <td data-label=\"#\">1<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/claude-opus-5\/\">Claude Opus 5<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>61<\/strong><\/td>\n        <td data-label=\"Blended\">$9.00<\/td>\n        <td data-label=\"Score per $\">6.8<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">2<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/claude-fable-5\/\">Claude Fable 5<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>60<\/strong><\/td>\n        <td data-label=\"Blended\">$18.00<\/td>\n        <td data-label=\"Score per $\">3.3<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">3<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/gpt-5-6-sol\/\">GPT-5.6 Sol<\/a><\/td>\n        <td data-label=\"Developer\">OpenAI<\/td>\n        <td data-label=\"Score\"><strong>59<\/strong><\/td>\n        <td data-label=\"Blended\">$10.00<\/td>\n        <td data-label=\"Score per $\">5.9<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">4<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/kimi-k3\/\">Kimi K3<\/a> <span class=\"cbm-tag\">pesos abertos<\/span><\/td>\n        <td data-label=\"Developer\">Moonshot AI<\/td>\n        <td data-label=\"Score\"><strong>57<\/strong><\/td>\n        <td data-label=\"Blended\">$5.40<\/td>\n        <td data-label=\"Score per $\">10.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">5<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/claude-opus-4-8\/\">Claude Opus 4.8<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>55.7<\/strong><\/td>\n        <td data-label=\"Blended\">$9.00<\/td>\n        <td data-label=\"Score per $\">6.2<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">6<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/gpt-5-5\/\">GPT-5.5<\/a><\/td>\n        <td data-label=\"Developer\">OpenAI<\/td>\n        <td data-label=\"Score\"><strong>54.8<\/strong><\/td>\n        <td data-label=\"Blended\">$10.00<\/td>\n        <td data-label=\"Score per $\">5.5<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">7<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/glm-5-2\/\">GLM 5.2<\/a> <span class=\"cbm-tag\">pesos abertos<\/span><\/td>\n        <td data-label=\"Developer\">Zhipu AI<\/td>\n        <td data-label=\"Score\"><strong>51.1<\/strong><\/td>\n        <td data-label=\"Blended\">$2.00<\/td>\n        <td data-label=\"Score per $\">25.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">8<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/gemini-3-5-flash\/\">Gemini 3.5 Flash<\/a><\/td>\n        <td data-label=\"Developer\">Google<\/td>\n        <td data-label=\"Score\"><strong>50.2<\/strong><\/td>\n        <td data-label=\"Blended\">$3.00<\/td>\n        <td data-label=\"Score per $\">16.7<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">9<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/claude-sonnet-4-6\/\">Claude Sonnet 4.6<\/a><\/td>\n        <td data-label=\"Developer\">Anthropic<\/td>\n        <td data-label=\"Score\"><strong>47<\/strong><\/td>\n        <td data-label=\"Blended\">$5.40<\/td>\n        <td data-label=\"Score per $\">8.7<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">10<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/gemini-3-1-pro\/\">Gemini 3.1 Pro<\/a><\/td>\n        <td data-label=\"Developer\">Google<\/td>\n        <td data-label=\"Score\"><strong>46.5<\/strong><\/td>\n        <td data-label=\"Blended\">$4.00<\/td>\n        <td data-label=\"Score per $\">11.6<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">11<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/deepseek-v4-pro\/\">DeepSeek V4-Pro<\/a> <span class=\"cbm-tag\">pesos abertos<\/span><\/td>\n        <td data-label=\"Developer\">DeepSeek<\/td>\n        <td data-label=\"Score\"><strong>44.3<\/strong><\/td>\n        <td data-label=\"Blended\">$0.522<\/td>\n        <td data-label=\"Score per $\">84.9<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"#\">12<\/td>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/kimi-k2-7-code\/\">Kimi K2.7 Code<\/a> <span class=\"cbm-tag\">pesos abertos<\/span><\/td>\n        <td data-label=\"Developer\">Moonshot AI<\/td>\n        <td data-label=\"Score\"><strong>42<\/strong><\/td>\n        <td data-label=\"Blended\">$0.980<\/td>\n        <td data-label=\"Score per $\">42.9<\/td>\n      <\/tr>\n        <\/tbody>\n  <\/table>\n  <p class=\"cbm-note\">As pontua\u00e7\u00f5es seguem a escala do \u00cdndice de Intelig\u00eancia Artificial da Artificial Analysis, uma composi\u00e7\u00e3o\n     de diversas avalia\u00e7\u00f5es independentes, em vez de um \u00fanico teste \u2014 essa \u00e9 a maneira correta de\n     interpretar uma afirma\u00e7\u00e3o de t\u00edtulo como \"melhor modelo\". A entrada mais forte com pesos abertos \u00e9\n     <a href=\"https:\/\/convly.ai\/pt\/model\/kimi-k3\/\">Kimi K3<\/a>\n     com 57 pontos. Ordene o conjunto completo conforme sua prefer\u00eancia na\n     <a href=\"https:\/\/convly.ai\/pt\/llm-leaderboard\/\">Ranking de LLMs<\/a>.<\/p>\n<\/div>\n\n<h2>Benchmarks relevantes em 2026<\/h2>\n<h3>MMLU (Compreens\u00e3o Massiva de Linguagem em M\u00faltiplas Tarefas)<\/h3>\n<p>Quest\u00f5es de m\u00faltipla escolha em 57 \u00e1reas distintas, desde matem\u00e1tica elementar at\u00e9 direito profissional.<br \/>\nDurante anos, foi o principal indicador divulgado, mas esse agora \u00e9 justamente o problema: modelos de ponta\n     apresentam resultados t\u00e3o pr\u00f3ximos no topo que as diferen\u00e7as entre eles caem dentro da margem de ru\u00eddo. O MMLU ainda \u00e9<br \/>\n\u00fatil para comparar um modelo aberto menor com um modelo maior, mas praticamente in\u00fatil para distinguir<br \/>\ndois modelos de ponta. Trate qualquer afirma\u00e7\u00e3o sobre o MMLU em 2026 como uma verifica\u00e7\u00e3o m\u00ednima de desempenho, n\u00e3o como uma classifica\u00e7\u00e3o definitiva.<br \/>\ndois modelos de ponta. Trate uma alega\u00e7\u00e3o de MMLU de 2026 como um teste de limite inferior, n\u00e3o como uma classifica\u00e7\u00e3o.<\/p>\n<h3>GPQA (Perguntas e Respostas de N\u00edvel de P\u00f3s-Gradua\u00e7\u00e3o, resistente ao Google)<\/h3>\n<p>Elaborado por doutores especializados em biologia, f\u00edsica e qu\u00edmica, e intencionalmente projetado para que<br \/>\nbuscar informa\u00e7\u00f5es na web n\u00e3o ajude. Ele responde a uma pergunta diferente da do MMLU: n\u00e3o \"o modelo leu muito?\",\n     mas sim \"o modelo consegue raciocinar sobre um problema genuinamente dif\u00edcil em uma \u00e1rea t\u00e9cnica?\". Como<br \/>\nresiste tanto \u00e0 memoriza\u00e7\u00e3o quanto \u00e0 recupera\u00e7\u00e3o de informa\u00e7\u00f5es, o GPQA envelheceu melhor do que o MMLU como discriminador.<br \/>\nele resiste tanto \u00e0 memoriza\u00e7\u00e3o quanto \u00e0 recupera\u00e7\u00e3o, tendo envelhecido melhor do que o MMLU como discriminador.<\/p>\n<h3>SWE-bench Verificado<\/h3>\n<p>Relat\u00f3rios reais de bugs provenientes de reposit\u00f3rios reais do GitHub, avaliados com base na capacidade do patch gerado pelo modelo de corrigir o<br \/>\nos testes pr\u00f3prios do projeto passam. O subconjunto Verificado \u00e9 a por\u00e7\u00e3o validada por humanos, filtrada para remover<br \/>\ntarefas que estavam quebradas ou imposs\u00edveis \u2014 raz\u00e3o pela qual voc\u00ea deve verificar <em>qual<\/em> o SWE-bench um<br \/>\nfornecedor est\u00e1 cotando. Este \u00e9 o benchmark mais relevante para tomada de decis\u00e3o se voc\u00ea estiver escolhendo um<br \/>\nmodelo para um agente de programa\u00e7\u00e3o, pois tanto a tarefa quanto a avalia\u00e7\u00e3o s\u00e3o aut\u00eanticas. O Claude Sonnet 5<br \/>\nregistra 85,2% no SWE-bench Verificado e 63,2% no mais dif\u00edcil SWE-bench Pro.<\/p>\n<h3>Terminal-Bench<\/h3>\n<p>Tarefas ag\u00eanticas executadas em um terminal real: instalar algo, diagnosticar uma falha, criar um script para<br \/>\ncorrigi-la. Ele mede uma habilidade distinta da escrita de um patch \u2014 toler\u00e2ncia a trabalhos multietapa nos quais<br \/>\no modelo deve ler sua pr\u00f3pria sa\u00edda de erro e se recuperar. O Claude Sonnet 5 registra 80,4% no<br \/>\nTerminal-Bench 2.1. Se seu caso de uso for um agente aut\u00f4nomo, e n\u00e3o um assistente de c\u00f3digo embutido, este e o OSWorld revelam mais do que o SWE-bench.<br \/>\nassistente, este e o OSWorld revelam mais do que o SWE-bench.<\/p>\n<h3>OSWorld<\/h3>\n<p>Uso do computador em um ambiente de desktop real \u2014 abrir aplicativos, clicar em interfaces,<br \/>\nconcluir uma tarefa que uma pessoa faria com um mouse. Os resultados aqui s\u00e3o muito inferiores aos obtidos em benchmarks textuais em toda a linha, o que constitui um sinal honesto sobre o qu\u00e3o imaturos ainda s\u00e3o os agentes de uso computacional.<br \/>\nClaude Sonnet 5 registra 81,2% no OSWorld-Verificado; o Nemotron 3 Nano Omni, da NVIDIA,<br \/>\num modelo aberto de 30 bilh\u00f5es de par\u00e2metros, registra 47,4% no OSWorld \u2014 um resultado razo\u00e1vel para seu tamanho.<br \/>\num modelo aberto de 30 bilh\u00f5es de par\u00e2metros, registra 47,4% no OSWorld, um resultado razo\u00e1vel para seu tamanho.<\/p>\n<h3>ARC-AGI<\/h3>\n<p>Quebra-cabe\u00e7as abstratos de racioc\u00ednio visual projetados de modo que a correspond\u00eancia de padr\u00f5es a partir dos dados de treinamento n\u00e3o seja transfer\u00edvel. Cada tarefa consiste em poucas transforma\u00e7\u00f5es de grade que o modelo deve inferir a partir de alguns exemplos.<br \/>\nO ARC-AGI \u00e9 o teste mais pr\u00f3ximo que o campo possui de uma avalia\u00e7\u00e3o de generaliza\u00e7\u00e3o genu\u00edna, em vez de mera recupera\u00e7\u00e3o de mem\u00f3ria, raz\u00e3o pela qual o progresso nele \u00e9 lento e saltos significativos s\u00e3o tratados como eventos importantes.<br \/>\nO Claude Opus 5 \u00e9 relatado com desempenho aproximadamente tr\u00eas vezes superior ao do segundo melhor modelo no ARC-AGI 3.<br \/>\nPerguntas elaboradas por especialistas em diversas \u00e1reas, criadas especificamente para resistir \u00e0 satura\u00e7\u00e3o que afetou o MMLU. O objetivo de projeto \u00e9 um benchmark que permane\u00e7a desafiador \u00e0 medida que os modelos evoluem,<br \/>\nde modo que as pontua\u00e7\u00f5es sejam intencionalmente baixas e pequenos ganhos sejam significativos. Leia-o como um discriminador de fronteira, n\u00e3o como uma medida de utilidade para tarefas cotidianas.<\/p>\n<h3>O \u00daltimo Exame da Humanidade<\/h3>\n<p>N\u00e3o \u00e9 um teste, mas uma composi\u00e7\u00e3o que combina v\u00e1rias avalia\u00e7\u00f5es independentes em uma \u00fanica pontua\u00e7\u00e3o. Esse \u00e9 seu valor: qualquer benchmark individual pode ser alvo de otimiza\u00e7\u00e3o espec\u00edfica, enquanto uma combina\u00e7\u00e3o \u00e9 muito mais dif\u00edcil de manipular. \u00c9 a escala utilizada na tabela acima. O Claude Opus 5 \u00e9 o atual l\u00edder com 61 pontos, seguido pelo Claude Fable 5 com 60 e pelo GPT-5.6 Sol com 59 \u2014 e o Kimi K3 com 57, o melhor resultado registrado entre modelos de pesos abertos, situando-se apenas quatro pontos abaixo do melhor modelo fechado.<br \/>\nsatura\u00e7\u00e3o que superou o MMLU. O objetivo de projeto \u00e9 um benchmark que permane\u00e7a desafiador \u00e0 medida que os modelos evoluem,<br \/>\nde modo que as pontua\u00e7\u00f5es sejam intencionalmente baixas e pequenos ganhos sejam significativos. Interprete-o como um discriminador de ponta,<br \/>\nn\u00e3o como uma medida de utilidade para tarefas cotidianas.<\/p>\n<h3>\u00cdndice de Intelig\u00eancia Artificial da Artificial Analysis<\/h3>\n<p>N\u00e3o \u00e9 um teste isolado, mas uma composi\u00e7\u00e3o que combina v\u00e1rias avalia\u00e7\u00f5es independentes em uma \u00fanica pontua\u00e7\u00e3o. Esse \u00e9<br \/>\nseu valor: qualquer benchmark individual pode ser alvo de otimiza\u00e7\u00e3o espec\u00edfica, enquanto uma combina\u00e7\u00e3o \u00e9 muito mais dif\u00edcil de ser manipulada. \u00c9 a<br \/>\nescala utilizada na tabela acima. O Claude Opus 5 \u00e9 o atual l\u00edder com 61 pontos, seguido pelo Claude Fable 5 com 60 e pelo GPT-5.6 Sol com 59 \u2014 e o Kimi K3 com 57, o melhor resultado registrado at\u00e9 agora entre modelos de peso aberto, situando-se<br \/>\na apenas quatro pontos do melhor modelo fechado.<br \/>\na menos de quatro pontos do melhor modelo fechado.<\/p>\n<h2>Como interpretar uma alega\u00e7\u00e3o de desempenho em benchmark<\/h2>\n<p><strong>Pergunte quem o executou.<\/strong> Uma pontua\u00e7\u00e3o divulgada pelo pr\u00f3prio fornecedor em sua p\u00e1gina de lan\u00e7amento e uma avalia\u00e7\u00e3o independente s\u00e3o tipos distintos de evid\u00eancia. Os leaderboards independentes aplicam o mesmo 'harness' (estrutura de avalia\u00e7\u00e3o) a todos os modelos; j\u00e1 o fornecedor escolhe suas pr\u00f3prias condi\u00e7\u00f5es.<br \/>\nVerifique a contamina\u00e7\u00e3o.<br \/>\nSe as perguntas de um benchmark forem anteriores ao corte de dados de treinamento de um modelo e estiverem publicamente dispon\u00edveis, \u00e9 prov\u00e1vel que algumas delas fa\u00e7am parte dos dados de treinamento. Essa \u00e9 a principal raz\u00e3o pela qual benchmarks antigos tendem a inflacionar ao longo do tempo e por que os mais recentes s\u00e3o constru\u00eddos para serem \"\u00e0 prova do Google\" ou totalmente reservados.<\/p>\n<p><strong>Atente-se \u00e0 mudan\u00e7a de crit\u00e9rio.<\/strong> \"SWE-bench\" sem a especifica\u00e7\u00e3o \"Verificado\", um subconjunto n\u00e3o nomeado,<br \/>\num n\u00famero diferente de tentativas ou uma pontua\u00e7\u00e3o obtida com uso de ferramentas comparada a outra sem esse recurso \u2014 essas s\u00e3o as formas habituais pelas quais uma compara\u00e7\u00e3o deixa de ser 'lado a lado'.<br \/>\nCuidado com a satura\u00e7\u00e3o.<br \/>\nQuando todos os modelos s\u00e9rios obt\u00eam mais de 90 pontos em um teste, esse teste deixou de classificar qualquer coisa. Diferen\u00e7as de um ou dois pontos no topo de um benchmark saturado s\u00e3o ru\u00eddo, n\u00e3o sinal.<\/p>\n<p><strong>O pre\u00e7o faz parte da pontua\u00e7\u00e3o.<\/strong> Um modelo com dois pontos a mais de desempenho, mas seis vezes mais caro, n\u00e3o \u00e9 melhor para a maioria das cargas de trabalho. \u00c9 por isso que a tabela acima inclui uma coluna de 'pontua\u00e7\u00e3o por d\u00f3lar' e por que o<br \/>\n\u00edndice de desempenho por custo<br \/>\nexiste.<\/p>\n<p><strong>Qual benchmark voc\u00ea realmente deveria considerar?<\/strong> Constru\u00e7\u00e3o de um agente de programa\u00e7\u00e3o:<br \/>\nSWE-bench Verificado em primeiro lugar, Terminal-Bench em segundo.<br \/>\nos benchmarks s\u00e3o ru\u00eddo, n\u00e3o sinal.<\/p>\n<p><strong>O pre\u00e7o faz parte da pontua\u00e7\u00e3o.<\/strong> Um modelo dois pontos melhor, mas seis vezes mais<br \/>\ncaro, n\u00e3o \u00e9 melhor para a maioria das cargas de trabalho. \u00c9 por isso que a tabela acima inclui uma coluna de pontua\u00e7\u00e3o por d\u00f3lar<br \/>\ne por que o <a href=\"https:\/\/convly.ai\/pt\/ai-price-performance-index-2026\/\">\u00edndice de desempenho por pre\u00e7o<br \/>\nexiste.<\/a> existe.<\/p>\n<h2>Qual benchmark voc\u00ea realmente deve levar em conta?<\/h2>\n<p><strong>Construindo um agente de programa\u00e7\u00e3o:<\/strong> SWE-bench Verified em primeiro lugar, Terminal-Bench em segundo.<br \/>\nIgnore completamente o MMLU.<\/p>\n<p><strong>Construir um agente para uso de computador ou desktop:<\/strong> OSWorld, seguido por Terminal-Bench.<br \/>\nEspere que os valores absolutos sejam baixos.<\/p>\n<p><strong>Resposta a perguntas t\u00e9cnicas ou cient\u00edficas:<\/strong> GPQA e Humanity\u2019s Last Exam, caso<br \/>\nsuas perguntas sejam realmente de n\u00edvel especializado.<\/p>\n<p><strong>Assistente geral ou chat:<\/strong> um \u00edndice composto \u00e9 mais informativo do que qualquer<br \/>\n\u00fanico teste, pois nenhum benchmark individual reflete a diversidade de tarefas que usu\u00e1rios reais solicitam.<\/p>\n<p><strong>Escolher um modelo pequeno para hospedagem pr\u00f3pria:<\/strong> os benchmarks importam menos do que a adequa\u00e7\u00e3o. Verifique<br \/>\no que realmente roda em seu hardware com<br \/>\n<a href=\"https:\/\/convly.ai\/pt\/llm-vram-calculator\/\">Calculadora de VRAM<\/a> primeiro lugar e, s\u00f3 ent\u00e3o, compare<br \/>\nos resultados dos benchmarks apenas entre os modelos compat\u00edveis.<\/p>\n<h2>Resultados de benchmarks publicados em nossa base de dados<\/h2>\n<div class=\"cbm\">\n  <table class=\"cm-table cbm-scores\">\n    <thead><tr><th>Modelo<\/th><th>Resultados publicados<\/th><\/tr><\/thead>\n    <tbody>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/gpt-5-6-sol\/\">GPT-5.6 Sol<\/a><\/td>\n        <td data-label=\"Results\">\u00cdndice de Intelig\u00eancia Artificial da Artificial Analysis: 59.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/claude-sonnet-5\/\">Claude Sonnet 5<\/a><\/td>\n        <td data-label=\"Results\">SWE-Bench Verified: 85,2%; SWE-Bench Pro: 63,2%; Terminal-Bench 2.1: 80,4%; OSWorld-Verified: 81,2%.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/claude-opus-5\/\">Claude Opus 5<\/a><\/td>\n        <td data-label=\"Results\">\u00cdndice de Intelig\u00eancia Artificial da Artificial Analysis: 61 (classificado em #1 entre 170 modelos). Mais do que duplica o desempenho do Opus 4.8 no Frontier-Bench v0.1; cerca de tr\u00eas vezes o desempenho do pr\u00f3ximo melhor modelo no ARC-AGI 3.<\/td>\n      <\/tr>\n          <tr>\n        <td data-label=\"Model\"><a href=\"https:\/\/convly.ai\/pt\/model\/nvidia-nemotron-3-nano-omni\/\">NVIDIA Nemotron 3 Nano Omni<\/a><\/td>\n        <td data-label=\"Results\">OCRBench V2: 67,04 | Video-MME: 72,2 | OSWorld: 47,4 | Speech IF: 89,39<\/td>\n      <\/tr>\n        <\/tbody>\n  <\/table>\n  <p class=\"cbm-note\">Apenas modelos cujos desenvolvedores publicam dados espec\u00edficos est\u00e3o listados. A aus\u00eancia\n     aqui significa que n\u00e3o verificamos um n\u00famero publicado, n\u00e3o que o modelo tenha desempenho ruim \u2014 o que,\n     por si s\u00f3, j\u00e1 \u00e9 uma informa\u00e7\u00e3o relevante quando um fornecedor destaca uma afirma\u00e7\u00e3o baseada em benchmark.<\/p>\n<\/div>\n\n<h2>Perguntas frequentes<\/h2>\n<div class=\"cbm-faq\">\n<details class=\"cmp-q\">\n<summary>O que \u00e9 um benchmark de IA?<\/summary>\n<p>Um conjunto fixo de tarefas com um m\u00e9todo de pontua\u00e7\u00e3o definido, usado para permitir que diferentes modelos sejam<br \/>\ncomparados com entradas id\u00eanticas. Os benchmarks variam desde testes de conhecimento de m\u00faltipla escolha, como o MMLU,<br \/>\nat\u00e9 tarefas ag\u00eanticas, como resolver problemas reais no GitHub no SWE-bench, medindo cada um uma fatia estreita de habilidade,\n     em vez de avaliar a qualidade geral.<br \/>\nqualquer \u00fanica avalia\u00e7\u00e3o. \u00cdndices compostos s\u00e3o a m\u00e9trica mais confi\u00e1vel para resumo geral, pois combinar<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Qual benchmark de IA \u00e9 o mais confi\u00e1vel?<\/summary>\n<p>Nenhum \u00fanico. \u00cdndices compostos s\u00e3o a m\u00e9trica mais confi\u00e1vel para resumo geral, pois combinar<br \/>\nv\u00e1rias avalia\u00e7\u00f5es \u00e9 muito mais dif\u00edcil de manipular do que otimizar para um \u00fanico teste. Para uma decis\u00e3o espec\u00edfica,\n     o benchmark mais confi\u00e1vel \u00e9 aquele que mais se assemelha \u00e0 sua carga de trabalho real \u2014<br \/>\nSWE-bench Verified para agentes de programa\u00e7\u00e3o, OSWorld para uso de computador e GPQA para racioc\u00ednio t\u00e9cnico.<br \/>\nSWE-bench Verified para agentes de programa\u00e7\u00e3o, OSWorld para uso de computador e GPQA para racioc\u00ednio t\u00e9cnico.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Qual \u00e9 uma boa pontua\u00e7\u00e3o no MMLU em 2026?<\/summary>\n<p>O MMLU est\u00e1 amplamente saturado entre os modelos de ponta, portanto, uma alta pontua\u00e7\u00e3o j\u00e1 n\u00e3o os distingue.<br \/>\nContinua sendo \u00fatil para posicionar modelos abertos menores, nos quais a varia\u00e7\u00e3o ainda \u00e9 ampla. Se voc\u00ea estiver<br \/>\ncomparando dois modelos de ponta, o MMLU n\u00e3o os diferenciar\u00e1, e o GPQA ou um \u00edndice composto ser\u00e3o mais indicados.<br \/>\ncomparando dois modelos de ponta, o MMLU n\u00e3o os diferenciar\u00e1, e o GPQA ou um \u00edndice composto ser\u00e3o mais indicados.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>\u00c9 poss\u00edvel manipular benchmarks de IA?<\/summary>\n<p>Sim, de duas maneiras. Os dados de treinamento podem incluir as perguntas de um benchmark, inflando artificialmente as pontua\u00e7\u00f5es sem<br \/>\nnenhum ganho real de capacidade \u2014 raz\u00e3o pela qual benchmarks mais recentes s\u00e3o projetados para resistir \u00e0 busca e<br \/>\n\u00e0 memoriza\u00e7\u00e3o. Al\u00e9m disso, as condi\u00e7\u00f5es de avalia\u00e7\u00e3o podem ser escolhidas de forma favor\u00e1vel: um subconjunto diferente, mais<br \/>\ntentativas ou o uso de ferramentas comparado contra um modelo que n\u00e3o as utiliza. Leaderboards independentes e<br \/>\n\u00edndices compostos mitigam ambos os problemas.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>As pontua\u00e7\u00f5es em benchmarks preveem o desempenho no mundo real?<\/summary>\n<p>Parcialmente. Benchmarks com tarefas aut\u00eanticas, como o SWE-bench Verified e o OSWorld, predizem razoavelmente<br \/>\nbem, pois a tarefa avaliada \u00e9 exatamente a tarefa real. J\u00e1 benchmarks acad\u00eamicos de m\u00faltipla escolha predizem mal,<br \/>\nporque responder quest\u00f5es de provas n\u00e3o \u00e9 o que a maioria das aplica\u00e7\u00f5es faz. O preditor mais forte continua sendo<br \/>\numa avalia\u00e7\u00e3o personalizada que voc\u00ea constr\u00f3i com seus pr\u00f3prios dados.<\/p>\n<\/details>\n<details class=\"cmp-q\">\n<summary>Qual modelo de peso aberto obt\u00e9m a maior pontua\u00e7\u00e3o?<\/summary>\n<p>Kimi K3, com 57 no \u00cdndice de Intelig\u00eancia Artificial da Artificial Analysis \u2014 o melhor resultado registrado para modelos de peso aberto,\n     a apenas quatro pontos do melhor modelo fechado. A tabela de l\u00edderes acima marca todas as entradas de modelos de peso aberto,\n     e o conjunto completo \u00e9 orden\u00e1vel na<br \/>\nregistrado, dentro de quatro pontos do melhor modelo fechado. A tabela de l\u00edderes acima marca todos os<br \/>\nentrada de c\u00f3digo aberto e o conjunto completo \u00e9 classific\u00e1vel na<br \/>\n<a href=\"https:\/\/convly.ai\/pt\/llm-leaderboard\/\">Ranking de LLMs<\/a>.<\/p>\n<\/details>\n<\/div>","protected":false},"excerpt":{"rendered":"<p>An AI benchmark is a fixed set of tasks used to score a model&#8217;s ability, so that different models can [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"parent":0,"menu_order":0,"comment_status":"closed","ping_status":"closed","template":"","meta":{"site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"default","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-4)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"class_list":["post-2102","page","type-page","status-publish","hentry"],"_links":{"self":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/pages\/2102","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/pages"}],"about":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/types\/page"}],"author":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/comments?post=2102"}],"version-history":[{"count":0,"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/pages\/2102\/revisions"}],"wp:attachment":[{"href":"https:\/\/convly.ai\/pt\/wp-json\/wp\/v2\/media?parent=2102"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}