Un benchmark IA est un ensemble fixe de tâches utilisé pour évaluer les capacités d’un modèle, afin que
différents modèles puissent être comparés sur le même test. Il n’existe pas de benchmark unique qui
détermine quel modèle est le meilleur — chacun mesure un aspect précis, et plusieurs des benchmarks célèbres
sont désormais presque saturés. L’approche pratique consiste à consulter les deux ou trois benchmarks correspondant à votre
charge de travail réelle, et à considérer avec scepticisme toute valeur isolée présentée en une.
Qui mène actuellement
Classés selon l’Indice d’intelligence artificielle d’Artificial Analysis, une synthèse de plusieurs évaluations indépendantes plutôt qu’un seul test. La dernière colonne, souvent omise dans les comparaisons, représente le score
divisé par le coût combiné, ce qui reflète réellement la valeur achetée.
Score d’intelligence
| # | Modèle | Développeur | Score par dollar | Coût combiné par million de dollars | Les scores sont exprimés selon l’échelle de l’Indice d’intelligence artificielle d’Artificial Analysis, une synthèse de plusieurs évaluations indépendantes plutôt que le résultat d’un seul test — ce qui constitue la bonne façon d’interpréter une affirmation médiatique du type « meilleur modèle ». L’entrée la plus performante parmi les modèles à poids ouverts est |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 61 | $9.00 | 6.8 |
| 2 | Claude Fable 5 | Anthropic | 60 | $18.00 | 3.3 |
| 3 | GPT-5.6 Sol | OpenAI | 59 | $10.00 | 5.9 |
| 4 | Kimi K3 poids ouverts | Moonshot AI | 57 | $5.40 | 10.6 |
| 5 | Claude Opus 4.8 | Anthropic | 55.7 | $9.00 | 6.2 |
| 6 | GPT-5.5 | OpenAI | 54.8 | $10.00 | 5.5 |
| 7 | GLM 5.2 poids ouverts | Zhipu AI | 51.1 | $2.00 | 25.6 |
| 8 | Gemini 3.5 Flash | 50.2 | $3.00 | 16.7 | |
| 9 | Claude Sonnet 4.6 | Anthropic | 47 | $5.40 | 8.7 |
| 10 | Gemini 3.1 Pro | 46.5 | $4.00 | 11.6 | |
| 11 | DeepSeek V4-Pro poids ouverts | DeepSeek | 44.3 | $0.522 | 84.9 |
| 12 | Kimi K2.7 Code poids ouverts | Moonshot AI | 42 | $0.980 | 42.9 |
à 57. Triez vous-même l’ensemble complet sur le Kimi K3 Les benchmarks pertinents en 2026 Classement des grands modèles linguistiques (LLM).
MMLU (Massive Multitask Language Understanding)
Questions à choix multiples couvrant 57 domaines, allant des mathématiques élémentaires au droit professionnel.
Pendant des années, il a constitué la référence principale, mais c’est justement là le problème : les modèles de pointe
se regroupent si étroitement en haut du classement que les différences entre eux tombent dans la marge d’incertitude. Le MMLU reste utile pour comparer un petit modèle à poids ouverts à un grand modèle, mais il est presque inopérant pour distinguer deux modèles de pointe. Considérez toute affirmation fondée sur le MMLU en 2026 comme un simple test de seuil, non comme un classement.
GPQA (Graduate-Level Google-Proof Q&A)
Rédigé par des docteurs spécialisés en biologie, physique et chimie, et délibérément conçu pour que la recherche sur le web n’apporte aucune aide. Il répond à une question différente de celle du MMLU : non pas « le modèle a-t-il lu beaucoup ? », mais « peut-il raisonner de manière rigoureuse face à un problème véritablement difficile dans un domaine technique ? ». Comme il résiste aussi bien à la mémorisation qu’à la simple récupération d’informations, il s’est mieux maintenu que le MMLU en tant que critère discriminant.
Rapports réels de bogues provenant de vrais dépôts GitHub, évalués selon que le correctif proposé par le modèle
deux modèles frontières. Considérez une affirmation de score MMLU pour 2026 comme un test minimal, et non comme un classement.
GPQA (Questions et réponses de niveau doctorat, résistantes à Google)
rédigées par des docteurs spécialisés en biologie, physique et chimie, et délibérément conçues de façon à ce que
la recherche sur le web n’apporte aucune aide. Ce benchmark répond à une question différente de celle de MMLU : non pas « le modèle a-t-il lu beaucoup ? », mais « le modèle est-il capable de raisonner de manière rigoureuse face à un problème véritablement difficile dans un domaine technique ? ». En effet,
il résiste aussi bien à la mémorisation qu’à la simple récupération d’informations, ce qui explique pourquoi il s’est mieux maintenu que MMLU en tant qu’indicateur discriminant.
des rapports de bogues réels provenant de véritables dépôts GitHub, évalués selon que le correctif proposé par le modèle permet ou non de résoudre effectivement le bogue.
SWE-bench vérifié
Véritables rapports de bogues provenant de véritables dépôts GitHub, évalués en fonction de la capacité du correctif généré par le modèle à résoudre les
les tests propres au projet réussissent. Le sous-ensemble « Verified » correspond à la portion validée manuellement, filtrée afin d’éliminer
les tâches défectueuses ou impossibles — c’est pourquoi vous devez vérifier lequel SWE-bench une
le fournisseur cite. Il s’agit du benchmark le plus pertinent pour la prise de décision si vous choisissez un
modèle destiné à un agent de programmation, car la tâche et l’évaluation sont toutes deux authentiques. Claude Sonnet 5
obtient 85,2 % sur SWE-bench Verified et 63,2 % sur la version plus difficile, SWE-bench Pro.
Terminal-Bench
Tâches agentic menées dans un terminal réel : installer un logiciel, diagnostiquer une panne, écrire un script pour
corriger un problème. Ce benchmark mesure une compétence différente de celle consistant à rédiger un correctif — il évalue notamment la capacité à mener des travaux multi-étapes où
le modèle doit lire sa propre sortie d’erreur et s’en remettre. Claude Sonnet 5 obtient 80,4 % sur
Terminal-Bench 2.1. Si votre cas d’usage implique un agent autonome plutôt qu’un assistant de code intégré, ce benchmark et OSWorld vous renseignent davantage que SWE-bench.
assistant, ce benchmark ainsi qu’OSWorld vous renseignent davantage que SWE-bench.
OSWorld
Utilisation d’un ordinateur dans un environnement bureautique réel : ouvrir des applications, cliquer dans les interfaces,
accomplir une tâche que ferait une personne avec une souris. Les scores obtenus ici sont nettement inférieurs à ceux des benchmarks textuels, ce qui constitue un signal honnête quant au stade encore précoce des agents capables d’utiliser un ordinateur.
Claude Sonnet 5 obtient 81,2 % sur OSWorld-Verified ; le modèle ouvert Nemotron 3 Nano Omni, développé par NVIDIA,
un modèle de 30 milliards de paramètres, obtient 47,4 % sur OSWorld — un résultat raisonnable compte tenu de sa taille.
un modèle ouvert de 30 milliards de paramètres, affiche un score de 47,4 % sur OSWorld, ce qui constitue un résultat raisonnable pour sa taille.
ARC-AGI
Puzzles abstraits de raisonnement visuel conçus de façon à ce que la simple reconnaissance de motifs tirés des données d’entraînement ne soit pas transférable.
Chaque tâche consiste en quelques transformations de grille que le modèle doit déduire à partir de quelques exemples seulement.
ARC-AGI est la référence la plus proche d’un test de généralisation véritable, plutôt que de simple mémorisation, ce qui explique pourquoi les progrès y sont lents et pourquoi chaque avancée significative y est particulièrement remarquée.
que la simple mémorisation, ce qui explique pourquoi les progrès sont lents et pourquoi toute amélioration notable est considérée comme significative.
Claude Opus 5 obtient un score environ trois fois supérieur à celui du deuxième meilleur modèle sur ARC-AGI 3.
Le dernier examen de l’humanité
Questions rédigées par des experts dans de nombreuses disciplines, spécifiquement conçues pour résister à la saturation qui a affecté MMLU.
L’objectif de conception est de créer un benchmark qui reste difficile à mesure que les modèles progressent,
si bien que les scores sont volontairement faibles et que même de petits gains revêtent une signification importante.
Interprétez-le comme un discriminateur de pointe, non comme une mesure de l’utilité pratique dans un travail courant.
Indice d’intelligence artificielle d’Artificial Analysis
Il ne s’agit pas d’un test en soi, mais d’une combinaison composite de plusieurs évaluations indépendantes en un seul score.
C’est là toute sa valeur : un benchmark isolé peut être spécifiquement optimisé, tandis qu’un ensemble combiné est beaucoup plus difficile à manipuler.
C’est l’échelle utilisée dans le tableau ci-dessus. Claude Opus 5 est actuellement en tête avec un score de 61, suivi de Claude Fable 5 (60) et de GPT-5.6 Sol (59) — et Kimi K3 (57), le meilleur résultat publié à ce jour pour un modèle open-weight, n’étant qu’à quatre points du meilleur modèle fermé.
60, et GPT-5.6 Sol à 59 — tandis que Kimi K3 atteint 57, le meilleur résultat jamais enregistré pour un modèle open-weight, se situant
à seulement quatre points du meilleur modèle fermé.
Comment interpréter une affirmation fondée sur un benchmark
Demandez qui l’a réalisé. Un score communiqué par le fournisseur sur sa propre page de lancement et une évaluation indépendante constituent deux types d’éléments probants distincts. Les classements indépendants appliquent le même cadre d’évaluation à tous les modèles ; le fournisseur, lui, choisit ses propres conditions.
évaluations indépendantes sont des types de preuves différents. Les classements indépendants appliquent les mêmes
outils à chaque modèle ; un éditeur choisit lui-même ses propres conditions.
Vérifiez la contamination. Si les questions d’un benchmark datent d’avant la date limite d’entraînement d’un modèle et sont publiques, certaines d’entre elles se trouvent très probablement dans les données d’entraînement.
C’est la principale raison pour laquelle les anciens benchmarks voient leurs scores artificiellement gonflés au fil du temps, et pourquoi les nouveaux benchmarks sont conçus pour être « introuvables via Google » ou entièrement réservés.
principale raison pour laquelle les anciens benchmarks surestiment progressivement les performances, et pourquoi les nouveaux sont conçus pour être
« résistants à Google » ou entièrement réservés.
Méfiez-vous des buts mobiles. « SWE-bench » sans précision « Verified », un sous-ensemble non nommé,
un nombre différent de tentatives, ou un score obtenu avec l’usage d’outils comparé à un autre sans outils — ce sont les moyens habituels par lesquels une comparaison cesse d’être « pomme contre pomme ».
sont les moyens habituels par lesquels une comparaison cesse d’être « pomme contre pomme ».
Méfiez-vous de la saturation. Lorsque tous les modèles sérieux obtiennent plus de 90 % sur un test, ce dernier cesse d’être discriminant.
Des différences d’un point ou deux au sommet d’un benchmark saturé relèvent du bruit, non du signal.
benchmark constituent du bruit, non pas un signal.
Le prix fait partie du score. Un modèle deux points meilleur mais six fois plus coûteux n’est pas meilleur pour la plupart des charges de travail.
C’est pourquoi le tableau ci-dessus inclut une colonne « score par dollar », et pourquoi l’« indice
colonne, et pourquoi la prix-performance
existe. existe.
Quel benchmark devriez-vous réellement privilégier ?
Pour développer un agent de programmation : SWE-bench Verified en premier lieu, Terminal-Bench en second.
Ignorer complètement le MMLU.
Concevoir un agent informatique ou un agent de bureau : OSWorld, puis Terminal-Bench.
Attendez-vous à des valeurs absolues faibles.
Réponse à des questions techniques ou scientifiques : GPQA, et Humanity’s Last Exam si
vos questions sont véritablement de niveau expert.
Assistant général ou chat : un indice composite est plus informatif que n’importe quel
test individuel, car aucun benchmark ne reflète la diversité des demandes formulées par les utilisateurs réels.
Choisir un petit modèle à auto-héberger : les benchmarks importent moins que l’adéquation. Vérifiez d’abord
ce qui fonctionnera physiquement sur votre matériel, puis comparez
Calculateur de VRAM les scores aux benchmarks uniquement entre les modèles compatibles.
Résultats de benchmarks publiés dans notre base de données
Résultats publiés
| Modèle | Indice d’intelligence artificielle d’Artificial Analysis : 59. |
|---|---|
| GPT-5.6 Sol | SWE-Bench Verified : 85,2 % ; SWE-Bench Pro : 63,2 % ; Terminal-Bench 2.1 : 80,4 % ; OSWorld-Verified : 81,2 %. |
| Claude Sonnet 5 | Indice d’intelligence artificielle d’Artificial Analysis : 61 (classé n° 1 sur 170 modèles). Plus du double d’Opus 4.8 sur Frontier-Bench v0.1 ; environ trois fois supérieur au deuxième meilleur modèle sur ARC-AGI 3. |
| Claude Opus 5 | OCRBench V2 : 67,04 | Video-MME : 72,2 | OSWorld : 47,4 | Speech IF : 89,39 |
| NVIDIA Nemotron 3 Nano Omni | Seuls les modèles dont les développeurs publient des chiffres spécifiques sont listés. Une absence ici signifie que nous n’avons pas vérifié de valeur publiée, et non que le modèle performe mal — ce qui, en soi, constitue une information utile lorsque le fournisseur met en avant une performance sur un benchmark. |
Qu’est-ce qu’un benchmark IA ?
Questions fréquemment posées
Un ensemble fixe de tâches doté d’une méthode de notation définie, utilisé afin de permettre la comparaison de différents modèles sur des entrées identiques. Les benchmarks vont de tests de connaissances à choix multiples, comme le MMLU,
à des tâches agentic telles que la résolution d’issues GitHub réelles sur SWE-Bench, et chacun mesure une capacité très spécifique plutôt que la qualité globale.
Quel benchmark IA est le plus fiable ?
Aucun seul benchmark ne l’est. Les indices composites constituent la mesure synthétique la plus fiable, car il est bien plus difficile d’optimiser simultanément plusieurs évaluations qu’une seule. Pour une décision précise, le benchmark le plus fiable est celui qui se rapproche le plus de votre charge de travail —
SWE-Bench Verified pour les agents de programmation, OSWorld pour l’utilisation informatique, GPQA pour le raisonnement technique.
Quel est un bon score MMLU en 2026 ?
Le MMLU est largement saturé parmi les modèles de pointe, donc un score élevé ne permet plus de les distinguer.
Il reste toutefois utile pour positionner les petits modèles open source, où l’écart entre performances demeure important. Si vous comparez deux modèles de pointe, le MMLU ne permettra pas de les départager, et vous devrez recourir au GPQA ou à un indice composite.
Les benchmarks IA peuvent-ils être manipulés ?
Oui, de deux manières. Les données d’entraînement peuvent inclure les questions d’un benchmark, gonflant artificiellement les scores sans amélioration réelle des capacités — c’est pourquoi les nouveaux benchmarks sont conçus pour résister à la recherche et à la mémorisation. En outre, les conditions d’évaluation peuvent être choisies de façon avantageuse : sous-ensemble différent, nombre accru de tentatives ou utilisation d’outils comparée à un modèle qui n’en dispose pas. Les classements indépendants et les indices composites atténuent ces deux biais.
Les scores de benchmark prédisent-ils les performances en situation réelle ?
Partiellement. Les benchmarks authentiques sur tâche, comme SWE-Bench Verified et OSWorld, prédisent raisonnablement bien, car la tâche évaluée est effectivement celle réalisée en pratique. En revanche, les benchmarks académiques à choix multiples prédisent mal, car répondre à des examens ne correspond pas à ce que font la plupart des applications. Le prédicteur le plus fiable reste toutefois une évaluation que vous construisez vous-même sur vos propres données.
Quel modèle open-weight obtient le score le plus élevé ?
Kimi K3 avec un score de 57 sur l’Indice d’intelligence artificielle d’Artificial Analysis, le meilleur résultat jamais enregistré pour un modèle open-weight, à seulement quatre points du meilleur modèle fermé. Le tableau des leaders ci-dessus indique clairement chaque modèle open-weight, et l’ensemble complet est triable sur la
le fera.
Les benchmarks d’IA peuvent-ils être manipulés ?
Oui, de deux manières. Les données d’entraînement peuvent inclure les questions d’un benchmark, gonflant ainsi les scores sans
aucun gain réel de capacité — c’est pourquoi les benchmarks récents sont conçus pour résister aux recherches et
mémorisation. Et les conditions d'évaluation peuvent être choisies de manière favorable : un sous-ensemble différent, davantage de tentatives ou l'utilisation d'outils comparée à un modèle qui n'en dispose pas. Des classements et des indices composites exécutés indépendamment atténuent ces deux biais.
attempts, ou l'utilisation d'outils comparée à un modèle qui n'en dispose pas. Des classements et des indices composites exécutés indépendamment atténuent ces deux biais.
des classements et des indices composites exécutés indépendamment atténuent ces deux biais.
Les scores aux benchmarks prédisent-ils effectivement les performances en situation réelle ?
Partiellement. Les benchmarks reflétant fidèlement les tâches réelles — comme SWE-bench Verified et OSWorld — offrent des prédictions raisonnables, car la tâche évaluée est précisément celle qu’on rencontre dans le monde réel.
En revanche, les benchmarks académiques à choix multiples prédisent mal les performances réelles, car répondre à des questions d’examens ne correspond pas à ce que font la plupart des applications.
Le prédicteur le plus fiable reste toutefois une évaluation que vous concevez vous-même, sur vos propres données.
une évaluation que vous concevez vous-même, sur vos propres données.
Quel modèle open-weight obtient le score le plus élevé ?
Kimi K3, avec un score de 57 sur l’Intelligence Index d’Artificial Analysis, soit le meilleur résultat jamais enregistré pour un modèle open-weight, à seulement quatre points du meilleur modèle fermé.
Le tableau des leaders ci-dessus signale explicitement chaque modèle open-weight, et l’ensemble complet est triable sur la
page correspondante.
Classement des grands modèles linguistiques (LLM).

