Monday, 3 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

OpenAI affirme que le résultat GPT-5.6 Sol sur ARC-AGI-3 dépasse désormais celui de Claude Opus 5

OpenAI a publié un article intitulé « Comment l’activation de deux paramètres a triplé nos scores sur le benchmark ARC-AGI-3 », et le-decoder.com rapporte que l’entreprise utilise ces résultats pour revendiquer une GPT-5.6 Sol ARC-AGI-3 avance sur le modèle concurrent Opus 5 lorsque le benchmark est exécuté via la dernière API d’OpenAI avec deux paramètres supplémentaires activés. Cette affirmation est moins remarquable pour sa position sur le classement que pour ce qu’elle révèle de la dépendance des résultats de benchmark à l’égard de la configuration exacte utilisée pour les obtenir — un détail qui rarement survit au passage d’un billet de blog éditeur à un graphique sur une diapositive.

Points clés

  • Selon son propre titre, OpenAI a publié un article affirmant que l’activation de deux paramètres avait triplé ses scores sur le benchmark ARC-AGI-3.
  • le-decoder.com rapporte qu’OpenAI affirme GPT-5.6 Sol dépasser Opus 5 sur ARC-AGI-3 à l’aide de sa dernière API ainsi que de ces deux paramètres supplémentaires.
  • L’amélioration rapportée d’un facteur trois provient de modifications de configuration, et non d’une nouvelle version du modèle, comme le précise le cadre exposé dans l’article d’OpenAI lui-même.
  • Aucun des deux extraits ne fournit de scores précis, ni l’identité des deux paramètres, ni les dates d’évaluation ; ces chiffres ne doivent donc pas être supposés.
  • Pour les développeurs, la leçon pratique est que la configuration au niveau de l’API peut modifier considérablement les résultats des benchmarks : les résultats ne sont comparables que si le cadre d’évaluation (« harness ») est strictement identique.

Ce qu’OpenAI a effectivement affirmé concernant GPT-5.6 Sol sur ARC-AGI-3

La source principale ici est OpenAI elle-même. Le titre de l’article de l’entreprise est « Comment l’activation de deux paramètres a triplé nos scores sur le benchmark ARC-AGI-3 », ce qui établit trois éléments : le benchmark concerné est ARC-AGI-3, l’amélioration est attribuée à l’activation de deux paramètres, et l’ampleur de cette amélioration est décrite comme un triplement du score.

La seconde source, le-decoder.com, ajoute une dimension concurrentielle. Son rapport indique qu’OpenAI affirme que GPT-5.6 Sol dépasse Opus 5 sur ARC-AGI-3 avec sa dernière API et deux paramètres supplémentaires. C’est là toute l’étendue de ce qui est attesté par les documents disponibles au moment de la rédaction. Les valeurs sous-jacentes des scores, l’ordre relatif des modèles avant l’activation des paramètres, le nombre de tâches exécutées, ou encore le budget calculatoire ou en jetons alloué par tentative ne sont pas spécifiés dans les extraits consultés, et aucune lecture rigoureuse ne devrait combler ces lacunes par inférence.

Il convient de formuler précisément la nature de cette affirmation, car il est facile de la mal interpréter. Il n’est pas rapporté qu’OpenAI annonce un nouveau modèle. Il est rapporté qu’elle annonce un nouveau résultat pour un modèle existant, obtenu en modifiant la façon dont ce modèle est invoqué.

Pourquoi « deux paramètres » est la phrase la plus importante de cette histoire

Un triplement d’un score de benchmark issu uniquement de modifications de configuration constitue une variation très importante, et met en lumière un problème plus large lié à la manière dont l’industrie compare les modèles. Les évaluations de pointe ne se résument pas simplement à envoyer une instruction (prompt) et à enregistrer la réponse. Le résultat dépend de l’infrastructure entourant le modèle : le nombre de tentatives autorisées, la durée maximale de raisonnement avant réponse, la possibilité d’appeler des outils externes, la méthode d’analyse des sorties, ou encore la stratégie de nouvelle tentative en cas d’échec. Modifier l’un de ces éléments modifie automatiquement le score obtenu.

Ceci constitue un contexte général plutôt qu’un détail rapporté — les sources ne précisent pas quels sont les deux paramètres activés par OpenAI. Toutefois, la direction de cette observation s’inscrit dans un schéma bien connu : sur les benchmarks conçus pour évaluer le raisonnement et l’adaptabilité plutôt que la simple mémorisation, le cadre d’évaluation (« harness ») explique souvent autant de variance que les poids du modèle lui-même. Une affirmation du type « le modèle A bat le modèle B » est donc incomplète sans mentionner la configuration ayant permis d’obtenir ce résultat.

Pour toute personne établissant une liste restreinte de modèles candidats, ceci justifie de considérer les comparaisons publiées par les éditeurs comme un point de départ plutôt que comme un verdict définitif. Notre Base de données des modèles IA base de données suit les spécifications publiées par les fournisseurs, mais aucun tableau statique ne peut rendre compte des paramètres d’exécution utilisés lors d’un benchmark.

GPT-5.6 Sol contre Opus 5 : ce que les sources établissent, et ce qu’elles ne disent pas

Compte tenu du volume important de couvertures secondaires qu’une telle affirmation tend à générer, il est utile de distinguer les faits rapportés des détails simplement absents. Le tableau ci-dessous reflète uniquement ce qui apparaît dans les deux sources disponibles.

DétailStatut dans les sources disponibles
BenchmarkARC-AGI-3, mentionné à la fois dans le titre de l’article d’OpenAI et dans le rapport du-decoder.com
Modèles comparésGPT-5.6 Sol et Opus 5, selon le-decoder.com
Résultat revendiquéOpenAI affirme que GPT-5.6 Sol dépasse Opus 5, selon le-decoder.com
Amélioration rapportéeLes scores ont « triplé » après activation de deux paramètres, selon le titre de l’article d’OpenAI
ConditionsDernière API d’OpenAI plus deux paramètres supplémentaires, selon le-decoder.com
Scores précisAbsents des extraits sources
Identité des deux paramètresAbsents des extraits sources
Vérification indépendanteAbsents des extraits sources

La dernière ligne mérite une attention particulière. Comme indiqué, il s'agit d'une affirmation émanant du fournisseur lui-même concernant l'un de ses propres modèles, publiée par ce fournisseur et relayée par the-decoder.com en tant qu'affirmation — et non pas comme un résultat tiers confirmé. Ce n'est pas une critique du travail accompli : publier les détails de la configuration est plus transparent que de ne publier qu'un chiffre brut ; toutefois, cela définit bien le niveau de preuve requis.

Ce que cela signifie pour les développeurs qui construisent des applications sur l’API OpenAI

La conclusion pratique pour les développeurs n'est pas « changer de modèle », mais bien que les paramètres par défaut hérités lors d'un appel à une API peuvent ne pas correspondre aux réglages ayant permis d'obtenir les performances publiées. Si un résultat publié repose sur deux paramètres non standards, une équipe cherchant à reproduire cette charge de travail avec les paramètres par défaut devra s'attendre à un résultat sensiblement différent.

Trois conséquences en découlent. Premièrement, la sélection d’un modèle fondée sur des benchmarks doit s’accompagner d’une évaluation interne sur vos propres tâches, exécutée avec la configuration exacte que vous comptez déployer. Deuxièmement, tout paramètre augmentant les scores en étendant les efforts de raisonnement ou le nombre de tentatives augmentera généralement aussi le coût ; la comparaison pertinente porte donc sur la qualité par unité de dépense, et non sur la qualité seule — objectif précisément auquel notre Calculateur de coûts des API IA est conçu pour donner corps. Troisièmement, lorsqu’on compare des offres provenant de différents fournisseurs, les paramètres doivent être strictement identiques des deux côtés ; sinon, la comparaison n’en est pas une.

Aucune des sources citées ne précise les implications financières des deux paramètres d’OpenAI, si bien que ce lien est ici présenté comme une analyse générale, et non comme un fait rapporté. Pourtant, c’est très probablement la première question que se poseront les équipes d’ingénierie, et il est tout à fait légitime de la soumettre à tout fournisseur publiant un résultat dépendant de la configuration.

ARC-AGI-3 et l’évolution vers une évaluation interactive

La famille de benchmarks ARC-AGI est devenue une référence dans les discussions portant sur le raisonnement général précisément parce qu’elle résiste aux stratégies de mémorisation qui gonflent artificiellement les scores obtenus sur les anciens jeux de tests. Les versions successives ont progressivement orienté les tâches vers la découverte de règles inédites, plutôt que vers la simple restitution d’un motif déjà vu.

Cette conception a un effet secondaire pertinent dans le cadre de cet article : les benchmarks récompensant l’exploration et la résolution de problèmes en plusieurs étapes sont particulièrement sensibles à l’espace laissé au modèle pour explorer. Ainsi, une modification de configuration autorisant davantage de réflexion ou une interaction plus structurée peut produire un gain nettement plus important que la même modification appliquée à un test de réponse à une question en un seul tour. Là encore, il s’agit d’un contexte explicatif sur le comportement de tels benchmarks, et non d’une affirmation concernant les paramètres spécifiques d’OpenAI — dont les sources ne donnent aucune description.

Les équipes évaluant des modèles destinés à des tâches autonomes et multi-étapes reconnaîtront ce schéma à partir de leurs propres tests : la même sensibilité à l’« échafaudage » (scaffolding) apparaît dans l’ensemble des outils couverts par notre synthèse de agents de codage IA, où la conception de l’environnement d’exécution (harness) fait souvent la différence entre un agent exploitable et un autre, utilisant le même modèle sous-jacent, mais totalement inutilisable.

Comment interpréter les affirmations des éditeurs sur les benchmarks sans aller trop loin dans l’interprétation

Il est tentant de rejeter les résultats dépendants de la configuration comme relevant purement du marketing. Ce serait tirer la mauvaise leçon. Un fournisseur qui publie les paramètres activés fournit à la communauté davantage d’éléments exploitables qu’un autre se contentant de publier un chiffre isolé, et l’affirmation résultante est, du moins en principe, vérifiable.

L’attitude utile se situe entre crédulité et rejet systématique. Traitez l’affirmation comme elle est rapportée : OpenAI affirme que l’activation de deux paramètres a triplé ses scores sur le benchmark ARC-AGI-3, et qu’avec ces résultats, GPT-5.6 Sol devance Opus 5. Attendez les exécutions indépendantes avant de considérer cet ordre comme définitif. Et dès que les paramètres et les scores seront publiés intégralement, vérifiez si cette configuration est effectivement disponible — et abordable — dans le niveau tarifaire que vous utilisez concrètement. Lorsque le coût entre en jeu dans la décision, notre Indice prix-performance IA permet de suivre jusqu’où s’étend un niveau donné de qualité selon les fournisseurs.

Questions fréquemment posées

Quelle affirmation précise OpenAI a-t-elle formulée concernant GPT-5.6 Sol sur ARC-AGI-3 ? Selon the-decoder.com, OpenAI affirme que GPT-5.6 Sol devance Opus 5 sur ARC-AGI-3 lorsqu’il est exécuté via sa dernière API avec deux paramètres supplémentaires activés. Le billet officiel d’OpenAI est intitulé « Comment l’activation de deux paramètres a triplé nos scores sur le benchmark ARC-AGI-3 ».

Quels sont ces deux paramètres ? Les extraits de source disponibles ne les nomment pas. Jusqu’à la confirmation des détails complets du billet d’OpenAI, toute identification précise resterait spéculative.

Cela signifie-t-il que GPT-5.6 Sol est un nouveau modèle ? Rien dans les sources ne laisse entendre une sortie de nouveau modèle. La modification signalée concerne uniquement la façon dont un modèle existant a été configuré et invoqué via la dernière API d’OpenAI.

Ce résultat a-t-il été vérifié de manière indépendante ? Non, selon les documents disponibles. the-decoder.com le présente comme une affirmation d’OpenAI, et aucune confirmation tierce n’apparaît dans les sources.

Dois-je changer de modèle en production à la suite de cette information ? Pas en soi. Un résultat de benchmark dépendant de la configuration constitue une preuve faible pour une décision de production ; une évaluation menée sur votre propre charge de travail, avec vos propres paramètres et votre budget, est nettement plus fiable.

En résumé

L’affirmation rapportée concernant GPT-5.6 Sol sur ARC-AGI-3 constitue un point de données utile, assorti d’une mise en garde essentielle. OpenAI affirme que deux paramètres ont triplé ses scores, et the-decoder.com rapporte que l’entreprise place désormais GPT-5.6 Sol devant Opus 5 sur ce benchmark, en utilisant sa dernière API. Or, ce que les sources ne fournissent pas — ni les scores, ni les paramètres, ni le coût, ni une reproduction indépendante — est précisément ce qui serait nécessaire pour considérer cet ordre comme durable, et non provisoire. En attendant que ces éléments soient rendus publics, la lecture la plus prudente est que la configuration s’est révélée cruciale sur ARC-AGI-3, et que toute comparaison entre classements établie sans alignement strict des configurations ne mesure pas ce qu’elle prétend mesurer.

Sources : news.google.com. Publié le 30 juillet 2026.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice prix-performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts des API et l’économie de l’auto-hébergement. Il écrit sur la tarification des modèles, les résultats des benchmarks et le matériel nécessaire pour exécuter localement des modèles IA, privilégiant systématiquement les chiffres mesurés aux allégations des fournisseurs.

Défiler vers le haut
Featured on There's An AI For That