
Tout part d’un tweet de victoire. Anthropic annonce sur son compte officiel que sur ARC-AGI-3, le score de son Claude Opus 5 est trois fois supérieur à celui du deuxième meilleur modèle, GPT-5.6 Sol. Un point donne du poids au chiffre : il a été mesuré par un tiers, la fondation ARC Prize, et non par Anthropic. Le résultat, 30,2 %, est un record sur ce test.
ARC-AGI-3, c’est quoi ? Un test pensé pour mesurer le raisonnement. On lâche le modèle dans de petits jeux en 2D qu’il n’a jamais vus, sans règle ni notice, et il doit comprendre seul comment ça tourne. Impossible, donc, de tricher en récitant des exemples avalés pendant l’entraînement.
Opus 5 y a bouclé cinq environnements qu’aucun modèle n’avait résolus, quand le GPT-5.6 Sol d’OpenAI plafonnait autour de 8 %. Ce genre de vérification indépendante reste rare : la plupart des scores brandis lors d’un lancement sont produits par le labo lui-même, sur son propre matériel. D’où le tweet triomphal.
Deux réglages, et l’écart s’effondre
Sauf qu’OpenAI n’a pas goûté la comparaison. Le 29 juillet, l’entreprise a publié une analyse au titre limpide : deux réglages ont triplé son score. Le test officiel s’appuie sur un « harnais » générique (la tuyauterie qui relie le modèle au jeu), et ce harnais jette le raisonnement du modèle après chaque action.
GPT-5.6 devait donc tout recomprendre à chaque tour, comme s’il perdait la mémoire en boucle. En activant deux options qu’OpenAI emploie déjà dans ChatGPT et Codex, la conservation du raisonnement et la compaction, le même modèle grimpe de 13,3 % à 38,3 %, avec six fois moins de jetons consommés. Soit, sur le papier, mieux que les 30,2 % d’Opus 5.
Le développeur autrichien Peter Steinberger (le papa d’OpenClaw), passé ingénieur chez OpenAI début 2026, a enfoncé le clou, se demandant tout haut si personne, chez Anthropic, ne s’était étonné de chiffres aussi absurdes avant de crier victoire.
La partie n’est évidemment pas neutre. ARC Prize, de son côté, reconnaît que le résultat d’OpenAI est réel et utile, tout en défendant son harnais volontairement basique : il impose à tous les modèles les mêmes conditions, pour comparer sur un pied d’égalité. Les deux labos, eux, se livrent déjà une guerre des agents de bureau autrement plus lucrative.
Au-delà de la bagarre d’egos, il y a une vraie leçon. Un benchmark ne mesure jamais un modèle tout seul : il mesure aussi le harnais, les réglages d’API et le niveau d’effort choisis par celui qui fait passer le test.
Le score d’Opus 5 tient la route parce qu’un tiers l’a vérifié. Celui de GPT-5.6 rappelle qu’un même modèle peut passer du simple au triple selon la plomberie autour. Avant de gober un « x3 » en gras, mieux vaut se demander qui a mesuré, sur quel harnais et à quel niveau d’effort.
D’ailleurs, Composio a récemment fait un test : faire tourner le modèle Kimi K3 sur trois harnais différents : Kimi Code, Hermes et Claude Code sur la même tâche. Le résultat est quasi similaire (la tâche a été effectuée), mais la consommation de tokens (et donc le coût) est radicalement différent. Une autre preuve que le harnais a presque autant d’importance que le choix du modèle.
Téléchargez notre application Android et iOS ! Vous pourrez y lire nos articles, dossiers, et regarder nos dernières vidéos YouTube.

Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.