
Moins d’une semaine après le lancement de Claude Opus 5.5, Anthropic sort le deuxième modèle de sa famille Claude 5.5. L’entreprise américaine a présenté Claude Sonnet 5.5 ce lundi 28 septembre. Pour ceux qui paient l’IA à l’usage, elle annonce des tâches jusqu’à 30 % moins chères qu’avec Sonnet 5 et des réponses générées plus de 30 % plus vite. Surtout, ce modèle de milieu de gamme arrive à quelques points d’Opus 5.5 sur la plupart des tests publiés par Anthropic, pour un prix par token deux fois plus bas.
Anthropic ne touche pas aux tarifs de Sonnet 5. Le million de tokens (des morceaux de mots, l’unité de facturation des modèles d’IA) coûte 2 dollars en entrée, et 10 dollars en sortie. Les lectures de cache, quand le modèle réutilise un contexte déjà envoyé, restent à 0,20 dollar. La baisse de la facture vient donc d’ailleurs : Sonnet 5.5 consomme moins de tokens pour faire le même travail.
Opus 5.5 est facturé le double, 4 et 20 dollars le million de tokens, alors qu’il promettait déjà d’être 40 % moins cher à faire tourner qu’Opus 5. Anthropic répartit les rôles sans ambiguïté. Opus 5.5 garde le travail complexe qui demande du jugement, et Sonnet 5.5 prend les tâches courantes bien cadrées : corriger des bugs, produire des documents, des présentations ou des tableurs.
Un Sonnet au niveau d’Opus sur plusieurs tests
Sur Terminal-Bench 4.0, Sonnet 5 plafonnait à 10,3 %, et Sonnet 5.5 atteint 70,6 %. Ce test mesure si un modèle sait mener seul des tâches professionnelles en plusieurs étapes dans un terminal, la fenêtre de commandes des développeurs. On parle de programmation agentique. Opus 5.5 fait moins bien, avec un meilleur score de 66,4 % obtenu au réglage Xhigh.

Sur les autres tests, Opus 5.5 garde un peu d’avance. GDPval-AA évalue des tâches de bureau tirées de 44 métiers. Sonnet 5.5 y obtient 1 844 points, contre 1 846 pour Opus 5.5 et 1 449 pour Sonnet 5. Sur CursorBench 4.0, construit à partir de vraies sessions de l’éditeur de code Cursor, l’écart est d’un peu plus de deux points (55,5 % contre 57,8 %). Anthropic reconnaît d’ailleurs que les benchmarks ne disent pas tout : d’après ses tests, Opus 5.5 reste « clairement plus fort » sur le travail complexe et ouvert.
Ses capacités en cybersécurité se rapprochent de celles d’Opus 5. Sonnet 5.5 est donc le premier Sonnet lancé avec des garde-fous comparables à ceux des modèles haut de gamme d’Anthropic. Les demandes jugées à haut risque basculent de façon visible vers Sonnet 5, et la correction de bugs ordinaire n’est pas concernée. Côté biologie, Anthropic garde les protections de Sonnet 5.
Et face à GPT-6 Sol ?
Le tableau d’Anthropic place aussi Sonnet 5.5 face à GPT-6 Sol. OpenAI a sorti ce modèle le 22 septembre, le même jour qu’Opus 5.5, en jouant la carte du prix face à Opus 5.5. GPT-6 Sol et Sonnet 5.5 sont d’ailleurs facturés exactement pareil, 2 et 10 dollars le million de tokens. Pourtant, sur Terminal-Bench 4.0, la case de GPT-6 Sol reste vide. OpenAI n’a pas publié de score, et Anthropic a mis l’ancien GPT-5.6 Sol dans ses graphiques.
Le cabinet indépendant Artificial Analysis, qui fait passer ses propres tests aux modèles d’IA, a mesuré GPT-6 Sol à 43 % sur Terminal-Bench 4.0 au réglage maximal. Il l’a toutefois fait dans Codex, l’outil de code d’OpenAI, avec un protocole différent de celui d’Anthropic. Les deux chiffres ne se comparent donc pas directement.
Là où les deux modèles figurent côte à côte, Sonnet 5.5 passe devant sur GDPval-AA, avec 1 844 points contre 1 487. Sur FrontierCode, qui vérifie si une modification de code serait acceptée sans retouche, il obtient 52,1 % au réglage Xhigh contre 49,3 % pour GPT-6 Sol. En revanche, il tombe à 46,2 % au réglage Max, le plus poussé. Selon Anthropic, le modèle y lance plus souvent une relecture de code confiée à plusieurs sous-agents, ce qui a parfois mené à des délais dépassés ou à des modifications hors du périmètre demandé, deux choses que FrontierCode pénalise.
Sonnet 5.5 est disponible dès ce lundi dans les applications Claude. Il y tourne par défaut au réglage d’effort Medium, comme dans Claude Code, contre High sur la plateforme développeurs. Ce curseur fixe le temps de réflexion du modèle. Il est aussi proposé chez AWS, Google Cloud et Microsoft Azure. Sur la plateforme Claude, les développeurs l’appellent avec l’identifiant claude-sonnet-5-5, et ceux qui utilisaient Sonnet sans réflexion doivent d’abord passer au nouveau réglage between_tools. Pour les usages à très gros volume, Anthropic annonce Claude Haiku 5.5 « dans les prochaines semaines », sans date précise.
Si vous voulez recevoir les meilleures actus Frandroid sur WhatsApp, rejoignez cette discussion.

Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.