Claude Sonnet 5.5 : Anthropic lance un modèle plus rapide et moins cher, presque au niveau d’Opus 5.5

Presque Opus, moitié prix

 
Anthropic a lancé ce lundi 28 septembre Claude Sonnet 5.5, plus de 30 % plus rapide que Sonnet 5 et jusqu’à 30 % moins cher par tâche, au même prix par token. Sur le test de codage Terminal-Bench 4.0, il passe de 10,3 % à 70,6 % et devance Opus 5.5, le modèle phare de la famille Claude 5.5.
Logo Claude AI – Anthropic // Source : Anthropic

Moins d’une semaine après le lancement de Claude Opus 5.5, Anthropic sort le deuxième modèle de sa famille Claude 5.5. L’entreprise américaine a présenté Claude Sonnet 5.5 ce lundi 28 septembre. Pour ceux qui paient l’IA à l’usage, elle annonce des tâches jusqu’à 30 % moins chères qu’avec Sonnet 5 et des réponses générées plus de 30 % plus vite. Surtout, ce modèle de milieu de gamme arrive à quelques points d’Opus 5.5 sur la plupart des tests publiés par Anthropic, pour un prix par token deux fois plus bas.

Anthropic ne touche pas aux tarifs de Sonnet 5. Le million de tokens (des morceaux de mots, l’unité de facturation des modèles d’IA) coûte 2 dollars en entrée, et 10 dollars en sortie. Les lectures de cache, quand le modèle réutilise un contexte déjà envoyé, restent à 0,20 dollar. La baisse de la facture vient donc d’ailleurs : Sonnet 5.5 consomme moins de tokens pour faire le même travail.

Opus 5.5 est facturé le double, 4 et 20 dollars le million de tokens, alors qu’il promettait déjà d’être 40 % moins cher à faire tourner qu’Opus 5. Anthropic répartit les rôles sans ambiguïté. Opus 5.5 garde le travail complexe qui demande du jugement, et Sonnet 5.5 prend les tâches courantes bien cadrées : corriger des bugs, produire des documents, des présentations ou des tableurs.

Un Sonnet au niveau d’Opus sur plusieurs tests

Sur Terminal-Bench 4.0, Sonnet 5 plafonnait à 10,3 %, et Sonnet 5.5 atteint 70,6 %. Ce test mesure si un modèle sait mener seul des tâches professionnelles en plusieurs étapes dans un terminal, la fenêtre de commandes des développeurs. On parle de programmation agentique. Opus 5.5 fait moins bien, avec un meilleur score de 66,4 % obtenu au réglage Xhigh.

Les benchmarks présentés par Anthropic // Source : Anthropic

Sur les autres tests, Opus 5.5 garde un peu d’avance. GDPval-AA évalue des tâches de bureau tirées de 44 métiers. Sonnet 5.5 y obtient 1 844 points, contre 1 846 pour Opus 5.5 et 1 449 pour Sonnet 5. Sur CursorBench 4.0, construit à partir de vraies sessions de l’éditeur de code Cursor, l’écart est d’un peu plus de deux points (55,5 % contre 57,8 %). Anthropic reconnaît d’ailleurs que les benchmarks ne disent pas tout : d’après ses tests, Opus 5.5 reste « clairement plus fort » sur le travail complexe et ouvert.

Ses capacités en cybersécurité se rapprochent de celles d’Opus 5. Sonnet 5.5 est donc le premier Sonnet lancé avec des garde-fous comparables à ceux des modèles haut de gamme d’Anthropic. Les demandes jugées à haut risque basculent de façon visible vers Sonnet 5, et la correction de bugs ordinaire n’est pas concernée. Côté biologie, Anthropic garde les protections de Sonnet 5.

Et face à GPT-6 Sol ?

Le tableau d’Anthropic place aussi Sonnet 5.5 face à GPT-6 Sol. OpenAI a sorti ce modèle le 22 septembre, le même jour qu’Opus 5.5, en jouant la carte du prix face à Opus 5.5. GPT-6 Sol et Sonnet 5.5 sont d’ailleurs facturés exactement pareil, 2 et 10 dollars le million de tokens. Pourtant, sur Terminal-Bench 4.0, la case de GPT-6 Sol reste vide. OpenAI n’a pas publié de score, et Anthropic a mis l’ancien GPT-5.6 Sol dans ses graphiques.

Le cabinet indépendant Artificial Analysis, qui fait passer ses propres tests aux modèles d’IA, a mesuré GPT-6 Sol à 43 % sur Terminal-Bench 4.0 au réglage maximal. Il l’a toutefois fait dans Codex, l’outil de code d’OpenAI, avec un protocole différent de celui d’Anthropic. Les deux chiffres ne se comparent donc pas directement.

Là où les deux modèles figurent côte à côte, Sonnet 5.5 passe devant sur GDPval-AA, avec 1 844 points contre 1 487. Sur FrontierCode, qui vérifie si une modification de code serait acceptée sans retouche, il obtient 52,1 % au réglage Xhigh contre 49,3 % pour GPT-6 Sol. En revanche, il tombe à 46,2 % au réglage Max, le plus poussé. Selon Anthropic, le modèle y lance plus souvent une relecture de code confiée à plusieurs sous-agents, ce qui a parfois mené à des délais dépassés ou à des modifications hors du périmètre demandé, deux choses que FrontierCode pénalise.

Sonnet 5.5 est disponible dès ce lundi dans les applications Claude. Il y tourne par défaut au réglage d’effort Medium, comme dans Claude Code, contre High sur la plateforme développeurs. Ce curseur fixe le temps de réflexion du modèle. Il est aussi proposé chez AWS, Google Cloud et Microsoft Azure. Sur la plateforme Claude, les développeurs l’appellent avec l’identifiant claude-sonnet-5-5, et ceux qui utilisaient Sonnet sans réflexion doivent d’abord passer au nouveau réglage between_tools. Pour les usages à très gros volume, Anthropic annonce Claude Haiku 5.5 « dans les prochaines semaines », sans date précise.


Les bons plans n’attendent pas : abonnez-vous à notre canal WhatsApp Frandroid Bons Plans ! (zéro spam, promis, juste de super bons plans).

Recherche IA boostée par
Perplexity