
Google n’avait plus sorti de modèle phare depuis Gemini 3.1 Pro, il y a plus de sept mois, et avait même abandonné en route un Gemini 3.5 Pro promis pour juin. Ce mercredi 30 septembre, Koray Kavukcuoglu, vice-président senior de Google DeepMind et architecte en chef de l’IA chez Google, a donc présenté Gemini 4 Argon comme la « prochaine ère d’intelligence frontière ».
Dans le tableau qui accompagne l’annonce, le modèle arrive premier sur 13 des 19 benchmarks (des séries de tests standardisés), devant GPT-6 Astra d’OpenAI et Claude Opus 5.5 d’Anthropic. Pourtant, les évaluateurs indépendants qui ont publié leurs mesures dans la foulée ne le placent pas tous en tête, et l’un d’eux le met seulement huitième.
Argon est conçu pour les tâches longues : développement logiciel, recherche juridique et financière, cyberdéfense. Sa principale nouveauté technique tient à la longueur de ses réponses, qui peuvent atteindre 1 million de tokens (les fragments de mots que le modèle manipule), contre 64 000 jusqu’ici, de quoi mener une grosse migration de code d’un seul tenant au lieu de la découper.
Les mesures indépendantes confirment tout de même le bond. Sur l’indice du cabinet Artificial Analysis, Argon gagne 23 points par rapport à Gemini 3.1 Pro Preview, qui plafonnait à 30 points ; selon le cabinet, Google revient ainsi parmi les trois premiers laboratoires d’IA.
Chez Artificial Analysis, Claude Opus 5.5 garde cinq points d’avance
Artificial Analysis est un cabinet indépendant qui fait passer la même batterie d’épreuves à tous les modèles. Son Intelligence Index agrège dix tests, du code dans un terminal au raisonnement scientifique, en passant par des tâches de bureau confiées à des agents (des IA qui enchaînent seules plusieurs actions).

Sur cet indice, Argon obtient 52,6 points à son réglage « High ». Claude Opus 5.5 est premier avec 57,6 points, devant Claude Sonnet 5.5 (56) et GPT-6 Astra (52,7). En clair, Argon fait jeu égal avec le modèle d’OpenAI mais reste à cinq points de celui d’Anthropic, et se classe huitième au général, les sept premières places revenant à différents réglages des modèles d’Anthropic et à GPT-6 Astra.
Pour aller plus loin
GPT-6, Fable 5.1 : comment lire les benchmarks de Claude et GPT sans se faire avoir
Le détail des épreuves va dans le même sens. Sur GDPval-AA, qui reproduit des tâches professionnelles issues de 44 métiers, Argon obtient un score Elo (une note de classement héritée des échecs) de 1 611, devant Astra (1 542) mais loin d’Opus 5.5 (1 846). Sur Humanity’s Last Exam, un examen de connaissances et de raisonnement réputé très difficile, il fait 57,1 %, contre 54,7 % pour Astra et 61,4 % pour Opus 5.5.

Comment Google arrive-t-il alors à treize premières places ? Déjà, c’est lui qui choisit les dix-neuf épreuves de son tableau. Surtout, il n’a pas toujours mesuré les concurrents lui-même : sur Terminal-Bench 4.0, comme l’a relevé Trending Topics, Google affiche pour Opus 5.5 les 66,4 % annoncés par Anthropic, alors qu’Artificial Analysis ne mesure que 59,6 %. Le score d’Argon, en revanche, colle à la mesure indépendante, avec 57,4 % chez Google et 57,1 % chez Artificial Analysis.
Certaines victoires de Google restent nettes sur le papier. Sur DeepSWE v1.1, qui évalue des tâches de développement longues tirées de projets réels, Argon affiche 77,9 %, contre 74,2 % pour Opus 5.5 et 74,1 % pour Astra. Pour autant, ce chiffre vient du tableau de Google lui-même.
Les évaluateurs indépendants ne sont pas non plus d’accord entre eux. Le Vals Index, tenu par la société Vals AI, pondère des tâches de finance, de code, de droit et de fiscalité selon le poids de chaque secteur dans le PIB américain, et place cette fois Argon premier avec 68,9 %, un peu moins de deux points devant Claude Sonnet 5.5 et Claude Opus 5.5, une première pour un modèle Gemini.

Le site spécialisé The Decoder a bien résumé la situation en titrant que Gemini 4 Argon « comble l’écart avec OpenAI et Anthropic mais ne prend pas une avance claire ».
Premier pour discuter, huitième pour coder un site web
Sur Arena (anciennement LMArena), le verdict se coupe en deux. Sur cette plateforme, des internautes posent une question, reçoivent deux réponses anonymes et votent pour la meilleure. Dans le classement texte, Argon est premier avec 1 525 points, 20 points devant Claude Opus 4.6, et arrive aussi en tête des catégories code, requêtes difficiles et écriture créative.
En revanche, dans Code Arena WebDev, où chaque modèle doit construire une application web que les votants comparent ensuite, Argon n’est que huitième avec 1 679 points. Le progrès est net, puisque Gemini 3.8 Flash pointait à la 29e place, mais Argon reste loin du podium.
Même chose dans Agent Arena, qui évalue des IA chargées de mener une tâche de bout en bout : Argon y est aussi huitième, avec un score d’amélioration nette de +7,92 %. Arena précise que ce résultat reste préliminaire, puisqu’il repose sur environ 3 000 sessions réelles. Ce grand écart compte, car le développement web et les agents sont justement les usages que Google met en avant pour les entreprises.
Des salariés de Google dubitatifs ?
Ce point faible recoupe ce que racontent des salariés de Google. Le jour même du lancement, Bloomberg a publié une enquête de Julia Love et Davey Alba selon laquelle des employés ayant accès au modèle doutent de ses performances en usage réel.
D’après ces sources anonymes, Gemini 4 brille sur les benchmarks mais fait moins bien une fois mis au travail, avec des difficultés sur certaines tâches de code, notamment le front-end, la partie qui décide de l’apparence d’un site ou d’une application. On appelle ça le benchmaxxing : faire en sorte que le modèle fasse un bon score dans les tests, sans qu’il soit bon dans la réalité. « C’estun problème extrêmement pernicieux », résume Edwin Chen, fondateur de la start up Surge AI, à propos de cette tendance du secteur.
Google conteste. L’entreprise juge « inexact » de dire que Gemini 4 sous-performe en code, et renvoie aux propos de Koray Kavukcuoglu, qui s’est dit encouragé par les résultats du modèle. Un autre salarié cité par Bloomberg évoque même un « large consensus » en interne pour dire que Gemini 4 est au niveau des meilleurs.
Il s’agit de témoignages anonymes, sans évaluation publiée à l’appui, mais ils collent avec la huitième place d’Argon en développement web.
Moins d’hallucinations, mais un accès encore fermé
Pour un utilisateur, le chiffre le plus parlant vient encore d’Artificial Analysis. Sur son test AA-Omniscience, qui mesure la part de mauvaises réponses quand le modèle ne connaît pas la bonne, Argon affiche un taux d’hallucination de 15 %, contre 51 % pour GPT-6 Astra, soit plus de trois fois moins. C’est le taux le plus bas parmi les modèles qui dépassent 45 points sur l’indice du cabinet.
En pratique, Argon préfère dire qu’il ne sait pas plutôt que d’inventer. Pour autant, il ne connaît pas plus de choses : sur le même test, il ne donne la bonne réponse qu’une fois sur deux (50 %), 13 points de moins qu’Astra. Pour un juriste ou un journaliste, un « je ne sais pas » vaut mieux qu’une réponse inventée, mais il faudra plus souvent chercher ailleurs.
Encore faut-il pouvoir l’utiliser. Au lancement, Argon n’est ouvert qu’à des spécialistes de la cyberdéfense triés sur le volet, via le programme Fairwind de Google. Viendront ensuite les clients payants de l’API (l’interface qui permet aux entreprises de brancher le modèle dans leurs propres outils) et les abonnés Google AI Ultra, sans date annoncée. Clubic a résumé la situation dans son titre : « une IA qui bat GPT-6 Astra sur le papier mais que presque personne ne peut utiliser« .
Google justifie ce déploiement au compte-gouttes par la sécurité. Le groupe dit participer au dispositif volontaire du gouvernement américain qui permet de tester les modèles avant leur sortie, et veut renforcer ses garde-fous (usages malveillants, injections de prompt) avant d’ouvrir plus largement l’accès. Les défenseurs du programme Fairwind reçoivent d’ailleurs une version d’Argon privée des garde-fous liés à la cybersécurité, pour exploiter pleinement ses capacités de défense.
Côté prix, Google annonce un tarif de lancement de 2 dollars par million de tokens en entrée et 10 dollars en sortie (environ 1,70 € et 8,50 € HT), qui passera ensuite à 4 et 20 dollars (environ 3,40 € et 17 € HT), sans date précise : d’après Artificial Analysis, la remise doit durer au moins un mois. Ce tarif de lancement représente la moitié de celui d’Opus 5.5 et le cinquième de celui de GPT-6 Astra, facturé 10 et 50 dollars (environ 8,50 € et 42,50 € HT).
Comme les modèles ne consomment pas tous autant de tokens pour une même tâche, Artificial Analysis a aussi calculé le coût moyen d’une tâche de son indice : 1,99 dollar pour Argon (environ 1,70 €), 3,26 dollars pour Astra (environ 2,80 €) et 5,98 dollars pour Opus 5.5 (environ 5,10 €).

Arena arrive à une conclusion proche, avec un prix mixte (une moyenne de l’entrée et de la sortie) de 8 dollars par million de tokens, soit environ 6,80 € HT, et un coût de 0,62 dollar (environ 0,53 €) par tâche dans Agent Arena.
Arena place ainsi Argon sur sa frontière de Pareto, c’est-à-dire parmi les modèles qu’aucun autre ne bat à la fois sur le score et sur le prix. Attention tout de même à GPT-6.1 Sol d’OpenAI, au même tarif au token qu’Argon, qui obtient 51,8 points chez Artificial Analysis pour 0,72 dollar (environ 0,60 €) par tâche, parce qu’il consomme beaucoup moins de tokens : on l’avait vu, il offre presque le niveau d’Astra pour un cinquième du prix, et il bouscule aussi le rapport puissance-prix de Claude Opus 5.5.
Le bon rapport prix-performance d’Argon tient toutefois surtout à sa promotion de lancement. Artificial Analysis relève qu’il produit en moyenne 62 000 tokens en sortie par tâche, contre 27 000 pour GPT-6 Astra : son avantage vient uniquement du prix du token. Une fois la remise de 50 % terminée, le cabinet estime que le coût d’une tâche de son indice grimpera à 3,98 dollars (environ 3,40 €), soit environ 1,2 fois celui d’Astra. Argon sera alors facturé au même tarif au token qu’Opus 5.5, soit 4 et 20 dollars par million de tokens.
Si vous voulez recevoir les meilleures actus Frandroid sur WhatsApp, rejoignez cette discussion.

Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.