Gemini 4 Argon peut générer un million de jetons en une seule réponse : voici ce que ça change

 
Google a multiplié par quinze la longueur maximale d’une réponse de Gemini. Personne ne lira un million de jetons d’une traite, et c’est voulu : Gemini 4 Argon est conçu pour travailler pendant qu’on fait autre chose.

On attendait tous l’annonce de Google. Il faut dire que la firme américaine était larguée par rapport à Anthropic et OpenAI. Gemini 4 Argon a été annoncé par Google le 30 septembre. Google met en avant un plafond d’un million de jetons de sortie par réponse, contre 64 000 sur ses modèles précédents. Encore faut-il savoir quoi faire d’une réponse aussi longue.

Un jeton correspond à un morceau de mot, en gros trois quarts d’un mot anglais. Un million de jetons de sortie représente donc environ 750 000 mots, soit l’intégralité de Guerre et Paix avec de la marge pour Cent ans de solitude. Lire tout ça prendrait une cinquantaine d’heures.

Pour aller plus loin
C’est quoi un token dans l’IA ? Tout comprendre à une notion primordiale

Google ne vise évidemment pas les romanciers pressés (même s’ils se reconnaîtront) : cette limite sert à laisser le modèle enchaîner raisonnement, essais et corrections dans une seule exécution, sans être coupé en plein milieu.

Ses concurrents directs, GPT-6 Astra et Claude Opus 5.5, plafonnent à 128 000 jetons par réponse. Côté tarifs, Google facture 2 dollars (environ 1,70 €) HT le million de jetons en entrée et 10 dollars (environ 8,50 €) HT en sortie, puis le double une fois la promotion de lancement terminée.

Pour aller plus loin
Google annonce Gemini 4 Argon et affirme battre GPT-6 Astra et Opus 5.5

Ce que Google fait déjà avec Argon

Les exemples donnés par Google montrent bien le public visé. Des agents Argon migrent du code C et C++ vers Rust, jusqu’aux plus de 800 000 lignes du noyau Zircon de Fuchsia.

D’autres ont épluché la télémétrie des centres de données de l’entreprise et libéré plus de 300 Tio de mémoire, avec 500 Tio à 1 Pio espérés à terme.

Ce sont des chantiers d’ingénierie au long cours, loin des simples questions qu’on peut poser dans un chat.

Sur les tâches de développement très longues, Argon reste derrière OpenAI : dans le tableau publié par Google lui-même, il obtient 55 % sur FrontierSWE v2, un test de développement logiciel au long cours, contre 65,5 % pour GPT-6 Astra.

Côté facture, Artificial Analysis mesure un coût de 1,99 dollar (environ 1,70 €) par tâche de son index, soit 60 % des 3,26 dollars de GPT-6 Astra. Argon consomme pourtant en moyenne 62 000 jetons de sortie par tâche, contre 27 000 pour Astra : il revient moins cher parce que son jeton coûte cinq fois moins. Une fois la promotion terminée (Google n’a pas donné de date, Artificial Analysis parle d’au moins un mois), le coût par tâche double à 3,98 dollars (environ 3,40 €) et dépasse les 3,26 dollars de GPT-6 Astra. Quant aux scores, leur fiabilité fait déjà débat.

Argon n’est pas non plus l’option la moins chère chez OpenAI. Selon Artificial Analysis, GPT-6.1 Sol obtient 52 points sur son index, un de moins qu’Argon, et coûte 2,7 fois moins cher par tâche, même pendant la promotion de lancement de Google.

Pour aller plus loin
« Benchmaxxing » : pourquoi les résultats du surpuissant Gemini 4 font polémique face à GPT et Claude

Qui surveille un modèle qui travaille seul pendant des heures ?

Pour un développeur qui enchaîne les petites requêtes, cette limite ne change rien : 64 000 jetons suffisaient déjà largement.

La limite sert surtout aux équipes qui veulent confier une migration, un audit de sécurité ou une analyse financière à un agent et revenir le lendemain. Avec un réflexe à prendre : fixer un plafond de dépenses, parce que c’est le modèle qui décide combien de jetons il brûle.

Pour donner un ordre d’idée, une réponse qui irait jusqu’au plafond d’un million de jetons coûterait 10 dollars (environ 8,50 €) HT en sortie au tarif de lancement, puis 20 dollars une fois la promotion terminée, sans compter les jetons d’entrée.

Vient ensuite la question du contrôle. Google surveille le raisonnement d’Argon en temps réel, interrompt l’exécution en cas de dérive, et fait auditer à la main chaque migration avant la mise en production. METR, l’organisme qui mesure la longueur des tâches que les IA savent boucler seules (en temps de travail d’un expert humain), traque les cas de triche dans ses tests et reconnaît que ses mesures ne sont plus fiables au-delà de seize heures.

Autrement dit, même Google traite son modèle comme un prestataire à qui on ne tourne pas le dos, d’autant qu’un modèle Gemini s’était déjà introduit chez trois entreprises lors d’un test en mai, comme le détaille Numerama. L’accès reste limité. De ce fait, Google ouvre d’abord Argon à des défenseurs cyber triés sur le volet, via son programme Fairwind. L’API payante et les abonnés AI Ultra suivront, mais il n’y a aucune date annoncée pour le moment.

Le million de jetons sert d’argument marketing, mais il décrit honnêtement un produit conçu pour travailler des heures sans nous.

Plus la réponse est longue, plus la vérification coûte en temps humain : Google lui-même fait relire chaque migration à la main. Tant qu’Argon reste réservé au programme Fairwind, ni les développeurs ni la presse ne peuvent tester ses promesses sur une vraie tâche longue.

Pour aller plus loin
« Benchmaxxing » : pourquoi les résultats du surpuissant Gemini 4 font polémique face à GPT et Claude


Téléchargez notre application Android et iOS ! Vous pourrez y lire nos articles, dossiers, et regarder nos dernières vidéos YouTube.

Recherche IA boostée par
Perplexity