
Mistral a surnommé son nouveau modèle « le Chonk ». Sur Internet, un chonk est un chat beaucoup trop gros que tout le monde trouve adorable, et à qui personne ne demande d’attraper des souris.
Le nom est assumé, puisque Large 4 est le plus gros modèle jamais entraîné par la start-up française. Depuis ce mardi, des évaluateurs indépendants comme Artificial Analysis, Vals.ai ou Arena l’ont posé sur leur propre balance, et son poids n’est plus vraiment le sujet.
Mistral Large 4 est sorti ce mardi 6 octobre en préversion publique, uniquement par l’API. Il compte 1 000 milliards de paramètres (contre 675 milliards pour Large 3), dont 52 milliards actifs à chaque réponse selon la page actuelle de Mistral (la première version de l’annonce en indiquait 49).
Il a été entraîné à partir de zéro sur 3 800 GPU Nvidia dans les centres de données européens de l’entreprise. C’est le premier jalon financé par sa levée de 3 milliards d’euros. On avait raconté le lancement de Large 4 face aux cadors chinois, avec une promesse ambitieuse sur les modèles à poids ouverts. On a donc cherché à savoir s’il est surcoté, et la réponse change selon qu’on lit le texte de l’annonce ou ses graphiques.
Pour aller plus loin
« On a accompli des miracles » : Mistral annonce Large 4, sa nouvelle IA surpuissante qui défie les cadors chinois
Droit et cybersécurité : là où Large 4 est vraiment bon
Le résultat le plus solide vient du droit. Sur le Legal Agent Benchmark de Harvey, mesuré par Vals.ai, Large 4 est 6e sur 76 modèles avec 15,83 %, et premier des modèles à poids ouverts. GPT-6 Astra est 31e, Claude Opus 5.5 38e. Le score paraît faible parce que le test est dur pour tout le monde : le premier, Muse Spark 1.2 de Meta, plafonne à 25,4 %.

En cybersécurité, il prend la tête de CyberGym-E2E avec 82 %, un test qui demande de reproduire une vraie faille dans un logiciel libre puis de la corriger (source : Artificial Analysis). Sur le Cyber Index du même évaluateur, il atteint 50, à égalité avec GLM-5.3-Flash et derrière MiMo-V2.6-Pro (56). Ce 82 % se lit avec une précaution. Selon Mistral, Claude Opus 5.5 et GPT-6 Astra sont proches de zéro sur ce test parce qu’ils refusent la tâche. L’écart mesure donc en partie leurs garde-fous. Pour une équipe de sécurité qui veut un modèle qui ne claque pas la porte en plein incident, l’argument reste concret.
Mistral assure de son côté que Large 4 refuse plus souvent que tous les autres modèles ouverts les demandes cyber clairement malveillantes, en moyenne sur trois jeux de tests publics (JailbreakBench, StrongREJECT et AgentHarm). Ce chiffre vient de Mistral lui-même.
Le saut de génération est réel lui aussi. L’indice d’intelligence d’Artificial Analysis passe de 9,3 pour Large 3 et 14,2 pour Medium 3.5 à 38,4, soit 2,7 fois le score du meilleur Mistral précédent. En création de sites web, il est 42e sur 141 dans la WebDev Arena quand Medium 3.5 pointait à la 125e place. Il est rapide, avec 116 jetons par seconde, ce qui le classe 37e sur 226. Dans le classement de QUELLE IA, le meilleur modèle européen restait jusqu’ici Medium 3.5, 111e ; la fiche de Large 4 recevra son score dès que les benchmarks suivis l’auront mesuré.

En agent et en code, le compte n’y est pas
Mistral présente Large 4 comme un modèle taillé pour les agents, ces programmes qui enchaînent seuls des actions avec des outils. L’Agent Arena, qui s’appuie sur des sessions de vrais utilisateurs, le classe 43e sur 52 avec un score net négatif de 6,6 % (données publiques de ce jeudi 8 octobre). Il est dernier pour l’hallucination d’outils, c’est-à-dire l’invention d’appels qui n’existent pas, et dernier aussi pour le respect des consignes en cours de tâche. Seule consolation, il gagne onze places sur Medium 3.5, et son rang sur le résultat final des tâches est plus honorable, 28e.

En code agentique, Large 4 reste aussi loin du compte. Sur Terminal-Bench 4.0, Mistral annonce 28,3 %, Artificial Analysis mesure 26,8 % et Vals.ai 22,73 %, quand Claude Opus 5.5 et GPT-6 Astra tournent entre 59 et 65 %. GLM-5.3 obtient entre 38,9 et 41,9 % selon l’évaluateur. En conversation, l’Arena texte le place entre la 100e et la 115e place sur 414, avec des marges d’erreur qui recouvrent celles de Large 3 et de Medium 3.5. Pour discuter, aucun progrès n’est mesurable.
Vals.ai, qui classe Large 4 6e sur 76 en droit, le place 33e sur 45 sur son indice général, avec 48,05 %. Le droit reste de loin son meilleur résultat chez cet évaluateur.
Deux chiffres d’Artificial Analysis pèsent aussi sur l’usage quotidien. Le taux d’hallucination atteint 41,9 % sur AA-Omniscience, pour 25,8 % de réponses exactes. Le modèle est aussi très bavard, avec 200 millions de jetons produits pour passer l’indice contre une médiane de 81 millions. Comme on paie au jeton, cette verbosité se retrouve sur la facture, on y revient plus bas.
Ce que l’annonce de Mistral a enjolivé
Ce que l’on a remarqué, c’est que le texte de l’annonce est plus flatteur que ses propres graphiques. Mistral écrit que Large 4 est « state of the art » parmi les modèles ouverts sur SciCode-Verified ; sur le graphique placé juste en dessous, il est cinquième sur onze, derrière GLM-5.3 et MiMo-V2.6-Pro entre autres.
Sur AutomationBench, le texte le dit devant Kimi K3, MiMo et DeepSeek V4 Pro, sans préciser que GLM-5.3 le devance (62,2 contre 59,9). Même procédé sur AA-Briefcase, où il est présenté comme supérieur à DeepSeek V4 Pro alors qu’il est quatrième du graphique.
Mistral choisit aussi ses adversaires. Aucun Gemini n’apparaît sur les 26 graphiques, alors que Gemini 4 Argon est premier sur Finance Agent v2 et sur AutomationBench. GPT-6 Astra disparaît de la plupart des comparaisons en code et en agent.
D’ailleurs, les axes démarrent rarement à zéro, ce qui donne du relief au demi-point d’avance sur Dense 200, le test de repérage visuel où Mistral revendique de battre les modèles fermés (42 contre 41,5).
Trois tests de code ont été mesurés avant la sortie publique de leur harnais, donc personne ne peut encore les refaire. Ces ficelles ne sont pas propres à Mistral, on les avait détaillées dans notre guide pour lire les benchmarks sans se faire avoir.

L’étiquette « poids ouverts » nécessite elle aussi un astérisque. À ce jour, rien n’est téléchargeable et la documentation n’indique aucune licence. Mistral promet les poids avant la fin du mois, sans date précise sur sa page, même la date du 27 octobre, évoquée au lancement, n’y figure pas.
Large 3 était sous Apache 2.0, mais Large 2 était sorti sous Mistral Research License, qui interdit l’usage commercial sans accord. Rien ne garantit la même ouverture cette fois. Les évaluateurs ne cochent d’ailleurs pas la même case, puisque Artificial Analysis et Arena le rangent parmi les modèles propriétaires quand Vals.ai le liste déjà comme ouvert.
Mistral justifie ce délai par une phase de test en conditions réelles. D’ici la publication des poids, des spécialistes de la cybersécurité, des partenaires triés sur le volet et des autorités publiques utilisent le même modèle, avec une modération allégée et des capacités cyber étendues.
Enfin, d’autres caractéristiques changent selon l’endroit où on regarde. La documentation annonce une fenêtre de contexte d’un million de jetons, Artificial Analysis et Vals.ai en relèvent environ 512 000. La fiche produit décrit un modèle à l’aise dans plus de 160 langues, alors que le texte dit seulement que les données d’entraînement couvraient 160 langues, et aucune mesure en français n’a été publiée. Les prix mis en avant, 0,68 dollar (environ 0,60 € hors taxes) en entrée et 2,09 dollars (environ 1,85 €) en sortie par million de jetons, sont une promotion de lancement à moitié prix, prévue pour les deux premières semaines selon Artificial Analysis, soit jusqu’au 20 octobre environ.
Pour aller plus loin
GPT-6, Fable 5.1 : comment lire les benchmarks de Claude et GPT sans se faire avoir
Face aux modèles chinois et américains
Guillaume Lample, cofondateur et directeur scientifique de Mistral, situe Large 4 au niveau des « meilleurs modèles chinois d’il y a un mois ou deux ». L’indice d’intelligence d’Artificial Analysis, qui agrège dix évaluations, est un peu moins généreux.

- Claude Opus 5.5 (Anthropic, fermé) : 57,6
- GPT-6 Astra (OpenAI, fermé) : 52,7
- MiMo-V2.6-Pro (Xiaomi, ouvert) : 46,3
- GLM-5.3 (Z.ai, ouvert) : 44,8
- Kimi K3 (Moonshot, ouvert) : 43,6
- DeepSeek V4.1 Flash (ouvert) : 39,5
- Mistral Large 4 : 38,4
- GPT-6 Luna (OpenAI, fermé) : 38,1
- Mistral Large 3 : 9,3
Large 4 est donc le meilleur modèle conçu hors des États-Unis et de la Chine, ce qu’Artificial Analysis souligne dans son titre. Parmi les modèles à poids ouverts ou annoncés comme tels, il est huitième, derrière sept modèles chinois. Ses voisins de palier sont DeepSeek V4.1 Flash, la version légère de DeepSeek, et GPT-6 Luna, le petit modèle d’OpenAI. L’écart avec Claude Opus 5.5 atteint 19 points. Le classement des modèles ouverts de QUELLE IA place en tête MiMo-V2.6-Pro, Kimi K3 et GLM-5.3, et son comparateur met Large 4 face à Kimi K3, GLM-5.3 et DeepSeek V4 Pro.
La comparaison se durcit quand on regarde la taille et la facture. Large 4 mobilise 1 000 milliards de paramètres, dont 52 milliards actifs, pour atteindre l’indice de DeepSeek V4.1 Flash, qui en compte 552 milliards dont 16 actifs. Au prix plein, 1,36 et 4,18 dollars (environ 1,20 et 3,70 € hors taxes) par million de jetons, il coûte autant par jeton que GLM-5.3 ou DeepSeek V4 Pro. Sa verbosité fait grimper le coût par tâche à 1,13 dollar (environ 1 €) selon Artificial Analysis, plus de huit fois celui de MiMo-V2.6-Pro (0,13 dollar), pourtant mieux noté. Même en promotion, la tâche revient à 0,57 dollar, le double de DeepSeek V4.1 Flash. Les modèles fermés américains restent bien plus chers, 5,98 dollars pour Opus 5.5, et le classement qualité-prix permet de situer tout ce monde.

Où se trouve le vrai potentiel
Large 4 a du sens pour les cabinets et les éditeurs de logiciels juridiques, qui obtiennent un modèle de premier rang qu’ils pourront héberger chez eux une fois les poids publiés, à condition de disposer d’un serveur à la hauteur.
Il en a pour les équipes de cybersécurité, à qui un modèle acceptant de reproduire une faille rend plus service qu’un meilleur score général. Il en a enfin pour les entreprises et administrations qui veulent une IA servie de bout en bout en Europe et sous droit européen, ce que Mistral met en avant.
Pour piloter un agent autonome ou un assistant de code, les mesures actuelles orientent ailleurs, comme le montrent les classements Agents et Code de QUELLE IA. On ne sait rien non plus de son niveau en français, alors que Medium 3.5 est 55e du classement dédié. Quant à le faire tourner chez soi, il faut l’oublier. Il réclame environ 690 Go de mémoire en quantification 4 bits, davantage que quatre DGX Spark reliées en grappe (448 Go utiles). Un serveur à huit GPU est le minimum réaliste, là où Medium 3.5 tient sur une seule carte de 96 Go, et le guide des machines pour l’IA locale donne l’ordre de grandeur.

Mais ce n’est pas un avis définitif. L’entraînement par renforcement est encore en cours, et Mistral dit ne voir aucun signe de saturation. Tout peut donc s’améliorer.
Les scores d’aujourd’hui sont ceux d’une préversion, et l’usage d’outils sur de longues tâches fait partie de ce que cette phase est censée travailler.
Large 4 doit aussi servir de base à une génération de modèles spécialisés, ce qui colle avec ses points forts en droit et en cyber. Trois inconnues décideront de la suite, à savoir la licence, la date réelle des poids et le prix une fois la promotion terminée. On suivra ça sur la page Mistral de QUELLE IA.
Donc, oui, l’annonce survend Large 4, surtout en agent et en code, où le modèle reste loin des meilleurs modèles chinois et américains. Mais toutes les annonces survivent à leur modèle. Large 4 reste le meilleur modèle jamais sorti d’Europe, avec deux spécialités, le droit et la cybersécurité, où il devance des concurrents facturés plusieurs fois son prix.
Le prochain rendez-vous de Mistral est fixé à la fin du mois, quand on saura sous quelle licence sortent les poids et ce que l’entraînement en cours aura ajouté.
Pour aller plus loin
GPT-6, Fable 5.1 : comment lire les benchmarks de Claude et GPT sans se faire avoir
Tous nos articles sont aussi sur notre profil Google : suivez-nous pour ne rien manquer !
Et le second meilleur moyen de nous donner un coup de pouce, c’est d’ajouter Frandroid à vos sources préférées sur Google.

Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.