Microsoft défie Claude et GPT en local, mais réclame 75 Go de RAM avec son nouveau modèle MAI Code 1.1 Flash

Le code sans cloud

 
Microsoft a présenté une version locale de MAI-Code-1.1-Flash, son modèle d’IA pour coder ultra-abordable et rapide. Elle arrive d’ici fin octobre dans GitHub Copilot, sur les PC à puce Nvidia RTX Spark. Un concurrent de Claude Haiku 5.5 tout juste sorti, ou de GPT-6 Luna.
MAI Code 1.1. Flash

Microsoft a présenté ce mercredi 7 octobre, dans un billet publié sur son blog technique Command Line, une version de MAI-Code-1.1-Flash qui tourne directement sur un PC Windows, sans passer par ses serveurs, de manière gratuite. Ce modèle d’IA spécialisé dans le code est arrivé cet été dans GitHub Copilot.

En local, les calculs se font sur la machine, et Microsoft explique ainsi qu’ils ne seront pas facturés. Il faut surtout loger 53 Go de modèle en mémoire, et Microsoft recommande plus de 120 Go de mémoire vive sur la puce vidéo pour de bonnes performances. Pour l’instant, ça réserve l’expérience à des machines comme le Surface Laptop Ultra, dans sa version à 128 Go de mémoire unifiée (la configuration d’entrée n’en a que 24 Go).

Benchmark entre MAI Code 1/1 Flash et GPT OSS 120B

Le modèle lui-même date du 11 août. Il vient de Microsoft AI, la division qui conçoit les modèles maison du groupe et qui leur a même rédigé un code de conduite en septembre. Cette division résumait alors sa promesse dans le titre de son annonce : un code de meilleure qualité, produit plus vite, pour un quart du prix de la première version présentée en juin.

GitHub Copilot est l’assistant de programmation de Microsoft, à ne pas confondre avec l’assistant Copilot grand public, qui sait lui aussi coder. Dans GitHub Copilot, MAI-Code-1.1-Flash coûte 0,20 dollar (environ 0,18 euro HT) par million de jetons en entrée et 1,20 dollar (environ 1,07 euro HT) en sortie, contre 0,75 et 4,50 dollars (environ 0,67 et 4,02 euros HT) pour la version précédente. Un jeton est un fragment de mot de quelques caractères, l’unité avec laquelle les IA lisent, écrivent et facturent.

Mais le plus intéressant, c’est que Microsoft propose désormais de faire tourner ce modèle sur un PC local, sans Internet, et sans payer les tokens utilisés puisque c’est la puissance du PC qui est utilisé.

Huit à dix fois moins cher que Claude Sonnet 5.5

Côté performances, Microsoft annonce 62,9 % de réussite sur Terminal-Bench 2.1. Ce test compte 89 tâches à accomplir dans un terminal, de l’entraînement d’un modèle à l’administration système. Sur le classement tenu par Vals AI, Claude Opus 5.5 atteint 87,6 % et GPT-6 Astra 87,3 %. GPT-5.6 Luna monte à 79 % et Claude Sonnet 5.5 à 83,1 %.

Les outils de mesure diffèrent d’un classement à l’autre, donc on parle d’un ordre de grandeur. Même avec cette réserve, le modèle de Microsoft reste nettement derrière, y compris face à GPT-5.6 Luna.

Vitesse de génération (token / seconde) selon la taille du prompt

Quand Microsoft se compare à un concurrent, il choisit GPT-OSS-120B, le modèle ouvert d’OpenAI, dans une version compressée par Unsloth, qui peut tourner sur des ordinateurs en local. Celui-ci obtient 32 % sur SWE-Bench Verified, un test de 500 vrais bugs à corriger, contre 72,6 % pour MAI-Code-1.1-Flash dans sa version cloud, et 70,8 % pour sa version locale.

137 milliards de paramètres dans un PC portable

Microsoft prépare plus largement l’exécution de gros modèles d’IA en local sur Windows, et MAI-Code-1.1-Flash s’y prête par sa conception. Il s’agit d’un mélange d’experts : sur 137 milliards de paramètres, les réglages internes du modèle, seuls 6,8 milliards travaillent à chaque étape. Microsoft l’a aussi quantifié, c’est-à-dire qu’il a stocké chaque paramètre avec moins de précision, environ 3,3 bits en moyenne. Le modèle ne pèse plus que 53 Go, 80 % de moins que la version cloud, et garde 70,8 % sur SWE-Bench Verified.

Sur Terminal-Bench 2.1, la version locale fait même mieux que celle du cloud, avec 66,3 % de réussite contre 62,9 %, d’après les mesures de Microsoft. Le groupe précise les avoir réalisées le 5 octobre sur un Surface Laptop Ultra, avec du décodage spéculatif : un petit modèle propose des suites de jetons que le gros modèle vérifie, pour répondre plus vite.

Par contre, la mémoire utilisée grimpe à 75,5 Go quand le modèle exploite sa fenêtre de contexte maximale de 256 000 jetons, c’est-à-dire la quantité de code qu’il garde en tête d’un coup.

Aux États-Unis, le Surface Laptop Ultra démarre à 2 599 dollars (environ 2 320 euros HT), mais avec 24 Go de mémoire unifiée, bien trop peu pour un modèle de 53 Go. La version à 64 Go, vendue 4 299 dollars (environ 3 840 euros HT), ne suffit pas pour le contexte maximal, et celle à 128 Go grimpe à 5 899 dollars (environ 5 270 euros HT).

D’ici la fin octobre, GitHub Copilot proposera en accès expérimental deux options dans son outil en ligne de commande, son application et l’éditeur VS Code. Avec le mode Auto, Copilot choisit seul entre le modèle local et le cloud. Les développeurs pourront aussi sélectionner le modèle local à la main.

Dans les deux cas, les commandes lancées par l’agent pourront tourner dans un bac à sable, une zone isolée qui limite son accès aux fichiers et au réseau, à condition d’activer l’option dans les réglages du projet ou avec la commande /sandbox.

La sélection manuelle ne se limite pas au modèle de Microsoft. GitHub Copilot pourra aussi se brancher sur un serveur local compatible avec l’API d’OpenAI et utiliser les modèles qu’il propose.

Si vous payez Claude Sonnet 5.5 au jeton pour coder, MAI-Code-1.1-Flash peut valoir un essai dans GitHub Copilot, où il est déjà disponible. Pour de petites tâches confiées par l’API, Claude Haiku 5.5 et GPT-6 Luna coûtent toutefois deux fois moins cher.

Sachez seulement qu’il est moins solide sur les tâches complexes. Sur le papier, la version locale tient la route, mais ces scores sortent des tests de Microsoft, menés le 5 octobre sur un Surface Laptop Ultra, avant toute mesure indépendante.

Elle visera d’abord les PC équipés de la puce Nvidia RTX Spark, comme le Surface Laptop Ultra, en précommande depuis ce mercredi 7 octobre et livré à partir du 16 octobre. Il est aussi possible de faire tourner le modèle sur d’autres configurations (comme des mini PC à base AMD ou encore les Mac Mini ou Mac Studio), du moment que la quantité de VRAM suive.


Si vous voulez recevoir les meilleures actus Frandroid sur WhatsApp, rejoignez cette discussion.

Pour nous soutenir gratuitement, dites simplement à Google d’ajouter Frandroid à vos sources préférées en cliquant ici.

Recherche IA boostée par
Perplexity