27 milliards de paramètres dans 5,9 Go : l’IA chinoise géante qui tourne sur Mac et iPhone

27 milliards, 5,9 Go

 
La startup américaine PrismML a publié Ternary Bonsai 2 27B, un modèle d’IA de 27 milliards de paramètres qui tient dans 5,9 Go de mémoire. Soit de quoi le faire tenir dans un smartphone ou un simple ordinateur de bureau. La startup revendique 98,2 % des performances du modèle chinois d’origine utilisé pour l’occasion : Qwen3.8 27B.
Le papier blanc de PrismML sur un MacBook Pro M2 // Source : Vincent Sergère pour Frandroid

Un modèle d’IA de cette taille réclame d’habitude plusieurs dizaines de gigaoctets de mémoire, ce qui le réserve aux cartes graphiques professionnelles ou au cloud. PrismML annonce le faire tenir dans 5,9 Go, soit plus de neuf fois moins que Qwen3.8 27B, le modèle chinois open source d’Alibaba dont il dérive. En clair, ça rentre dans la mémoire vive d’un MacBook Air d’entrée de gamme ou d’un iPhone, sans acheter la moindre pièce.

Le tour de passe-passe s’appelle la compression ternaire. Pour les plus techniques d’entre vous, l’explication est la suivante : au lieu de coder chaque poids du réseau sur 16 bits, PrismML les ramène à trois valeurs seulement, −1, 0 ou +1, avec une mise à l’échelle en FP16. On tombe à 1,76 bit par poids en moyenne.

Le modèle garde sa fenêtre de contexte de 262 000 tokens et reste multimodal, capable de lire aussi bien du texte que des images. Autrement dit, les capacités du modèle complet restent là.

Sur une batterie de tests maison couvrant le raisonnement, le code, les maths, le suivi d’instructions et la vision, PrismML attribue à son modèle un score agrégé de 83,9, contre 85,4 pour Qwen3.8 27B en pleine précision. Soit 98,2 % des performances conservées du modèle d’origine.

La compression ternaire franchit un cap

La compression ternaire n’a rien de neuf. Microsoft l’utilise déjà avec BitNet b1.58, sur les mêmes valeurs −1, 0 et +1. PrismML met surtout en avant le niveau de perte. Sa première génération, Bonsai 27B sortie en juillet 2026, ne conservait que 95 % des performances. Deux mois plus tard, la barre passe à plus de 98 %. À ce stade, deux points d’écart ne se repèrent a priori quasiment plus à l’usage, sauf à sortir un benchmark spécialisé.

La différence de performances entre Bonsai 2 et Qwen3.8 (en %)

Ce que ça change pour votre Mac ou votre iPhone

Le modèle tourne sur GPU NVIDIA via CUDA et sur les appareils Apple via MLX, ce qui couvre le Mac, l’iPhone et l’iPad. PrismML n’en est pas à son coup d’essai sur ce terrain : on vous a déjà montré comment la startup fait tenir une IA de 27 milliards de paramètres dans un iPhone, une prouesse que d’autres modèles de cette taille commencent à réussir en local.

Le modèle est gratuit et ouvert. PrismML publie les poids de Ternary Bonsai 2 27B sous licence Apache 2.0, téléchargeables sur Hugging Face, avec un usage commercial autorisé.

L’intelligence de chaque modèle ramené à son poids total

Côté vitesse, PrismML annonce jusqu’à 143 tokens par seconde sur une RTX 5090 et 46,8 tokens par seconde sur une puce M5 Max. Sur une RTX 4090, le modèle consommerait 0,714 mWh par token, soit 40 % de moins qu’un modèle 8B en pleine précision.

Pour tester l’IA locale sans le budget d’un PC de gamer, l’argument tient dans un chiffre : 5,9 Go rentrent dans la mémoire vive d’un MacBook Air comme d’un Mac équipé d’un M5 Max. Face aux références locales du moment, Mistral 7B ou Llama 3.1 8B, on parle d’un modèle bien plus gros, à 27 milliards de paramètres.

Avant de vous équiper, gardez en tête qu’acheter un Mac mini M6 juste pour l’IA locale n’est pas toujours une bonne idée, et qu’un Mac ne remplace pas si facilement un abonnement Claude ou Codex. Pour savoir ce que votre machine encaisse, un site répond en un clic. Et l’IA locale ne se cantonne plus au haut de gamme : elle gagne les smartphones plus abordables et se pilote même à distance depuis un iPhone.

PrismML peut-il exister face aux géants ?

Derrière le modèle, une jeune pousse née d’une équipe de chercheurs de Caltech et dirigée par Babak Hassibi, professeur à Caltech et spécialiste de la compression.

La société a levé 22,25 millions de dollars (environ 19 millions d’euros) en amorçage, avec Khosla Ventures, Cerberus Capital et Caltech au capital, et compte parmi ses conseillers Ion Stoica, cofondateur de Databricks. Selon TechCrunch, son premier modèle a déjà été téléchargé plus de 11 millions de fois, et la startup serait en discussion avec Apple, ce que Hassibi n’a pas voulu confirmer.

Le terrain est déjà encombré, entre BitNet de Microsoft, Gemma 3 de Google et les Mistral Small, tous à la recherche du meilleur rapport puissance-empreinte. Hassibi annonce viser des modèles de plusieurs centaines de milliards de paramètres dans les mois qui viennent.


Retrouvez un résumé du meilleur de l’actu tech tous les matins sur WhatsApp, c’est notre nouveau canal de discussion Frandroid que vous pouvez rejoindre dès maintenant !

Recherche IA boostée par
Perplexity