
Quatre ordinateurs, une IA locale contenue dans un fichier de 5,95 Go, et quatre vitesses qui n’ont rien à voir. Sur le mini PC Intel, les mots tombent péniblement à 1,75 token par seconde ; le Mac mini M6 en produit 18,1 dans le même temps quand la RTX 4070 Ti SUPER d’un PC de joueur crache le texte à près de 69 tokens par seconde.
Le modèle tient pourtant sans forcer dans la mémoire des quatre machines, ce qui pose une question toute bête : si chacun peut le charger, pourquoi de tels écarts ?
Ce fichier est Bonsai 2 27B, une version compressée du modèle Qwen3.8-27B d’Alibaba. La base est donc chinoise, mais la compression vient d’une jeune pousse américaine, Prism ML, née de travaux menés à Caltech. On vous présentait déjà cette IA géante qui tient dans 5,9 Go. Cette fois, on l’a mise à l’épreuve sur du vrai matériel pour comparer les performances et voir ce que ça peut donner sur un « vrai » ordinateur du quotidien.

Bonsai 2 27B a été mis en ligne le 17 septembre 2026, sous licence Apache 2.0 : les poids sont librement téléchargeables sur Hugging Face, gratuitement. Un détail à connaître avant de se lancer, en revanche : le format ternaire exige le runtime maison de Prism ML. En clair, on récupère le modèle sans débourser un euro, mais on ne le lance pas encore d’un simple clic dans un LM Studio ou un Ollama standard.
Faire tenir 27 milliards de paramètres dans 5,95 Go
Un modèle d’IA est avant tout une gigantesque collection de nombres, les poids, qui encodent ce qu’il a appris. Dans sa version classique en FP16, Qwen3.8-27B garde chacun de ses 27 milliards de poids sur 16 bits, ce qui donne un fichier d’environ 54 Go. Impossible à faire tenir dans la VRAM de 16 Go d’une carte graphique de joueur comme la RTX 4070 Ti SUPER de Nvidia du PC de votre serviteur.
Mais Prism ML fait dans le radical : chaque poids est ramené à trois valeurs possibles, −1, 0 ou +1. On appelle ça une représentation ternaire, obtenue par quantification post-entraînement, un format baptisé PTQ1_0. On tombe alors à 1,75 bit par poids en moyenne dans le fichier testé, pour un GGUF de 5,95 Go. À titre de comparaison, la quantification Q4 classique que nous avons utilisée en face pour nos tests de performances plus bas pèse encore 17,1 Go, soit un peu plus de 5 bits par poids.

Autant le dire tout de suite : un modèle de 17 Go ne peut pas tenir entièrement dans une carte graphique qui n’a que 16 Go de VRAM. Alors quand ce modèle ne pèse plus que 6 Go, la manipulation devient tout de suite beaucoup plus envisageable.
Côté matériel, on a réuni trois machines très différentes : le mini PC Intel (un GMKtec EVO-T2S à processeur Core Ultra et puce graphique Arc, 64 Go de mémoire partagée), le Mac mini M6 24 Go et sa mémoire unifiée, et un PC de joueur à base de RTX 4070 Ti SUPER avec 16 Go de VRAM. Détail qui compte : le Mac et le mini PC Intel partagent tous les deux leur mémoire entre processeur et puce graphique.

On a ajouté un quatrième larron, un mini PC AMD à base de Ryzen AI Max+ 395, pour servir de test de contrôle : le GMKtec EVO-X3. Ici aussi, la RAM soudée (128 Go) est partagée entre le CPU et le GPU. De quoi réserver ici 64 Go à la puce graphique pour y charger les modèles d’IA (GMKtec autorise jusqu’à 96 Go).
Le protocole tient en quelques lignes. Même version du runtime de Prism ML sur les quatre machines, même fichier Bonsai de 5,95 Go, même fichier Qwen3.8 en Q4 pour la comparaison. On mesure le débit de génération à chaud avec l’outil llama-bench, un prompt de 512 tokens puis une génération de 128 tokens, cinq répétitions.
Un passage réel séparé, sur un problème de probabilités, a donné la bonne réponse partout : de quoi vérifier qu’aucune machine ne délire, mais pas de quoi juger la qualité générale du modèle.
Le résultat qui inverse le classement
Voici les débits de génération à chaud, en tokens par seconde, moyenne de cinq passages. Le tableau montre quatre machines mais cinq chemins d’exécution, puisque le mini PC AMD est mesuré deux fois, une fois sous Vulkan et une fois sous ROCm.

Deux choses sautent aux yeux. D’abord, la RTX écrase tout : 39,3 fois plus rapide que l’Arc d’Intel sur Bonsai, et 3,8 fois plus rapide que le Mac.
Attention tout de même, ce ×39,3 mesure uniquement un écart de débit de génération, dans ce test précis, avec ce format de poids et ce backend.
Ensuite, le classement des formats change selon la machine : Bonsai bat le Q4 classique sous CUDA (le backend de Nvidia) et sous Metal (celui d’Apple), mais le Q4 reprend l’avantage sur l’Intel en Vulkan. Le mini PC AMD va éclairer tout ça, on y revient.
Pour situer ces mesures, Prism ML annonce jusqu’à 143 tokens par seconde sur une RTX 5090 et 46,8 sur une puce M5 Max. Nos 69 tokens par seconde sur la RTX 4070 Ti SUPER et 18 sur le Mac mini M6 restent logiquement en dessous, sur du matériel nettement plus modeste.
Vulkan, Metal, CUDA, ROCm : ce sont des backends, autrement dit les couches logicielles qui font parler le programme et la puce graphique. Vulkan est une API graphique pensée au départ pour les jeux, qu’on retrouve un peu partout, jusque dans Minecraft qui vient d’y basculer. Encore faut-il qu’elle dispose des bons kernels, ces petits programmes optimisés, pour un format de poids donné. Le format ternaire coince justement sur ce point.
Le piège de la RTX : lui retirer du travail l’accélère
Le cas le plus contre-intuitif vient justement de la RTX. Le Q4 pèse 17,1 Go alors que la carte n’a que 16 Go de VRAM : il ne peut pas y tenir en entier. Le runtime annonçait pourtant 66 couches sur 66 envoyées au GPU, et le test se terminait normalement, à 11,0 tokens par seconde. Son propre journal racontait une autre histoire : plus un mégaoctet libre sur la carte, et 682 Mo de poids restés côté mémoire système. Dit autrement, la VRAM était saturée et une partie du modèle attendait en RAM (beaucoup plus lente), ce qui étouffait la carte.

En tâtonnant, le meilleur réglage trouvé a été de confier trois couches sur 66 au processeur, qui les calcule depuis la mémoire du PC (32 Go de DDR5), au lieu que la carte graphique doive aller les y chercher à chaque mot. Le débit grimpe alors à 17,3 tokens par seconde, soit 57 % de mieux.
On enlève du travail à la carte graphique (en faisant travailler le processeur à la place), et elle va plus vite, tout simplement parce qu’on lui rend un peu de marge mémoire.
Avec une carte dotée de plus de VRAM (24 Go pour la RTX 4090, 32 Go pour la RTX 5090), le Q4 aurait tenu entièrement sur le GPU, sans passer par le processeur, et le débit aurait été nettement plus élevé.
Sur le même PC, un réglage logiciel qui change tout
Le mini PC AMD permet de prendre du recul sur toute la démonstration. On y a lancé deux fois les mêmes tests, avec les mêmes fichiers et les mêmes réglages : seul le backend change. Vulkan d’un côté, ROCm de l’autre. Bonsai passe alors de 3,95 à 21,57 tokens par seconde, soit 5,45 fois plus vite, sans toucher à un seul composant.
Dans le même temps, le Q4 (Qwen3.8 en quantification 4 bits classique) ne bouge quasiment pas, de 12,67 à 12,45. Le classement s’inverse donc sur place : sous Vulkan, le Q4 va 3,2 fois plus vite que Bonsai. Sous ROCm, c’est Bonsai qui passe devant, 1,73 fois plus rapide.

Dit autrement : en changeant « simplement » un élément logiciel, on multiplie le débit de Bonsai par plus de cinq. Attention à ne pas en conclure que ROCm bat Vulkan en toutes circonstances. Ulrich constate l’inverse avec un autre modèle, Gemma 4 de Google, plus rapide chez lui sous Vulkan.
La vraie leçon reste que la vitesse dépend des kernels disponibles pour un format précis, autant que de la quantité de mémoire ou de la puissance brute de la puce. La couverture de Vulkan a toujours été inégale, et le chemin ternaire n’y est visiblement pas encore le mieux optimisé.
Une précision qui a son importance : nos essais ne disent rien de la qualité de Bonsai. On a lancé un seul problème de raisonnement, réussi partout, ce qui ne suffit pas à évaluer un modèle. Les chiffres de qualité viennent de Prism ML.
La startup revendique une moyenne de 84,78 sur 14 benchmarks en mode raisonnement, contre 86,32 pour la version FP16 complète, soit 98,2 % des performances d’origine conservées, même si un premier test en conditions réelles publié par MindStudio se montre moins flatteur : le modèle y rate un bug volontairement caché dans une application et tourne en boucle sur une traduction en tamoul. Dit autrement, on perd un peu en capacité de raisonnement, en passant de Qwen 3.8 à Bonsai 2.
Quelle machine est la meilleure pour l’IA locale ?
Alors, quelle machine pour de l’IA locale ? Il n’y a pas de vainqueur universel, et c’est bien l’intérêt de la manipulation. La RTX 4070 Ti SUPER est de très loin la plus réactive avec Bonsai, qui tient à l’aise dans ses 16 Go, mais elle se fait piéger dès que le modèle déborde un peu de sa mémoire, comme Qwen3.8 en Q4.
Le Mac mini M6 24 Go offre un compromis silencieux et cohérent à 18 tokens par seconde, tout en restant nettement derrière la RTX. On a d’ailleurs déjà expliqué pourquoi acheter un Mac mini M6 pour l’IA locale est souvent une mauvaise idée, et posé la question de savoir si un Mac peut remplacer un abonnement Claude ou Codex.
Le mini PC AMD (à 3 499 euros), avec ses 128 Go de mémoire unifiée (dont 64 Go réservés ici à la puce graphique), avale les gros modèles sans broncher et grimpe de 3,95 à 21,57 tokens par seconde sur Bonsai une fois passé sous ROCm. Le mini PC Intel (autour de 1 800 euros) reste le plus lent des quatre pour cet usage, quand le Mac mini testé, à 1 269 euros au moment d’écrire ces lignes, allait dix fois plus vite sur Bonsai.

Parmi les trois machines compactes du test, le Mac mini offre le meilleur rapport qualité-prix pour faire tourner des modèles d’IA en local, à condition d’éviter la version 16 Go, trop juste : sur notre version 24 Go, il ne restait déjà plus beaucoup de mémoire libre. Or il faut en garder pour le contexte (votre conversation avec l’IA), qui peut vite occuper beaucoup de place.
Lancer une IA en local sur un simple prompt ne dit pas tout de l’usage au quotidien : avec des prompts complexes et de nombreux allers-retours, le contexte grossit, et avec lui la mémoire occupée.
Ce test montre également le poids du logiciel : changer un simple backend a multiplié le débit de Bonsai par 5,45 sur une seule machine. Une prochaine optimisation Vulkan pourrait rebattre les cartes, car ces chiffres sont une photo des couples modèle-format-backend au jour du test.
Prism ML n’en est pas à son coup d’essai. La startup avait déjà fait parler d’elle en casant un modèle de 54 Go dans un iPhone, un exploit à 27 milliards de paramètres sans passer par le cloud. Cette course à la compression touche d’ailleurs tout le secteur, jusqu’aux téléphones : l’IA locale débarque même sur les smartphones pas chers grâce à Qualcomm. Avant de se lancer, on peut vérifier quelle IA tourne sur sa machine avec un petit outil en ligne.
Si vous voulez recevoir les meilleures actus Frandroid sur WhatsApp, rejoignez cette discussion.

Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.