
Mercredi, un modèle chinois de 320 milliards de paramètres a changé de nom. Ox Alpha, apparu anonymement sur OpenRouter le 20 août et devenu en six jours le modèle le plus utilisé de la plateforme, il s’appelait en réalité GLM-5.3-Flash. Z.ai a publié ses poids sous licence MIT dans la foulée, il est donc téléchargeable, et des conversions pour Apple Silicon circulaient le soir même.
Au même moment, le configurateur du nouveau Mac Studio affichait fièrement 256 Go de mémoire. On a fait le rapprochement, comme tout le monde. Puis on s’est demandé ce que ça voulait dire, concrètement, pour quelqu’un qui hésite entre un abonnement à 23 € par mois et une machine à plusieurs milliers d’euros.
Il faut se souvenir d’où l’on vient. Il y a deux ans, faire tourner un modèle de langage chez soi relevait du bricolage de développeur, avec une carte Nvidia, un terminal et beaucoup de patience. Même les modèles Llama de Meta étaient loin d’égaler ce que Anthropic, Google ou OpenAI proposaient.
Depuis, les modèles « open weights », dont on peut télécharger les poids, ont explosé en qualité. DeepSeek, Qwen, GLM ou Kimi se disputent aujourd’hui les benchmarks avec les modèles fermés d’OpenAI et d’Anthropic, et un Mac mini M4 à 699 € suffisait à en faire tourner les petites versions. Du côté américain, il y a Gemma 4 chez Google et GPT-OSS chez OpenAI.
Le succès a été tel que ces mini PC se sont retrouvés en rupture au printemps, portés par la mode des agents IA domestiques. Apple a regardé tout ça, puis a monté les prix. La crise de la mémoire vive n’a forcément pas aidé.
Le M6 démarre 350 € plus cher que son prédécesseur, et le Mac Studio 512 Go, retiré du catalogue en mars faute de puces mémoire, revient fin octobre avec le statut de produit vitrine.

Le 25 août, Apple a donc annoncé un Mac mini M6 à 1 049 € avec 16 Go de mémoire, configurable jusqu’à 32 Go, et un Mac mini M5 Pro dès 1 999 € qui monte à 64 Go.
Le Mac Studio M5 Max démarre à 2 999 € avec 36 Go, grimpe à 128 Go et offre 614 Go/s de bande passante mémoire. Le M5 Ultra commence à 6 599 € avec 96 Go, passe à 12 429 € en 256 Go et atteindra 512 Go à un tarif qu’Apple n’a pas encore publié.
Ces chiffres ne sont pas là pour décorer : la firme écrit noir sur blanc que le M5 Ultra exécute des modèles « de classe frontière » sur l’appareil.
Dans le jargon du secteur, un modèle frontière désigne ce qui se fait de mieux à un instant donné, la catégorie de GPT-5.x, de Claude Fable 5 ou de Gemini. Apple ne parle évidemment pas de ceux-là, dont les poids ne sont pas téléchargeables, mais des modèles ouverts qui s’en approchent, comme GLM-5.3-Flash ou DeepSeek V4.
Pour la première fois, la quantité de mémoire unifiée est un argument de vente au même titre que les cœurs GPU, et le vrai sujet de cette rentrée, c’est l’IA locale.
Côté agenda, les précommandes sont ouvertes depuis le 25 août et les livraisons démarrent le 22 septembre pour la quasi-totalité des configurations. Seule la version 512 Go du Mac Studio se fait attendre jusqu’à fin octobre.


L’IA générative crée du contenu en quelques secondes, mais souvent au prix de vos données personnelles. Avec Lumo AI, l’assistant européen de Proton, vos conversations restent 100 % confidentielles.
| Machine | Mémoire | Bande passante | GPU | Prix France |
|---|---|---|---|---|
| Mac mini M6 | 16 Go | 153 Go/s | 12 cœurs | 1 049 € |
| Mac mini M6 | 24 à 32 Go | 170 Go/s | 12 cœurs | dès 1 269 € |
| Mac mini M5 Pro | 24 à 64 Go | 307 Go/s | 16 à 20 cœurs | dès 1 999 € |
| Mac Studio M5 Max | 36 à 128 Go | 614 Go/s | 32 à 40 cœurs | dès 2 999 € |
| Mac Studio M5 Ultra | 96 à 512 Go | 1,2 To/s | 64 à 80 cœurs | dès 6 599 € (12 429 € en 256 Go) |
La règle de base : la mémoire décide, la bande passante accélère
Un modèle de langage est un énorme paquet de nombres, les « poids », que l’ordinateur doit garder entièrement en mémoire pendant qu’il génère du texte. Si le paquet ne rentre pas, rien ne se passe, ou alors tout se passe à une vitesse de tortue. Première conséquence : la mémoire disponible détermine quels modèles on peut charger. Deuxième conséquence, moins connue : pour produire chaque mot, le processeur relit une grande partie de ces poids. La vitesse de lecture, la fameuse bande passante, fixe donc un plafond au nombre de mots par seconde. Plus de cœurs GPU ne permettent pas de charger un modèle plus gros, ils accélèrent ce qui tient déjà en mémoire.
C’est ici que l’architecture d’Apple se distingue d’un PC classique. Sur une carte Nvidia, le GPU dispose de sa propre mémoire vidéo, très rapide mais limitée : 32 Go sur une RTX 5090. Sur un Mac, le CPU et le GPU piochent dans la même mémoire unifiée, et celle-ci peut atteindre 128 Go sur le Studio M5 Max ou 512 Go sur le M5 Ultra. Un Mac est bien moins puissant qu’une grosse carte Nvidia sur le calcul brut, mais il peut charger des modèles qu’aucune carte grand public ne peut contenir. Cette particularité place les Mac dans une case à part face aux autres machines compactes, que l’on détaille dans notre guide des meilleurs mini PC pour l’IA locale.

Pour les experts, l’ordre de grandeur se calcule vite. Un modèle dense de 70 milliards de paramètres compressé en 4 bits pèse autour de 40 Go. Sur un Studio M5 Max à 614 Go/s, la génération plafonne théoriquement vers 15 tokens par seconde, en pratique plutôt 10 à 12 une fois comptés le cache et les pertes. Sur un Mac mini M6 à 170 Go/s, un 14 milliards en 4 bits (8 Go) tourne au mieux à une vingtaine de tokens par seconde. Le petit modèle sur la petite machine va donc plus vite que le gros modèle sur la grosse, et c’est normal. À noter que la version 16 Go du Mac mini M6 se contente de 153 Go/s, les 170 Go/s annoncés étant réservés aux configurations 24 et 32 Go, facturées 220 € de plus.
Pour aller plus loin
Quels sont les meilleurs ordinateurs d’Apple en 2026 (MacBook et Mac de bureau) ?
Quantification, MoE, contexte : les trois mots qui changent tout
La quantification consiste à stocker chaque poids avec moins de précision, typiquement 4 bits au lieu de 16. Le modèle perd un peu de qualité, souvent imperceptible en 4 bits, très visible en 2 bits, et il divise son encombrement par quatre. Presque tout ce qui tourne sur Mac est quantifié. Il faut ensuite ajouter le contexte : chaque document ou conversation que l’on donne au modèle occupe de la mémoire supplémentaire, le « KV cache », qui grossit avec la longueur du texte. Un 70 milliards en 4 bits de 40 Go n’est donc pas un bon candidat pour une machine de 48 Go, il ne resterait rien pour macOS ni pour le contexte.
Les modèles de 2026 ajoutent une couche. GLM-5.3-Flash est un Mixture of Experts, un MoE : 320 milliards de paramètres stockés, mais seulement 18 milliards mobilisés pour chaque token. Il calcule comme un petit modèle et répond vite, sauf qu’il faut tout de même conserver les 320 milliards en mémoire. En 4 bits, comptez environ 170 Go. Qwen3.8-Flash-Next, publié le 26 août par Alibaba comme aperçu de l’architecture de Qwen4, pousse la logique plus loin : 125 milliards de paramètres, plus 51 milliards de paramètres dédiés à une table de vocabulaire (d’embeddings n-gram), et 6 milliards actifs seulement. DeepSeek V4 Flash fait 284 milliards pour 13 actifs, ses poids officiels pèsent 167 Go.
Et pour comprendre, retenez que les paramètres totaux dictent la mémoire, les paramètres actifs dictent la vitesse. Un MoE de 320 milliards avec 18 actifs, chargé sur 1,2 To/s, génère théoriquement plus de 100 tokens par seconde. La question n’est plus « est-ce que ça rentre ? » mais « est-ce que la réponse arrive assez vite pour être utilisable ? ».
Deux nuances qui sont rarement évoqués. La vitesse de génération ne dit rien du temps de lecture du prompt : un modèle qui écrit à 30 tokens par seconde mais met 40 secondes à digérer un rapport de 50 pages paraîtra lent, et c’est justement sur ce traitement de prompt qu’Apple base ses gains de 4x face au M3 Ultra. Ensuite, la question des runtimes. MLX est le framework d’Apple, le plus rapide sur ses puces, et LM Studio, llama.cpp ou Ollama viennent ensuite. Une architecture publiée un mercredi n’est pas forcément exploitable proprement dans chacun le jeudi : la recette officielle de Qwen3.8-Flash-Next, par exemple, repose sur une table de 51 milliards de paramètres qui sert de mémoire de vocabulaire, et l’astuce qui permet de la sortir de la mémoire GPU pour l’alléger ne fonctionne aujourd’hui que sur Nvidia.
Notre guide pour installer un ChatGPT en local détaille ces outils du niveau débutant au niveau expert.
Pour aller plus loin
Comment installer un modèle LLM type ChatGPT sur PC ou Mac en local ? Voici le guide ultime pour tous
16, 32, 128 ou 512 Go : ce n’est pas le même sport
Avec 16 Go, le Mac mini M6 fait tourner correctement des modèles de 7 à 14 milliards de paramètres. Ce n’est pas rien : transcription avec Whisper, résumé, traduction, classification de documents, petit assistant de code, recherche dans ses propres fichiers. Un modèle spécialisé de cette taille bat parfois un géant sur une tâche précise. Appeler ça une machine à « grands modèles de langage » mérite en revanche un astérisque. En 32 Go, on passe aux 27 à 32 milliards, la classe des Qwen3.8-27B, et l’expérience devient réellement intéressante pour quelqu’un qui veut apprendre sans dépenser plusieurs milliers d’euros. Le Mac mini M5 Pro en 64 Go ouvre la porte aux 70 milliards en 4 bits, mais au prix où il grimpe, le Studio M5 Max et ses 614 Go/s deviennent difficiles à ignorer.
Le Studio de base est presque le personnage comique de cette gamme : 32 cœurs GPU, une énorme bande passante, une machine vendue pour l’IA, et 36 Go de mémoire. Les modèles de 32 milliards y vont très vite, puis on bute sur le mur mémoire avant d’avoir profité de la puissance. À 128 Go, tout change, on charge un 70 milliards avec une quantification confortable, plusieurs modèles en même temps, ou un gros MoE compressé. Les modèles de plusieurs centaines de milliards de paramètres, eux, relèvent du M5 Ultra en 256 Go. Et certains poids ouverts restent hors d’atteinte quoi qu’il arrive.
| Modèle | Paramètres (totaux / actifs) | Poids en mémoire | Mac minimum réaliste |
|---|---|---|---|
| Modèle dense 8B (4 bits) | 8 Md / 8 Md | 4 à 5 Go | Mac mini M6 16 Go |
| Qwen3.8-27B (4 bits) | 27 Md / 27 Md | 15 à 17 Go | Mac mini M6 32 Go |
| Modèle dense 70B (4 bits) | 70 Md / 70 Md | 35 à 45 Go | Mac mini M5 Pro 64 Go, Studio 128 Go pour le confort |
| Qwen3.8-Flash-Next (2 bits) | 125 Md + 51 Md / 6 Md | environ 80 Go | Mac Studio M5 Max 128 Go |
| DeepSeek V4 Flash (poids officiels) | 284 Md / 13 Md | 167 Go | Mac Studio M5 Ultra 256 Go |
| GLM-5.3-Flash (4 bits) | 320 Md / 18 Md | environ 170 Go | Mac Studio M5 Ultra 256 Go |
| DeepSeek V4 Pro | 1,6 T / 49 Md | plusieurs centaines de Go | M5 Ultra 512 Go ou cluster |
| Kimi K3 | 2,8 T / 104 Md | 1,5 To | Hors de portée d’un seul Mac |
Si l’on veut charger un modèle ouvert vraiment « frontière », un seul Studio ne suffit plus, même en 512 Go.
Prenons les trois candidats sérieux du moment. GLM-5.2, le grand frère de GLM-5.3-Flash, pèse 744 milliards de paramètres, soit 370 à 400 Go en 4 bits : un Ultra 512 Go l’avale seul, à un prix qu’Apple n’a pas encore donné, ou deux Ultra 256 Go reliés en Thunderbolt 5 pour 24 858 €. DeepSeek V4 Pro, avec ses 1,6 billion de paramètres, réclame environ 800 Go une fois quantifié, donc deux machines 512 Go ou quatre en 256 Go, ces dernières revenant à 49 716 € avant même d’ajouter le stockage. Kimi K3 ferme la marche : 2,8 billions de paramètres et 1,5 To de poids dans son format natif, il faut compter quatre Ultra 512 Go pour le charger avec un peu de marge pour le contexte, et Moonshot recommande de son côté 64 accélérateurs pour le servir correctement.
À ce stade, on parle vraisemblablement de 60 000 à 80 000 € de Mac posés sur un bureau, pour des modèles qui répondront à quelques tokens par seconde puisque chaque mot doit traverser les liaisons Thunderbolt entre machines.
Apple promet jusqu’à trois fois plus de performances avec quatre Studio, mais ce chiffre mesure un gain de vitesse sur un modèle qui tenait déjà sur une seule machine, ce n’est pas la vitesse d’un géant réparti sur quatre. Autrement dit, le cluster de Mac permet de charger un modèle frontière ouvert, il ne le rend pas confortable. Et face à un abonnement Claude Max ou ChatGPT Pro à 180 euros par mois, 60 000 € de machines représentent 25 ans de mensualités, pour un modèle qui ne sera jamais Fable 5 ni GPT-5.x. Même l’API de DeepSeek V4 Pro, facturée moins d’un dollar le million de tokens, reste moins chère pendant des années.
Pour aller plus loin
Apple présente la puce M5 Ultra : un monstre de puissance taillé pour l’IA en local
Le stockage pose une question annexe. Avec des modèles de 80 à 170 Go pièce, le SSD de 512 Go du Studio de base disparaît en trois téléchargements, même s’il s’agit du premier SSD PCIe Gen 6 grand public. Un SSD externe Thunderbolt revient bien moins cher que les options Apple, puisque le modèle vit en mémoire une fois chargé et que le disque ne sert qu’au chargement initial. La vitesse du SSD interne compte surtout pour ce moment-là, quand on jongle entre plusieurs modèles dans la journée.
Pour aller plus loin
Quels sont les meilleurs disques durs externes (SSD, HDD) ?
Abonnement ou Mac Studio : la calculette
ChatGPT Plus coûte 23 € TTC par mois en France, Claude Pro environ 21 €. Face à ça, le Mac mini M6 s’amortit en 45 mois, le Studio M5 Max en 11 ans et l’Ultra de base en 24 ans. Et ce calcul est généreux : il ignore l’électricité, le SSD, la panne, et surtout le fait que le modèle local ne vaudra pas toujours celui de l’abonnement.
Pour l’énergie, la formule est simple, puissance moyenne multipliée par les heures d’usage, par 365, par le prix du kWh. Un Studio qui tire 200 W huit heures par jour à 0,20 €/kWh coûte 117 € par an. Ce n’est pas ça qui ruine l’équation, c’est le prix d’achat.
À 200 dollars par mois (environ 180 €), tarif de ChatGPT Pro ou de Claude Max, l’Ultra revient à 33 mois et le Studio M5 Max à 15. Ça commence à se discuter, sauf que ces formules ne louent pas seulement un modèle. Elles livrent une interface, la recherche Web, les outils, le traitement de fichiers, la mémoire, et chaque nouvelle version le jour de sa sortie. Le Mac livre du calcul, le reste est à installer et à maintenir. Le vrai match se joue avec l’API. Claude Fable 5 est facturé 10 dollars le million de tokens en entrée et 50 en sortie. Une application qui avale 100 millions de tokens en entrée et 20 millions en sortie chaque mois paie 2 000 dollars, soit 24 000 par an. Là, un Studio à 5 000 ou 12 000 € devient rationnel en quelques mois, à une condition qui change tout : qu’un modèle ouvert suffise à la tâche. GLM, Qwen ou DeepSeek atteignent les modèles propriétaires sur certains benchmarks, ce qui ne signifie pas qu’ils les égalent partout, ni sur le long contexte, ni sur la fiabilité, ni sur les outils.
| Achat | Prix | Équivalent 23 €/mois (ChatGPT Plus) | Équivalent 180 €/mois (Pro / Max) | Équivalent 2 000 $/mois d’API |
|---|---|---|---|---|
| Mac mini M6 16 Go | 1 049 € | 45 mois | 5 mois | 2 semaines |
| Mac Studio M5 Max 36 Go | 2 999 € | 11 ans | 15 mois | 1,5 mois |
| Mac Studio M5 Ultra 96 Go | 6 599 € | 24 ans | 33 mois | 3,5 mois |
| Mac Studio M5 Ultra 256 Go | 12 429 € | 45 ans | 62 mois | 6 mois |
| Quatre M5 Ultra 256 Go en cluster | 49 716 € | 180 ans | 21 ans | 2 ans |
Deux arguments échappent pourtant à la calculette. Le premier est la confidentialité : avec un modèle local, le contrat, le code non publié ou le dossier client passe de la mémoire au calcul puis à la réponse, sans quitter la machine. Cela ne sécurise pas tout le système, les journaux, les sauvegardes et les outils auxquels un agent accède restent à maîtriser, mais l’inférence reste physiquement chez soi. Le second est la liberté de modèle. Un Studio acheté cette semaine pour GLM-5.3-Flash pourra faire tourner le DeepSeek de novembre ou le Qwen4 de janvier sans débourser un centime. Le matériel vieillit, les poids qu’on peut y installer s’améliorent gratuitement, et la semaine qui vient de s’écouler en est une démonstration presque caricaturale.
Louer son Mac la nuit ? Un bonus, pas un plan de financement
L’idée circule : la machine travaille pour vous le jour, elle calcule pour d’autres la nuit et se rembourse toute seule. Des services existent. Darkbloom, un réseau de Mac lancé par Eigen Labs, est devenu fournisseur payant sur OpenRouter et annonce 120 à 200 dollars par mois (environ 110 à 185 €) pour un Mac inactif, sur un parc de 250 machines encore en alpha publique.

Common Compute fait tourner des tâches IA en arrière-plan avec paiement via Stripe, mais réserve l’inscription aux comptes américains. Acorn, en alpha, ne propose que de la transcription et reconnaît sur sa propre page manquer de travail. Les revenus dépendent de la demande, de l’éligibilité matérielle et de conditions qui changent chaque mois. Si le Studio coûte 6 599 €, le projet doit tenir debout sans ce revenu. Tout ce qui tombe ensuite est un bonus.
Pour aller plus loin
Quel mini PC choisir pour l’IA ? Notre sélection 2026
Quatre profils se dégagent. Le curieux ou le développeur prend un Mac mini M6 en 24 ou 32 Go, jamais en 16, et compare d’abord avec les alternatives de notre comparatif de mini PC pour l’IA, qui coûtent parfois moitié moins pour la même mémoire. Le passionné avec un vrai projet vise le Studio M5 Max en 128 Go. Le M5 Ultra en 256 ou 512 Go se justifie quand les données ne doivent jamais sortir du bâtiment, quand la facture API dépasse le millier d’euros mensuel, ou quand on fait de la recherche. Le cluster, lui, est une infrastructure, pas un achat personnel. Et pour ceux qui veulent simplement apprendre, le guide complet d’installation fonctionne aussi sur le Mac mini M4 de l’an dernier, qui coûtait 350 € de moins.
Faut-il attendre mieux ? Apple ne prévoit ni M6 Pro ni M6 Max et passerait directement au M7, attendu autour de mi-2027. Ces Mac mini M6 et Mac Studio M5 Ultra devraient donc rester le haut de gamme Apple pour l’IA locale pendant un bon moment.
Le Mac Studio 512 Go est une machine remarquable pour exécuter des modèles ouverts, et l’histoire de GLM-5.3-Flash montre pourquoi une grosse mémoire locale prend de la valeur avec le temps.
Il ne fera jamais tourner GPT-5.x ni Claude Fable 5, dont les poids ne sont pas publics, quel que soit le prix payé.
Avec la puce M6 comme avec l’Ultra, Apple vend un outil, mais ce n’est pas un subsitut. À 23 € par mois, le cloud gagne presque toujours. À 180 euros par mois, un Studio 128 Go commence à se défendre, si le modèle ouvert fait le travail. À plusieurs milliers d’euros de tokens mensuels, ou avec des données interdites de sortie, le Mac raconte enfin une autre histoire. Le reste, c’est de la passion, et la passion coûte 12 429 €.
Pour aller plus loin
ChatGPT Work ou Claude Cowork : lequel choisir pour automatiser son travail en 2026 ?
Tous nos articles sont aussi sur notre profil Google : suivez-nous pour ne rien manquer !


Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.