
Aucun appareil de Medicine_Blogscanner n’a assez de mémoire pour charger seul gpt-oss-120b, le plus gros modèle d’IA ouvert d’OpenAI. Ce membre du forum Reddit r/LocalLLM, où l’on parle d’IA qui tourne sur son propre matériel, a donc découpé le modèle entre un Samsung Galaxy S24+, trois Mac et deux PC sous Windows. Son montage, repéré ce lundi 28 septembre par le site spécialisé Wccftech, fonctionne. Par contre, il ne sort que 1,1 token par seconde. Il faut donc une bonne vingtaine de secondes pour voir s’afficher une phrase d’une vingtaine de mots.
OpenAI a publié gpt-oss-120b le 5 août 2025, avec des poids librement téléchargeables. N’importe qui peut l’installer sur sa machine, à condition d’avoir assez de mémoire. Le modèle compte environ 117 milliards de paramètres, c’est-à-dire les réglages internes qu’il a appris pendant son entraînement.
D’après OpenAI, il tient dans 80 Go de mémoire, soit toute la mémoire d’une carte graphique pour data center. Medicine_Blogscanner a utilisé une version quantifiée en 4 bits : chaque paramètre y est stocké de façon plus compacte, au prix d’un peu de précision. Selon Wccftech, cette version demande quand même au moins 60 Go, contre 240 Go pour le modèle non compressé.
Six appareils qui travaillent à la chaîne
Pour y arriver, Medicine_Blogscanner a d’abord ramené l’empreinte mémoire du modèle à 47 Go. Wccftech ne précise pas comment. Il a ensuite utilisé un logiciel qui pratique le pipeline parallelism : le modèle est découpé par couches, et chaque appareil en garde une tranche.
Un mini PC surnommé « Tiny », équipé d’une carte graphique Nvidia RTX 3060 à 12 Go de mémoire, fait l’essentiel du travail. Il héberge à lui seul environ 28,7 Go du modèle, soit plus de la moitié. Le Galaxy S24+, un PC portable Windows doté de 12 Go de mémoire, un MacBook Pro à processeur Intel, un Mac mini et un MacBook Pro M3 se partagent le reste.

Sauf que chaque token doit traverser les appareils l’un après l’autre, via le réseau local, avant que le suivant puisse être calculé. Et la chaîne entière ne va jamais plus vite que son maillon le plus lent.
Un seul PC bien équipé va près de vingt fois plus vite
Wccftech affirme qu’aujourd’hui, il faut une machine avec 128 Go de mémoire unifiée, comme un MacBook Pro haut de gamme, pour faire tourner gpt-oss-120b. C’est exagéré.
Ça fonctionne parce que gpt-oss-120b repose sur un « mélange d’experts » (mixture of experts) : pour chaque token, seuls 5,1 milliards de ses paramètres travaillent. Les parties peu sollicitées peuvent donc rester dans la mémoire vive, plus lente que celle de la carte graphique, sans trop ralentir l’ensemble.
Pour essayer chez soi sans mobiliser six appareils, OpenAI propose aussi gpt-oss-20b, une version plus petite qui se contente de 16 Go de mémoire selon l’entreprise.
Pour ne rater aucun bon plan, rejoignez notre nouveau channel WhatsApp Frandroid Bons Plans, garanti sans spam !

Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.