Il fait tourner le plus grand modèle d’IA d’OpenAI en reliant six appareils, dont un Galaxy S24+

L'union fait la force

 
Un utilisateur de Reddit a fait tourner gpt-oss-120b, le plus gros modèle ouvert d’OpenAI, en le découpant entre six appareils, dont un Samsung Galaxy S24+. Le montage fonctionne, mais il ne génère que 1,1 token par seconde.

Aucun appareil de Medicine_Blogscanner n’a assez de mémoire pour charger seul gpt-oss-120b, le plus gros modèle d’IA ouvert d’OpenAI. Ce membre du forum Reddit r/LocalLLM, où l’on parle d’IA qui tourne sur son propre matériel, a donc découpé le modèle entre un Samsung Galaxy S24+, trois Mac et deux PC sous Windows. Son montage, repéré ce lundi 28 septembre par le site spécialisé Wccftech, fonctionne. Par contre, il ne sort que 1,1 token par seconde. Il faut donc une bonne vingtaine de secondes pour voir s’afficher une phrase d’une vingtaine de mots.

OpenAI a publié gpt-oss-120b le 5 août 2025, avec des poids librement téléchargeables. N’importe qui peut l’installer sur sa machine, à condition d’avoir assez de mémoire. Le modèle compte environ 117 milliards de paramètres, c’est-à-dire les réglages internes qu’il a appris pendant son entraînement.

D’après OpenAI, il tient dans 80 Go de mémoire, soit toute la mémoire d’une carte graphique pour data center. Medicine_Blogscanner a utilisé une version quantifiée en 4 bits : chaque paramètre y est stocké de façon plus compacte, au prix d’un peu de précision. Selon Wccftech, cette version demande quand même au moins 60 Go, contre 240 Go pour le modèle non compressé.

Six appareils qui travaillent à la chaîne

Pour y arriver, Medicine_Blogscanner a d’abord ramené l’empreinte mémoire du modèle à 47 Go. Wccftech ne précise pas comment. Il a ensuite utilisé un logiciel qui pratique le pipeline parallelism : le modèle est découpé par couches, et chaque appareil en garde une tranche.

Un mini PC surnommé « Tiny », équipé d’une carte graphique Nvidia RTX 3060 à 12 Go de mémoire, fait l’essentiel du travail. Il héberge à lui seul environ 28,7 Go du modèle, soit plus de la moitié. Le Galaxy S24+, un PC portable Windows doté de 12 Go de mémoire, un MacBook Pro à processeur Intel, un Mac mini et un MacBook Pro M3 se partagent le reste.

Sauf que chaque token doit traverser les appareils l’un après l’autre, via le réseau local, avant que le suivant puisse être calculé. Et la chaîne entière ne va jamais plus vite que son maillon le plus lent.

Un seul PC bien équipé va près de vingt fois plus vite

Wccftech affirme qu’aujourd’hui, il faut une machine avec 128 Go de mémoire unifiée, comme un MacBook Pro haut de gamme, pour faire tourner gpt-oss-120b. C’est exagéré.

Ça fonctionne parce que gpt-oss-120b repose sur un « mélange d’experts » (mixture of experts) : pour chaque token, seuls 5,1 milliards de ses paramètres travaillent. Les parties peu sollicitées peuvent donc rester dans la mémoire vive, plus lente que celle de la carte graphique, sans trop ralentir l’ensemble.

Pour essayer chez soi sans mobiliser six appareils, OpenAI propose aussi gpt-oss-20b, une version plus petite qui se contente de 16 Go de mémoire selon l’entreprise.


Pour ne rater aucun bon plan, rejoignez notre nouveau channel WhatsApp Frandroid Bons Plans, garanti sans spam !

Recherche IA boostée par
Perplexity