
De par leur conception, les LLM, les systèmes d’IA qui alimentent les chatbots comme ChatGPT ou Gemini, sont mauvais en raisonnement, et par extension en mathĂ©matiques. Pourtant, ils deviennent meilleurs : et s’ils trichaient ?
Pour aller plus loin
C’est quoi un LLM ? Comment fonctionnent les moteurs de ChatGPT, Gemini et autres ?
Des IA de plus en plus impressionnantes en mathématiques, vraiment ?
C’est un article de recherche rĂ©digĂ© par des chercheurs de Scale AI qui explique le stratagème des LLM pour les tests de rĂ©fĂ©rence en mathĂ©matiques. Ils ne seraient aussi bons en maths que ce que les scores de ces tests montrent. Pour comprendre cela, il faut comprendre la conception des LLM.
Ce sont des systèmes linguistiques et statistiques : ils ne comprennent pas rĂ©ellement les mots qu’on leur soumet. Et lors de la gĂ©nĂ©ration, ils prĂ©disent la probabilitĂ© qu’un mot en suive un autre. Et c’est grâce aux Ă©normes quantitĂ©s de donnĂ©es qu’ils ont ingurgitĂ©es avant que le rĂ©sultat paraĂ®t très humain et que leur syntaxe est bonne.

Ce que dĂ©montrent les chercheurs, c’est que des donnĂ©es qui ressemblent aux questions de rĂ©fĂ©rence peuvent ĂŞtre intĂ©grĂ©es dans les entraĂ®nements des LLM. Ce qui pourrait permettre Ă ces derniers de s’entraĂ®ner sur ces mĂŞmes questions.
De quoi artificiellement augmenter la rĂ©ussite des tests, et non d’interprĂ©ter correctement les questions qui leur sont posĂ©es. En bref, c’est comme si vous aviez un examen dont vous appreniez par cĹ“ur les rĂ©ponses au lieu d’apprendre comment en rĂ©soudre les problèmes. Les chercheurs nomment ce phĂ©nomène le « surajustement ».
Une triche aux conséquences très limitées
En rĂ©alitĂ©, les chercheurs qui ont menĂ© cette Ă©tude l’affirment : la thĂ©orie n’est pas confirmĂ©e par leurs conclusions. Le fait que ces IA puissent s’entraĂ®ner Ă l’avance ne signifie pas obligatoirement qu’elles sont mauvaises en raisonnement. Simplement, elles sont un peu moins bonnes que ce que laissent entendre les tests de rĂ©fĂ©rence.
Les modèles suradaptĂ©s peuvent encore raisonner et rĂ©soudre des problèmes, mĂŞme s’ils ne les ont jamais rencontrĂ©s au cours de leur entraĂ®nement.

Pour confirmer cela, ces chercheurs ont mis au point leur propre test de rĂ©fĂ©rence en mathĂ©matique (baptisĂ© GSM1k). L’idĂ©e avec celui-ci, c’est de forcer les IA Ă interprĂ©ter un problème et pas uniquement la rĂ©ponse. Le niveau reste peu Ă©levĂ© : des problèmes pour des enfants. L’Ă©quipe de recherche de Scale AI a ainsi dĂ©montrĂ© des baisses de prĂ©cision jusqu’Ă 13% pour les LLM testĂ©s.
Un « problème » qui pourrait bientĂ´t disparaĂ®tre : avec les progrès en raisonnement de tous les systèmes, les problèmes mathĂ©matiques de primaire ne seront peut-ĂŞtre plus assez ardus pour les IA. D’autant plus que pour ces chercheurs, l’amĂ©lioration du raisonnement « est l’une des directions les plus importantes de la recherche actuelle ».
Téléchargez notre application Android et iOS ! Vous pourrez y lire nos articles, dossiers, et regarder nos dernières vidéos YouTube.

Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.