
En juin, à sa conférence Build, Microsoft avait présenté sept modèles d’IA maison pour moins dépendre d’OpenAI. La gamme s’agrandit encore. Dans un billet publié ce jeudi 1er octobre, sa division Microsoft AI a lancé MAI-Transcribe-2-Streaming, son premier modèle de transcription en streaming, c’est-à-dire qu’il écrit le texte pendant que la personne parle. Il fonctionne dans 60 langues et repère tout seul la langue parlée, même si elle change en cours de route.
Il arrive avec deux modèles de synthèse vocale, MAI-Voice-2.1 et sa version rapide MAI-Voice-2.1-Flash. Ensemble, ils servent à construire des agents vocaux, ces assistants qui écoutent, réfléchissent puis répondent à voix haute, au service client par exemple.
Du texte avant la fin de la phrase
Le modèle de transcription n’attend pas que l’on ait fini de parler. Il propose un premier jet un peu plus de 100 millisecondes après avoir reçu le son, puis il le corrige au fil de la phrase. Un agent vocal peut donc commencer à préparer sa réponse avant même que son interlocuteur ait terminé.

Microsoft le dit premier en précision sur Artificial Analysis, un site indépendant qui compare les modèles d’IA. Il affirme aussi que les mots s’affichent deux fois plus vite que chez son concurrent le plus proche. Par contre, ce second chiffre sort de tests internes, et Microsoft ne nomme pas ce concurrent.

Côté voix, MAI-Voice-2.1 parle 23 langues et garde la même voix d’une langue à l’autre, avec l’accent local. Les deux modèles savent aussi cloner une voix à partir de quelques secondes d’enregistrement. D’après Microsoft, des garde-fous sur le consentement empêchent les abus. Google propose déjà de cloner une voix en 30 secondes avec Gemini 3.8 Flash TTS, lancé le 23 septembre.
Pour aller plus loin
Gemini : notre guide pour tout comprendre l’IA de Google
Les développeurs peuvent utiliser les trois modèles dès maintenant via Microsoft Foundry, Vercel ou le MAI Playground. La transcription coûte 0,54 dollar par heure d’audio, un tarif de lancement valable jusqu’à fin 2026. La voix est facturée 22 dollars par million de caractères, et 15 dollars en version Flash.
Si vous voulez recevoir les meilleures actus Frandroid sur WhatsApp, rejoignez cette discussion.

Ce contenu est bloqué car vous n'avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Disqus.
Pour pouvoir le visualiser, vous devez accepter l'usage étant opéré par Disqus avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l'amélioration des produits d'Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l'audience de ce site (en savoir plus)
En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et .
Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.