La nouvelle IA de Microsoft transcrit vos paroles avant même la fin de vos phrases

Plus vite que l'écrit

 
Microsoft a lancé ce jeudi 1er octobre MAI-Transcribe-2-Streaming, un modèle d’IA qui transcrit la parole en direct dans 60 langues, accompagné de deux nouveaux modèles de synthèse vocale. Selon Microsoft, ce premier modèle de transcription en direct de l’entreprise se classe numéro un en précision sur le comparateur Artificial Analysis.
Source : Microsoft

En juin, à sa conférence Build, Microsoft avait présenté sept modèles d’IA maison pour moins dépendre d’OpenAI. La gamme s’agrandit encore. Dans un billet publié ce jeudi 1er octobre, sa division Microsoft AI a lancé MAI-Transcribe-2-Streaming, son premier modèle de transcription en streaming, c’est-à-dire qu’il écrit le texte pendant que la personne parle. Il fonctionne dans 60 langues et repère tout seul la langue parlée, même si elle change en cours de route.

Il arrive avec deux modèles de synthèse vocale, MAI-Voice-2.1 et sa version rapide MAI-Voice-2.1-Flash. Ensemble, ils servent à construire des agents vocaux, ces assistants qui écoutent, réfléchissent puis répondent à voix haute, au service client par exemple.

Du texte avant la fin de la phrase

Le modèle de transcription n’attend pas que l’on ait fini de parler. Il propose un premier jet un peu plus de 100 millisecondes après avoir reçu le son, puis il le corrige au fil de la phrase. Un agent vocal peut donc commencer à préparer sa réponse avant même que son interlocuteur ait terminé.

Source : Microsoft

Microsoft le dit premier en précision sur Artificial Analysis, un site indépendant qui compare les modèles d’IA. Il affirme aussi que les mots s’affichent deux fois plus vite que chez son concurrent le plus proche. Par contre, ce second chiffre sort de tests internes, et Microsoft ne nomme pas ce concurrent.

Source : Microsoft

Côté voix, MAI-Voice-2.1 parle 23 langues et garde la même voix d’une langue à l’autre, avec l’accent local. Les deux modèles savent aussi cloner une voix à partir de quelques secondes d’enregistrement. D’après Microsoft, des garde-fous sur le consentement empêchent les abus. Google propose déjà de cloner une voix en 30 secondes avec Gemini 3.8 Flash TTS, lancé le 23 septembre.

Pour aller plus loin
Gemini : notre guide pour tout comprendre l’IA de Google

Les développeurs peuvent utiliser les trois modèles dès maintenant via Microsoft Foundry, Vercel ou le MAI Playground. La transcription coûte 0,54 dollar par heure d’audio, un tarif de lancement valable jusqu’à fin 2026. La voix est facturée 22 dollars par million de caractères, et 15 dollars en version Flash.


Si vous voulez recevoir les meilleures actus Frandroid sur WhatsApp, rejoignez cette discussion.

Recherche IA boostée par
Perplexity