Microsoft AI a présenté le 2 octobre 2026 une suite complète de trois modèles audio spécialement conçus pour les agents conversationnels : MAI-Transcribe-2-Streaming, MAI-Voice-2.1 et MAI-Voice-2.1-Flash. L’ambition de l’éditeur est d’offrir aux développeurs une boucle fermée d’écoute, de raisonnement et de restitution vocale capable de maintenir des échanges humains naturels sans temps mort.
MAI-Transcribe-2-Streaming : transcrire dès les premiers mots
Le modèle de reconnaissance vocale MAI-Transcribe-2-Streaming représente l’avancée la plus marquante de cette annonce. Selon les données communiquées par Microsoft et validées par la plateforme Artificial Analysis, le modèle prend la première position pour la précision de transcription, tant sur les résultats partiels en cours de phrase que sur le texte finalisé.
Le système se distingue par plusieurs caractéristiques techniques déterminantes pour l’architecture des agents IA :
- Une latence de réaction dès 100 millisecondes : le moteur commence à émettre ses premières hypothèses textuelles à peine 100 millisecondes après la réception des paquets audio.
- Prise en charge de 60 langues avec détection continue : l’algorithme adapte son décodage en direct sans nécessiter de sélection manuelle préalable de la langue ou du dialecte parlé.
- Anticipation des appels d’outils (tool calling) : en stabilisant le flux de texte au fil de l’élocution, le modèle permet au grand modèle de langage (LLM) sous-jacent d’engager son raisonnement ou de déclencher des requêtes d’outils avant même que l’utilisateur n’ait achevé sa phrase.
- Affichage accéléré : d’après les tests internes de Microsoft, l’apparition des mots à l’écran est deux fois plus rapide que celle des solutions concurrentes de dictée en direct.
MAI-Voice-2.1 et Flash : la voix multilingue sans rupture d’identité
Pour assurer la synthèse vocale, Microsoft dévoile parallèlement deux modèles complémentaires :
MAI-Voice-2.1 couvre 23 langues et 26 variantes régionales. Son point fort réside dans la préservation de l’identité vocale : une voix unique peut s’exprimer dans plusieurs langues successives tout en conservant son timbre caractéristique, en adoptant naturellement la phonétique et les intonations locales. Cette capacité évite par exemple de devoir changer d’interlocuteur virtuel lorsqu’un utilisateur passe du français à l’anglais au cours d’une session. Le modèle est proposé au tarif de 22 dollars par million de caractères.
MAI-Voice-2.1-Flash s’adresse quant à lui aux cas d’usage à fort volume nécessitant une réactivité immédiate. Capable de générer 45 secondes d’audio avec une latence de bout en bout de 150 millisecondes, il affiche une vitesse d’inférence supérieure de 55 % et un coût réduit de 60 % par rapport à la version standard, à 15 dollars par million de caractères.
Les deux modèles vocaux intègrent une technologie de clonage vocal fonctionnant à partir d’un échantillon de référence de quelques secondes, assortie de protocoles de consentement stricts pour prévenir la création de voix non autorisées.
Disponibilité immédiate et intégrations pour les développeurs
Microsoft rend ces technologies immédiatement accessibles pour faciliter leur adoption dans les pipelines existants :
- Les modèles de synthèse vocale sont intégrés au catalogue d’OpenRouter.
- L’ensemble du trio est disponible sur Microsoft Foundry, MAI Playground, Azure Voice Live et la plateforme Vercel.
- Une compatibilité native avec le protocole WebRTC de LiveKit est programmée pour les prochaines semaines.
- Une application de démonstration intitulée Chatter est mise en ligne sur le portail MAI Playground afin de tester la chaîne complète en conditions réelles.
Pour accompagner le lancement, MAI-Transcribe-2-Streaming bénéficie d’un tarif d’introduction fixé à 0,54 dollar par heure audio traitée jusqu’à la fin de l’année 2026.
Qu’est-ce que MAI-Transcribe-2-Streaming de Microsoft ?
MAI-Transcribe-2-Streaming est un modèle de reconnaissance vocale en temps réel conçu par Microsoft AI pour les agents autonomes. Il émet des hypothèses textuelles dès 100 millisecondes de latence et gère 60 langues avec détection automatique.
Quels sont les tarifs de la gamme audio Microsoft AI ?
Le modèle de transcription est facturé 0,54 $ par heure audio en tarif de lancement. La synthèse vocale MAI-Voice-2.1 est proposée à 22 $ par million de caractères, et sa déclinaison ultra-rapide Flash à 15 $ par million de caractères.
Comment utiliser ces modèles dans ses applications ?
Les développeurs peuvent y accéder via Microsoft Foundry, MAI Playground, Azure Voice Live, Vercel et OpenRouter, avec une intégration LiveKit à venir.
Source : TestingCatalog / Microsoft AI

