Close Menu
  • Actualité IA
  • Modèles IA
  • Open Weight
X (Twitter)
iacapsule.friacapsule.fr
  • Actualité IA
  • Modèles IA
  • Open Weight
S'abonner
X (Twitter)
iacapsule.friacapsule.fr
Home»Actualité IA»Microsoft lance MAI-Transcribe-2-Streaming et MAI-Voice : une stack audio taillée pour les agents
microsoft mai transcribe 2 streaming mai voice
Actualité IA

Microsoft lance MAI-Transcribe-2-Streaming et MAI-Voice : une stack audio taillée pour les agents

Updated:octobre 2, 20264 Mins Readoctobre 2, 2026
Share
Twitter Email Copy Link

Microsoft AI a présenté le 2 octobre 2026 une suite complète de trois modèles audio spécialement conçus pour les agents conversationnels : MAI-Transcribe-2-Streaming, MAI-Voice-2.1 et MAI-Voice-2.1-Flash. L’ambition de l’éditeur est d’offrir aux développeurs une boucle fermée d’écoute, de raisonnement et de restitution vocale capable de maintenir des échanges humains naturels sans temps mort.

MAI-Transcribe-2-Streaming : transcrire dès les premiers mots

Le modèle de reconnaissance vocale MAI-Transcribe-2-Streaming représente l’avancée la plus marquante de cette annonce. Selon les données communiquées par Microsoft et validées par la plateforme Artificial Analysis, le modèle prend la première position pour la précision de transcription, tant sur les résultats partiels en cours de phrase que sur le texte finalisé.

Le système se distingue par plusieurs caractéristiques techniques déterminantes pour l’architecture des agents IA :

  • Une latence de réaction dès 100 millisecondes : le moteur commence à émettre ses premières hypothèses textuelles à peine 100 millisecondes après la réception des paquets audio.
  • Prise en charge de 60 langues avec détection continue : l’algorithme adapte son décodage en direct sans nécessiter de sélection manuelle préalable de la langue ou du dialecte parlé.
  • Anticipation des appels d’outils (tool calling) : en stabilisant le flux de texte au fil de l’élocution, le modèle permet au grand modèle de langage (LLM) sous-jacent d’engager son raisonnement ou de déclencher des requêtes d’outils avant même que l’utilisateur n’ait achevé sa phrase.
  • Affichage accéléré : d’après les tests internes de Microsoft, l’apparition des mots à l’écran est deux fois plus rapide que celle des solutions concurrentes de dictée en direct.

MAI-Voice-2.1 et Flash : la voix multilingue sans rupture d’identité

Pour assurer la synthèse vocale, Microsoft dévoile parallèlement deux modèles complémentaires :

MAI-Voice-2.1 couvre 23 langues et 26 variantes régionales. Son point fort réside dans la préservation de l’identité vocale : une voix unique peut s’exprimer dans plusieurs langues successives tout en conservant son timbre caractéristique, en adoptant naturellement la phonétique et les intonations locales. Cette capacité évite par exemple de devoir changer d’interlocuteur virtuel lorsqu’un utilisateur passe du français à l’anglais au cours d’une session. Le modèle est proposé au tarif de 22 dollars par million de caractères.

MAI-Voice-2.1-Flash s’adresse quant à lui aux cas d’usage à fort volume nécessitant une réactivité immédiate. Capable de générer 45 secondes d’audio avec une latence de bout en bout de 150 millisecondes, il affiche une vitesse d’inférence supérieure de 55 % et un coût réduit de 60 % par rapport à la version standard, à 15 dollars par million de caractères.

Les deux modèles vocaux intègrent une technologie de clonage vocal fonctionnant à partir d’un échantillon de référence de quelques secondes, assortie de protocoles de consentement stricts pour prévenir la création de voix non autorisées.

Disponibilité immédiate et intégrations pour les développeurs

Microsoft rend ces technologies immédiatement accessibles pour faciliter leur adoption dans les pipelines existants :

  • Les modèles de synthèse vocale sont intégrés au catalogue d’OpenRouter.
  • L’ensemble du trio est disponible sur Microsoft Foundry, MAI Playground, Azure Voice Live et la plateforme Vercel.
  • Une compatibilité native avec le protocole WebRTC de LiveKit est programmée pour les prochaines semaines.
  • Une application de démonstration intitulée Chatter est mise en ligne sur le portail MAI Playground afin de tester la chaîne complète en conditions réelles.

Pour accompagner le lancement, MAI-Transcribe-2-Streaming bénéficie d’un tarif d’introduction fixé à 0,54 dollar par heure audio traitée jusqu’à la fin de l’année 2026.

Qu’est-ce que MAI-Transcribe-2-Streaming de Microsoft ?

MAI-Transcribe-2-Streaming est un modèle de reconnaissance vocale en temps réel conçu par Microsoft AI pour les agents autonomes. Il émet des hypothèses textuelles dès 100 millisecondes de latence et gère 60 langues avec détection automatique.

Quels sont les tarifs de la gamme audio Microsoft AI ?

Le modèle de transcription est facturé 0,54 $ par heure audio en tarif de lancement. La synthèse vocale MAI-Voice-2.1 est proposée à 22 $ par million de caractères, et sa déclinaison ultra-rapide Flash à 15 $ par million de caractères.

Comment utiliser ces modèles dans ses applications ?

Les développeurs peuvent y accéder via Microsoft Foundry, MAI Playground, Azure Voice Live, Vercel et OpenRouter, avec une intégration LiveKit à venir.

Source : TestingCatalog / Microsoft AI

agent IA Agents IA clonage de voix Microsoft
Share. Twitter Email Copy Link
Previous ArticlemacOS : Apple durcit l’accès complet au disque face aux dérives des agents IA
Next Article Meta libère le code des gadgets Muse : créez vos objets IA sur ESP32 et Raspberry Pi

Related Posts

Actualité IA Agents IA Breaking News Business & Stratégie ByteDance

TikTok Shopping Assistant : l’IA d’achat débarque dans le flux Pour Toi

Actualité IA Agents IA Breaking News

Sécurité des agents IA : OpenAI s’excuse en Australie et veut une loi

Agents IA Breaking News News OpenAI Régulation & Éthique Sécurité

Agents OpenAI : Wikipédia dénonce des bots hors de contrôle

Subscribe to Updates

Get the latest creative news from FooBar about art, design and business.

iacapsule.fr
X (Twitter)
  • À propos d’IA Capsule
  • Contact
  • Mentions légales
  • Politique de confidentialité
© 2026 iacapsule.fr

Type above and press Enter to search. Press Esc to cancel.

Gérer le consentement
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
  • Gérer les options
  • Gérer les services
  • Gérer {vendor_count} fournisseurs
  • En savoir plus sur ces finalités
Voir les préférences
  • {title}
  • {title}
  • {title}