Microsoft a présenté MAI-Image-2.5-Pro et MAI-Voice-2-Flash, deux nouveaux modèles internes disponibles dès aujourd’hui en préversion publique via Microsoft Foundry et le MAI Playground. Le premier vise la génération d’images haute fidélité, le second la synthèse vocale rapide et économique. Les deux modèles alimentent déjà des produits maison comme Bing Image Creator, PowerPoint et Azure Voice Live.
MAI-Image-2.5-Pro : le rendu de texte comme argument central
MAI-Image-2.5-Pro est décrit par Microsoft comme son modèle de génération d’images le plus abouti à ce jour. L’accent est mis sur trois points : la production d’illustrations détaillées de type « hero artwork », l’édition précise d’images existantes, et surtout un rendu fidèle du texte intégré aux visuels — un point faible historique des générateurs d’images. Le modèle accepte aussi des commandes en langage naturel pour effectuer des retouches rapides sans repartir d’un prompt complet.
Côté tarification, Microsoft facture ce modèle 5 dollars par million de tokens en entrée texte, 8 dollars par million de tokens en entrée image, et 106 dollars par million de tokens en sortie image. MAI-Image-2.5-Pro fait déjà tourner Bing Image Creator de bout en bout, sert aux tâches d’image-to-image dans PowerPoint, et intervient dans les fonctions d’édition d’images d’OneDrive.
MAI-Voice-2-Flash : la vitesse pensée pour les centres d’appels
MAI-Voice-2-Flash est la version accélérée du modèle de synthèse vocale de Microsoft. L’entreprise annonce une vitesse deux fois supérieure à MAI-Voice-2 et un coût réduit de 32 %, tout en conservant une prosodie et une qualité acoustique jugées naturelles. Le modèle est facturé 15 dollars par million de caractères.
Ce modèle est pensé pour les usages à très fort volume : il fait déjà tourner le Dynamics 365 Contact Center et Azure Voice Live. Microsoft avance jusqu’à 89 % de réduction des coûts de calcul GPU sur des déploiements de centres d’appels, un argument clé pour les entreprises qui opèrent des volumes d’appels vocaux automatisés importants.
Une stratégie de modèles maison qui s’accélère
Cette double annonce s’inscrit dans la continuité de la stratégie MAI de Microsoft, qui développe depuis plusieurs mois ses propres modèles pour réduire sa dépendance aux modèles tiers sur certains cas d’usage précis — image, voix, et plus tôt cette année du code avec MAI-Code-1-Flash. En intégrant MAI-Image-2.5-Pro et MAI-Voice-2-Flash directement dans Bing, PowerPoint, OneDrive et Dynamics 365, Microsoft garde la main sur le coût et la latence de ses propres produits plutôt que de dépendre entièrement de fournisseurs externes comme OpenAI pour ces fonctions.
Les deux modèles sont accessibles dès maintenant via l’annonce officielle de Microsoft AI, par Microsoft Foundry pour les développeurs souhaitant les intégrer à leurs propres applications, ou directement via le MAI Playground pour les tester sans configuration préalable.
Qu’est-ce que MAI-Image-2.5-Pro ?
C’est le nouveau modèle de génération d’images haute fidélité de Microsoft, capable de produire des illustrations détaillées avec un rendu précis du texte intégré, et disponible en préversion via Microsoft Foundry et le MAI Playground.
Combien coûte MAI-Voice-2-Flash ?
MAI-Voice-2-Flash est facturé 15 dollars par million de caractères. Microsoft annonce une vitesse deux fois supérieure à MAI-Voice-2 pour un coût réduit de 32 %.
Quels produits Microsoft utilisent déjà ces modèles ?
MAI-Image-2.5-Pro alimente Bing Image Creator, les fonctions image-to-image de PowerPoint et l’édition d’images d’OneDrive. MAI-Voice-2-Flash fait tourner le Dynamics 365 Contact Center et Azure Voice Live.
