Fish Audio a lancé le 28 juillet 2026 S2.1 Pro, un nouveau modèle de synthèse vocale IA conçu pour la conversation en temps réel plutôt que pour la narration scriptée. Le modèle affiche une latence d’environ 90 millisecondes, prend en charge 83 langues avec une identité vocale cohérente d’une langue à l’autre, et reste disponible via une offre gratuite pour le développement.
Une identité vocale qui traverse 83 langues
La promesse centrale de S2.1 Pro tient dans la cohérence : cloner une voix à partir d’un échantillon de 10 à 30 secondes, puis la faire parler dans n’importe laquelle des 83 langues prises en charge sans qu’elle change de « grain » ou de texture. Le modèle gère aussi les dialogues à plusieurs locuteurs, une fonctionnalité recherchée pour les podcasts synthétiques ou les scènes de jeu vidéo générées à la volée.
Des instructions de jeu par balises
Fish Audio a ajouté un système de balises entre crochets pour piloter la performance vocale à la demande : chuchotement, rire nerveux, hésitation, ou toute autre indication de jeu directement injectée dans le texte source. L’objectif est de sortir du registre figé du texte-à-parole classique pour se rapprocher d’une performance d’acteur dirigeable en temps réel.
Pensé pour les agents vocaux
S2.1 Pro s’intègre aux flux agentiques via le support MCP et des « agent-skills », ce qui le positionne directement face aux besoins des agents vocaux, des systèmes téléphoniques automatisés et des pipelines audio pilotés par IA — un terrain où la latence de 90 ms compte au moins autant que la qualité de la voix elle-même, puisqu’un délai plus long casse l’illusion conversationnelle.
Disponibilité et prix
Le modèle est accessible dès maintenant via l’API Fish Audio. Une offre gratuite tourne sur le même modèle, avec la même qualité et la même couverture linguistique que l’offre payante, sous limites d’usage raisonnable réservées au développement et aux tests — sans le plafond dur qu’impose habituellement ce type d’offre gratuite. Fish Audio ne communique pas de grille tarifaire précise pour l’offre de production dans cette annonce, publiée en premier par TestingCatalog.
Pourquoi ça compte
La synthèse vocale multilingue à faible latence est un des maillons les moins visibles, mais les plus critiques, de la vague d’agents vocaux qui se généralise cette année. Un modèle qui tient une identité de voix stable sur 83 langues, avec un contrôle fin du ton via de simples balises, réduit d’autant le travail d’intégration pour qui construit un assistant vocal multilingue — sans passer par les géants du secteur.
Qu’est-ce que Fish Audio S2.1 Pro ?
C’est un modèle de synthèse vocale conçu pour la conversation en temps réel, avec environ 90 ms de latence et un support de 83 langues, lancé le 28 juillet 2026.
S2.1 Pro est-il gratuit ?
Une offre gratuite donne accès au même modèle et à la même couverture linguistique que l’offre payante, sous limites d’usage raisonnable pour le développement et les tests.
Peut-on cloner une voix avec S2.1 Pro ?
Oui, à partir d’un échantillon de 10 à 30 secondes, avec une identité vocale conservée dans les 83 langues prises en charge.

