ByteDance SeedRealtime est le nom du nouveau modèle « full-duplex » présenté par l’organisation Seed du groupe chinois ByteDance : une IA capable d’écouter, de voir et de répondre en temps réel, dans une seule architecture qui fusionne audio, vidéo et texte sans passer par des modules séparés.
Une conversation qui ne s’arrête jamais
Les assistants vocaux actuels fonctionnent le plus souvent en alternance : l’utilisateur parle, le modèle traite, puis répond. SeedRealtime change cette logique en traitant les flux audio et vidéo en continu. Le modèle décide lui-même du bon moment pour intervenir, sans attendre un silence ou une commande explicite. Il peut aussi observer le contexte visuel pendant l’échange : gestes, expressions, éléments affichés à l’écran.
Comprendre au-delà des mots
Selon ByteDance, cette approche permet notamment de résoudre des homophones grâce au contexte visuel, de suivre une conversation dans un environnement bruyant, et de repérer un geste de la main pour ajuster une réponse. L’entreprise affirme que ses évaluations internes montrent une réduction de moitié des problèmes de synchronisation dans les échanges conversationnels, un point faible connu des systèmes vocaux « en cascade » qui traitent la parole, la compréhension puis la synthèse vocale en étapes distinctes.
Encore peu de détails techniques
ByteDance présente SeedRealtime comme « entièrement déployé » en interne, mais l’entreprise n’a communiqué pour l’instant aucune information sur une éventuelle API publique, une tarification, les régions couvertes ou les conditions d’accès pour les développeurs. Le modèle s’inscrit dans la lignée des travaux de l’organisation Seed, qui a déjà publié le modèle Doubao et le générateur d’images Seedream.
Pourquoi ça compte
La bascule vers des modèles multimodaux « full-duplex » est l’un des chantiers les plus disputés du secteur : OpenAI, Google et Meta travaillent tous sur des IA vocales capables de tenir une conversation aussi fluide qu’un humain, sans les coupures perceptibles des systèmes actuels. Avec SeedRealtime, ByteDance affiche sa volonté de rester dans cette course, aux côtés de ses propres modèles de langage comme Doubao.
Plus de détails sur le fonctionnement du modèle sont disponibles dans l’annonce originale relayée par TestingCatalog.
Qu’est-ce que SeedRealtime de ByteDance ?
SeedRealtime est un modèle IA multimodal « full-duplex » développé par l’organisation Seed de ByteDance, capable de traiter audio, vidéo et texte en continu pour répondre en temps réel.
SeedRealtime est-il disponible publiquement ?
ByteDance n’a pas communiqué de date, de tarification ni de modalités d’accès pour les développeurs à ce stade ; le modèle est présenté comme déployé en interne.
En quoi SeedRealtime diffère-t-il des assistants vocaux classiques ?
Contrairement aux systèmes qui alternent entre écoute et réponse, SeedRealtime traite les flux en continu et décide seul du moment opportun pour répondre, en tenant compte du contexte visuel.

