Close Menu
    X (Twitter)
    iacapsule.friacapsule.fr
    Subscribe
    X (Twitter)
    iacapsule.friacapsule.fr
    Home»Google»GenCeption DeepMind : un générateur vidéo qui réinvente les modèles du monde de la vision par ordinateur
    Capteur de profondeur et technologie de vision par ordinateur, illustration GenCeption DeepMind
    Google juillet 19, 20263 Mins Read

    GenCeption DeepMind : un générateur vidéo qui réinvente les modèles du monde de la vision par ordinateur

    Updated:juillet 19, 20263 Mins Read
    Share
    Twitter Email Copy Link

    Google DeepMind vient de présenter GenCeption, un système qui détourne un générateur vidéo pré-entraîné pour remplacer plusieurs modèles spécialisés de vision par ordinateur. Publiés le 19 juillet 2026, les résultats de ce GenCeption DeepMind montrent qu’un seul modèle vidéo peut égaler, voire dépasser, des références comme DepthAnything 3 ou SAM 3 sur des tâches d’estimation de profondeur, de segmentation et de pose 3D — avec une fraction des données d’entraînement habituelles.

    Un seul modèle pour plusieurs tâches de vision

    Contrairement aux modèles de diffusion classiques qui nécessitent plusieurs passes pour affiner un résultat, GenCeption génère ses réponses en une seule passe, guidée par une invite textuelle. Le système repose sur Wan2.1, le modèle vidéo open source d’Alibaba, dans sa version à 14 milliards de paramètres, capable de produire une séquence de 81 images en environ dix secondes.

    L’équipe DeepMind a testé l’approche sur trois tâches distinctes : l’estimation de profondeur, la segmentation d’objets et l’estimation de pose 3D. Dans chacun des cas, les résultats se situent au niveau des modèles spécialisés existants, sans architecture dédiée à chaque tâche.

    Des données d’entraînement réduites au minimum

    Le point le plus marquant concerne le volume de données utilisé : 7 500 vidéos synthétiques seulement, générées à partir de 800 modèles humains numériques et de 200 séquences de capture de mouvement, puis rendues dans Blender avec des arrière-plans variés. Selon DeepMind, GenCeption utilise entre 7 et 500 fois moins de données que les modèles concurrents pour des performances comparables.

    Autre résultat notable : le modèle généralise à des catégories absentes de son entraînement, comme les animaux, alors que sa base d’apprentissage se limite à des figures humaines de synthèse. Un article publié en parallèle par Tech Times confirme ces résultats en détaillant comment le pré-entraînement vidéo unifie six tâches de vision distinctes.

    Pourquoi ce résultat intéresse au-delà de la vision par ordinateur

    Le résultat nourrit un débat plus large dans la recherche : les générateurs vidéo, entraînés uniquement à prédire des images plausibles, pourraient avoir appris au passage une forme de représentation du monde physique — profondeur, mouvement, structure des objets — utilisable pour des tâches qu’ils n’ont jamais vues explicitement. C’est cette hypothèse des modèles du monde latents que DeepMind détaille dans son étude, en s’appuyant sur les scores obtenus par GenCeption face aux outils de référence du secteur.

    Pour l’instant, l’équipe ne communique pas de calendrier de mise à disposition publique du modèle. Mais l’approche ouvre une piste concrète : remplacer une collection d’outils de vision spécialisés par un seul générateur vidéo, piloté par des instructions en langage naturel.

    Qu’est-ce que GenCeption ?

    GenCeption est un système développé par Google DeepMind qui réutilise un générateur vidéo pré-entraîné pour réaliser des tâches de vision par ordinateur comme l’estimation de profondeur, la segmentation ou la pose 3D, en une seule passe et à partir d’une invite textuelle.

    Sur quel modèle repose GenCeption ?

    GenCeption s’appuie sur Wan2.1, le modèle vidéo open source d’Alibaba, dans sa version à 14 milliards de paramètres.

    Combien de données GenCeption a-t-il nécessité ?

    Le modèle a été entraîné avec seulement 7 500 vidéos synthétiques, générées à partir de 800 modèles humains numériques et 200 séquences de capture de mouvement rendues dans Blender.

    Google DeepMind Vidéo IA vision par ordinateur
    Share. Twitter Email Copy Link
    Previous ArticleApple Intelligence en Chine : l’action Alibaba bondit jusqu’à 7,9 % en Bourse
    Next Article RadLE 2.0 : le benchmark qui révèle l’excès de confiance de l’IA en radiologie
    Steve
    • Website

    Related Posts

    News

    Samsung Mistral : discussions pour un investissement jusqu’à 1 milliard d’euros

    News

    Substack détection IA : la plateforme identifie le contenu généré par Pangram

    News Emploi

    France Travail IA : un algorithme pour cibler les chômeurs à contrôler

    Subscribe to Updates

    Get the latest creative news from FooBar about art, design and business.

    iacapsule.fr
    X (Twitter)
    © 2026 iacapsule.fr

    Type above and press Enter to search. Press Esc to cancel.

    Gérer le consentement
    Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
    Fonctionnel Toujours activé
    L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
    Préférences
    L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
    Statistiques
    Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques. Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
    Marketing
    L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.
    • Gérer les options
    • Gérer les services
    • Gérer {vendor_count} fournisseurs
    • En savoir plus sur ces finalités
    Voir les préférences
    • {title}
    • {title}
    • {title}