Google DeepMind a publié le 30 juillet 2026 Gemini Robotics ER 2, la nouvelle version de son modèle de raisonnement embarqué (Embodied Reasoning), pensé comme un cerveau haut niveau pour les robots. Il comprend des flux vidéo en continu, planifie des tâches en plusieurs étapes et coordonne plusieurs robots entre eux, pendant que des modèles vision-langage-action de niveau inférieur exécutent les commandes motrices.
Comprendre la vidéo en continu, pas des images figées
La principale avancée par rapport à la version précédente, ER 1.6, tient dans la capacité du modèle à surveiller un flux vidéo continu plutôt que des images isolées. Les robots peuvent ainsi suivre la progression d’une tâche, détecter un échec en cours d’exécution et décider seuls du moment de passer à l’étape suivante. Gemini Robotics ER 2 introduit aussi une collaboration multi-robots : Apptronik a fait la démonstration de son humanoïde Apollo 2 travaillant aux côtés d’un bras Franka F3 Duo sur une tâche partagée, orchestrée par ce même modèle.
Des chiffres de précision inédits
Google DeepMind publie plusieurs indicateurs de performance. Le modèle atteint 57,4 % de précision pour classer la progression d’une tâche en cinq paliers, de 0-20 % à 80-100 % d’avancement. Sur la détection d’un instant précis dans une action, il identifie l’image critique avec 91,3 % de précision et un écart moyen de 0,96 seconde par rapport au moment réel. Selon Google DeepMind, cette latence sous la seconde est nécessaire pour piloter un robot physique en toute sécurité, avec une vitesse d’exécution quatre fois supérieure à celle de modèles concurrents plus volumineux, pour une fraction de la puissance de calcul. ER 2 dépasse systématiquement ER 1.6 dans les trois modes de contrôle testés : VLA réel, VLA en simulation et téléopération humaine.
Sécurité et lecture d’instruments
Le modèle améliore la détection de succès ou d’échec à partir de vidéo brute plutôt que d’images fixes, et étend la lecture d’instruments à dix types d’affichages différents : écrans numériques, échelles linéaires, thermomètres, entre autres. Sur les benchmarks de sécurité, Gemini Robotics ER 2 dépasse ER 1.6 pour le respect des instructions de sécurité et la gestion de la proximité humaine. Il est capable d’arrêter un robot humanoïde lorsqu’une personne s’approche, puis de reprendre le travail seul une fois la zone dégagée.
Une architecture à deux niveaux, disponible dès maintenant
Gemini Robotics ER 2 ne pilote pas directement les moteurs : il planifie et raisonne, puis délègue l’exécution motrice à des modèles vision-langage-action de plus bas niveau. Le modèle s’intègre à l’API Gemini Live via un point d’entrée en streaming bidirectionnel optimisé pour les usages sensibles à la latence, et peut appeler nativement des outils externes comme la recherche Google. Il est accessible dès maintenant via l’API Gemini et Google AI Studio, avec un accès en aperçu privé sur la plateforme Gemini Enterprise Agent. Boston Dynamics a déjà configuré son robot Spot pour aller chercher des objets sur commande vocale en s’appuyant sur ce modèle pour orchestrer navigation et manipulation.
Qu’est-ce que Gemini Robotics ER 2 ?
C’est le nouveau modèle de raisonnement embarqué de Google DeepMind, qui sert de cerveau haut niveau pour la planification et la coordination des robots, publié le 30 juillet 2026.
Gemini Robotics ER 2 est-il disponible ?
Oui, il est accessible dès maintenant via l’API Gemini et Google AI Studio, avec un accès en aperçu privé sur la plateforme Gemini Enterprise Agent.
Quelle est la précision de Gemini Robotics ER 2 ?
Le modèle atteint 91,3 % de précision pour identifier un instant critique dans une action, avec un écart moyen de 0,96 seconde par rapport au moment réel.
