Gemini Robotics muscle le raisonnement des robots
D'après Google DeepMind (30 juillet 2026 à 02h00)
Résumé
Google DeepMind lance Gemini Robotics ER 2, un modèle de « raisonnement incarné » qui améliore la compréhension vidéo, l’orchestration de tâches et la collaboration multi-robots.
Les faits
Google DeepMind présente Gemini Robotics ER 2 comme « notre modèle de “raisonnement incarné” le plus performant pour la robotique », conçu comme un « cerveau de haut niveau pour les robots ». Le modèle permet aux robots de discuter avec des humains, de comprendre le monde physique et de planifier des tâches en plusieurs étapes, avant de déléguer l’exécution motrice à un modèle Vision-Language-Action (VLA) ou à des API de navigation. Gemini Robotics ER 2 est décrit comme une amélioration significative de Gemini Robotics ER 1.6. En exploitant des flux vidéo continus, les robots peuvent désormais suivre leur propre progression, s’adapter si quelque chose se dérègle et savoir exactement quand passer à l’étape suivante. Le modèle peut aussi appeler nativement des outils comme Google Search ou toute fonction définie par l’utilisateur, et s’intègre au Gemini Live API via un endpoint de streaming bidirectionnel optimisé pour les tâches sensibles à la latence, afin d’éviter les pauses de type « stop-and-think » dans l’exécution. Sur le volet « intelligence temporelle », Google DeepMind met en avant deux capacités clés : la classification continue de la progression et la détection précise de moments critiques dans la vidéo. En évaluations internes, chaque image d’un flux vidéo est assignée à l’un de cinq niveaux de progression (0-20 %, 20-40 %, 40-60 %, 60-80 %, 80-100 %), ce qui donne au robot une conscience situationnelle en temps réel et la possibilité d’ajuster ses actions ou de réessayer des étapes sans relancer un flux complet. Gemini Robotics ER 2 atteint 57,4 % de précision sur ces tâches de classification de progression. Pour la recherche de moments clés (« moment-finding »), le modèle identifie l’image exacte où se produit un événement critique, par exemple le moment auquel il faut arrêter de verser du café dans une tasse. Gemini Robotics ER 2 affiche 91,3 % de précision et une distance moyenne absolue de 0,96 seconde sur ces tâches, tout en offrant cette performance à une fraction du coût de calcul et avec une vitesse d’exécution quatre fois supérieure à celle de modèles beaucoup plus grands, ce que Google DeepMind présente comme une latence sub-seconde adaptée à l’exploitation sûre de robots physiques. Enfin, la mise à jour introduit la collaboration multi-robots : différents robots peuvent travailler ensemble dans des espaces partagés, se transmettre des tâches et accomplir des workflows complexes qu’un seul robot ne pourrait réaliser.
Pourquoi c’est important
Avec Gemini Robotics ER 2, Google DeepMind franchit une étape dans la capacité des robots à opérer de manière autonome et sûre dans le monde réel. En combinant compréhension vidéo en continu, orchestration de tâches multi-étapes et évaluation fine de la progression, le modèle vise à rendre les robots « plus utiles dans le monde physique » en leur donnant une conscience temporelle et contextuelle plus riche que les versions précédentes. La possibilité de collaboration multi-robots et l’intégration dans des environnements de contrôle variés — VLA réel, simulation ou téléopération humaine — ouvrent la voie à des applications où des machines différentes se complètent pour des tâches complexes. En offrant des performances de moment-finding avec une latence sub-seconde et une exécution rapide à coût réduit, Gemini Robotics ER 2 se positionne comme un socle technique pour des agents physiques capables de planifier, surveiller et corriger leurs actions en temps réel, tout en restant orchestrables par des développeurs via des outils et API standard.
Questions fréquentes
Qu’est-ce que Gemini Robotics ER 2 ?
C’est le modèle de raisonnement incarné le plus performant de Google DeepMind, conçu comme un cerveau de haut niveau pour les robots.
Comment Gemini Robotics ER 2 gère la progression des tâches ?
Il classe chaque image vidéo dans cinq niveaux de progression, de 0-20 % à 80-100 %, avec une précision de 57,4 %.
Que signifie « moment-finding » dans Gemini Robotics ER 2 ?
Le modèle identifie l’image exacte où se produit un événement critique, atteignant 91,3 % de précision et 0,96 s d’erreur moyenne.
Gemini Robotics ER 2 permet-il la collaboration entre plusieurs robots ?
Oui, il introduit la collaboration multi-robots pour travailler ensemble dans des espaces partagés et accomplir des workflows complexes.
Comment Gemini Robotics ER 2 s’intègre-t-il aux outils existants ?
Il peut appeler des outils comme Google Search, des modèles VLA ou des API de navigation, et s’intègre au Gemini Live API en streaming bidirectionnel.
Source
Google DeepMindAuteur
Rédaction IA-MediasRédaction spécialisée dans la veille et l'analyse de l'actualité de l'intelligence artificielle, des puces IA, des robots, des agents IA et de la recherche.