Gemini Robotics ER 2 transforme les robots en assistants intelligents capables de comprendre des vidéos, d'orchestrer des tâches complexes et de collaborer entre eux. Une avancée majeure pour l'autonomie des machines.
UN CERVEAU ARTIFICIEL POUR LES ROBOTS
Gemini Robotics ER 2 représente une avancée majeure pour les robots. Ce modèle d'intelligence artificielle agit comme un cerveau intelligent, permettant aux machines de réfléchir rapidement, de planifier des tâches en plusieurs étapes et même de collaborer avec d'autres robots. Grâce à lui, les robots peuvent analyser des flux vidéo pour suivre leur propre progression et corriger leurs erreurs en temps réel. L'objectif ? Rendre les robots plus sûrs et plus utiles dans notre monde physique.
POURQUOI LES ROBOTS DOIVENT PENSER EN TEMPS RÉEL
Pour aider les humains dans leur environnement quotidien, les robots ne peuvent pas se contenter de comprendre l'espace qui les entoure. Ils doivent aussi prendre des décisions ultra-rapides, en synchronisation avec le monde réel. C'est exactement ce que permet Gemini Robotics ER 2 : un modèle de raisonnement incarné conçu spécialement pour la robotique. Imaginez un cerveau artificiel capable de discuter avec les humains, de comprendre le monde physique et de planifier des actions complexes. Une fois la stratégie définie, le modèle confie l'exécution des mouvements à des modèles spécialisés dans la vision, le langage et l'action (VLA).
DES Outils À LA DISPOSITION DES ROBOTS
Gemini Robotics ER 2 ne se limite pas à la planification. Il permet aussi aux robots d'utiliser des outils, comme une recherche sur Google pour trouver des informations, ou n'importe quelle autre fonction définie par l'utilisateur. Son architecture unique permet au robot de réfléchir à la suite tout en exécutant ses actions en parallèle. Une capacité révolutionnaire pour les machines autonomes.
UN SAUT QUANTIQUE PAR RAPPORT À LA VERSION PRÉCÉDENTE
Gemini Robotics ER 2 est une version considérablement améliorée par rapport à son prédécesseur, ER 1.6. Grâce à l'analyse continue de flux vidéo, les robots peuvent désormais suivre leur propre progression, s'adapter en cas de problème et savoir exactement quand passer à l'étape suivante. Autre nouveauté : la collaboration multi-robots. Plusieurs machines peuvent travailler ensemble dans un même espace et accomplir des tâches complexes qu'un seul robot ne pourrait pas réaliser seul.
ORCHESTRER DES TÂCHES COMPLEXES
La plupart des tâches dans le monde physique sont complexes et nécessitent plusieurs étapes pour être accomplies. Gemini Robotics ER 2 transforme les robots en agents autonomes capables d'orchestrer ces étapes, de s'auto-corriger et de s'adapter à des situations inédites. Pour créer un tel système, les développeurs peuvent déclarer des interfaces de contrôle de bas niveau, comme les modèles VLA ou les API de navigation, comme des outils. Ils peuvent aussi transmettre directement au modèle des flux multimodaux (vidéo, audio ou texte).
DES PERFORMANCES SUPÉRIEURES À TOUTES LES VERSIONS PRÉCÉDENTES
Dans le domaine de la robotique, la rapidité d'exécution est cruciale. C'est pourquoi Gemini Robotics ER 2 s'intègre à l'API Gemini Live, utilisant un point de terminaison de streaming bidirectionnel optimisé pour les tâches sensibles au temps de latence. Résultat : une orchestration fluide où le modèle commande les modèles d'action et les API robotiques pour accomplir des tâches en plusieurs étapes, sans les pauses gênantes de « réflexion ». Pour illustrer cette capacité, une démonstration a été réalisée avec le robot Spot de Boston Dynamics. Le modèle orchestrait les API de Spot, comme la navigation et le mouvement du bras manipulateur, transformant le robot en un assistant capable de récupérer des objets sur simple commande vocale.
UNE DÉMONSTRATION CONCRÈTE : SPOT, LE ROBOT QUI RAPPORTE VOTRE COLLATION
Gemini Robotics ER 2 a permis à Spot, le robot de Boston Dynamics, de récupérer un paquet de pop-corn sur simple commande vocale. Une preuve concrète de ses capacités à comprendre des instructions naturelles et à les transformer en actions robotiques précises.
LE CODE EST DISPONIBLE SUR GITHUB
Tous les exemples et le code source de Gemini Robotics ER 2 sont accessibles sur GitHub. Une opportunité pour les développeurs de s'approprier ce modèle et de l'adapter à leurs propres projets robotiques.
SAVOIR QUAND UNE TÂCHE EST TERMINÉE : UN DÉFI MAJEUR
L'un des plus grands défis en robotique est de déterminer quand une tâche est terminée. Gemini Robotics ER 2 apporte une révolution dans la compréhension vidéo et le suivi de progression. Il permet de vérifier que des tâches complexes, comme serrer une ampoule ou nouer un sac poubelle, sont accomplies correctement avant de passer à l'étape suivante.
DEUX CAPACITÉS FONDAMENTALES POUR LE SUIVI DE PROGRESSION
Dans cette mise à jour, deux capacités essentielles ont été améliorées : la classification de progression et la détection de moments clés. La classification de progression permet au robot de suivre son avancée vers l'accomplissement d'une tâche. Dans les évaluations, chaque image d'un flux vidéo est classée en cinq niveaux de progression (0-20 %, 20-40 %, 40-60 %, 60-80 %, 80-100 %). Grâce à cette quantification, Gemini Robotics ER 2 offre aux robots une conscience situationnelle en temps réel, leur permettant d'ajuster leurs actions ou de recommencer une étape échouée sans redémarrer tout le processus.
DÉTECTER LES MOMENTS CLÉS POUR UNE ACTION PRÉCISE
La détection de moments clés mesure la capacité du modèle à identifier l'image exacte d'une vidéo où un événement critique se produit (par exemple, quand arrêter de verser du café dans une tasse). Gemini Robotics ER 2 réalise des progrès significatifs dans ce domaine, permettant aux robots de basculer précisément entre les tâches, de vérifier leur succès et de suggérer des corrections.
UNE AMÉLIORATION DES CAPACITÉS DE RAISONNEMENT SPATIAL
Gemini Robotics ER 2 fait progresser les capacités de raisonnement spatial du robot, comme le montrent trois benchmarks : la détection de succès (image/vidéo), les questions-réponses (ERQA) et la lecture d'instruments généralisée. Dans tous ces tests, il surpasse systématiquement la version ER 1.6.
LE MODÈLE LE PLUS SÛR POUR LES ROBOTS PHYSIQUES
La sécurité est une priorité absolue. Gemini Robotics ER 2 est le modèle le plus sûr jamais développé, avec des gains significatifs sur les benchmarks de sécurité comme le suivi d'instructions de sécurité et la proximité humaine. Ces tests évaluent comment le modèle respecte les contraintes physiques pendant les tâches de raisonnement et sa capacité à détecter les humains dans l'environnement. Les résultats sont impressionnants : le modèle peut arrêter un robot humanoïde lorsqu'une personne est à proximité et reprendre le travail automatiquement une fois la zone dégagée. Pour renforcer encore la sécurité des agents physiques, un nouveau benchmark a été introduit. Il évalue la capacité d'un modèle de base à agir comme un orchestrateur VLA sûr en testant sa capacité à imposer des contraintes de sécurité, surveiller l'environnement, évaluer la faisabilité physique et demander des clarifications humaines.
UN AVENIR POUR DES ROBOTS ENCORE PLUS UTILES
Les plans futurs visent à pousser ces modèles vers des tâches encore plus complexes, afin d'accélérer le développement de robots utiles et de soutenir la communauté robotique. L'objectif est clair : rendre les robots encore plus autonomes et capables de nous assister dans notre quotidien.
GITHUB : TOUT LE CODE DISPONIBLE
Le code de Gemini Robotics ER 2 et d'autres exemples sont disponibles sur GitHub. Une ressource précieuse pour les développeurs souhaitant explorer et intégrer ce modèle dans leurs propres projets.
- Google DeepMind
L'indépendance de CLODCO est votre garantie.
Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.
Soutenir CLODCO


