IA PHYSIQUE · MODÈLES INCARNÉS
Gemini Robotics ER 2 : l’IA qui apprend aux robots à travailler ensemble
Le nouveau modèle de raisonnement incarné de Google DeepMind ne cherche pas d’abord à déplacer un bras. Il observe une scène, découpe une mission, vérifie sa progression et confie chaque geste au robot le mieux adapté. Cette séparation entre « cerveau » et « corps » pourrait compter davantage que la prochaine démonstration spectaculaire.
L’annonce a été publiée le 30 juillet 2026, et non ce matin. Son actualité demeure forte car Gemini Robotics ER 2 est désormais accessible aux développeurs en préversion publique via Gemini API et Google AI Studio, tandis que l’ancien endpoint ER 1.6 doit fermer le 31 août. Les notes de version officielles confirment deux interfaces : une standard et une version streaming destinée aux agents robotiques à faible latence.
Google DeepMind décrit ER 2 comme “a high-level brain for robots”. La formule est utile à condition de ne pas la prendre au pied de la lettre. Le modèle produit du raisonnement et des appels d’outils ; il ne remplace pas les contrôleurs qui gèrent équilibre, trajectoires, moteurs, force ou arrêt d’urgence.
ER 2 ajoute une couche d’orchestration : voir ce qui se passe, décider de la prochaine étape, vérifier le résultat et déléguer l’action à un robot ou à un humain.
Deux endpoints pour faire entrer le raisonnement dans la boucle
Le premier modèle, gemini-robotics-er-2-preview, traite texte, image, vidéo et audio. Il peut produire une sortie structurée, exécuter du code, appeler des fonctions et raisonner sur l’espace. Un développeur lui décrit les outils disponibles — naviguer, saisir, ouvrir, pointer, appeler un VLA — puis le modèle choisit leur ordre.
Le second, gemini-robotics-er-2-streaming-preview, utilise la Live API. Il reçoit un flux audio-vidéo bidirectionnel et émet du texte ou des appels de fonction pendant que la scène évolue. Le but est d’éviter le cycle rigide : capturer une image, arrêter, réfléchir, exécuter, puis recommencer. Selon la documentation développeur, les deux endpoints restent en préversion.
Cette disponibilité différencie ER 2 d’une simple vidéo de laboratoire. Un développeur peut tester la perception spatiale, la progression vidéo ou l’orchestration avec ses propres fonctions. Mais l’accès par API signifie aussi qu’une partie du raisonnement dépend d’une infrastructure distante, de quotas, de conditions contractuelles et de la qualité du réseau.
Une démonstration avec un robot quadrupède illustre le principe : le modèle appelle navigation et manipulation comme des outils séparés. Visuel généré par IA.
Le cerveau de haut niveau ne remplace pas le système nerveux
La pile comprend au moins quatre étages. Les capteurs produisent images, sons et états. ER 2 interprète la scène et construit un plan. Un modèle vision-langage-action ou une API traduit une étape en commandes. Enfin, le contrôleur temps réel pilote les moteurs sous contraintes de sécurité.
Cette architecture évite de demander au même réseau de discuter avec un humain et de stabiliser une articulation à plusieurs centaines de cycles par seconde. Le raisonnement peut fonctionner à une cadence plus lente, tandis que le contrôle réactif reste local. Si le modèle demande « avancer jusqu’à la table », l’API de navigation gère obstacles, vitesse et trajectoire.
Le rôle des outils
Un outil est une fonction décrite au modèle : prendre_objet, ouvrir_tiroir, lire_instrument ou demander_validation. ER 2 choisit l’outil et ses paramètres. Cette abstraction rend le même orchestrateur compatible avec un quadrupède, un bras fixe ou un humanoïde, à condition que chacun expose des capacités fiables.
Le rôle du VLA
Le VLA transforme vision et instruction en actions motrices. ER 2 peut lui déléguer un geste précis, puis observer la vidéo pour décider s’il a réussi. La séparation n’est pas absolue : planification et mouvement se recouvrent, mais elle rend le système plus modulaire et plus auditable.
Des corps différents peuvent partager un objectif sans partager la même mécanique. Visuel généré par IA.
La nouveauté décisive : savoir où en est l’action
Beaucoup de robots exécutent correctement une commande isolée et échouent dès que la tâche dure plusieurs minutes. Ils répètent un geste déjà terminé, abandonnent trop tôt ou ne voient pas qu’un objet a glissé. ER 2 ajoute une compréhension temporelle de la vidéo afin d’estimer la progression et de localiser les instants critiques.
Google divise une séquence en cinq classes d’avancement, de 0–20 % à 80–100 %. Sur son benchmark, ER 2 atteint 57,4 % de précision, contre 42,7 % pour ER 1.6. Ce résultat indique un progrès, mais aussi une marge d’erreur considérable : une classification correcte un peu plus d’une fois sur deux n’est pas suffisante pour laisser un système critique sans garde-fou.
Le moment finding cherche l’image exacte où un événement se produit : le liquide atteint le niveau voulu, l’ampoule est serrée ou le sac est fermé. Google annonce 91,3 % de précision et une distance absolue moyenne de 0,96 seconde. Ces chiffres viennent des évaluations du concepteur ; ils ne garantissent pas la même précision dans une usine, un domicile ou un éclairage différent.
Identifier le moment d’arrêter est une compétence distincte de celle qui produit le mouvement. Visuel généré par IA.
Voir l’échec, corriger, puis reprendre
La robustesse ne consiste pas à ne jamais échouer. Elle consiste à détecter l’écart, comprendre ce qui reste à faire et choisir une reprise sûre. Si une pince manque un cube, le modèle doit éviter de déclarer la tâche terminée, localiser l’objet et relancer une saisie avec une nouvelle approche.
Cette boucle observation–action–vérification rapproche la robotique des agents logiciels, mais le monde physique ajoute des conséquences. Une seconde tentative peut pousser l’objet hors de portée, coincer une articulation ou surprendre une personne. Les politiques de reprise doivent donc limiter le nombre d’essais et prévoir l’appel à un opérateur.
Dans les évaluations publiées par Google, ER 2 obtient 87,7 % en détection de succès sur image et 82,4 % sur vidéo. Ces scores sont meilleurs que ceux annoncés pour ER 1.6, mais ils confirment qu’aucun jugement n’est infaillible. L’autonomie utile naît d’un modèle performant entouré de contrôles explicites.
La reprise doit être observable, bornée et interrompable par l’humain. Visuel généré par IA.
Infographie : cinq états au lieu d’un simple oui ou non
Un système classique vérifie souvent une condition finale : objet présent ou absent, porte ouverte ou fermée. ER 2 tente d’estimer un état intermédiaire. Cette granularité permet de reprendre à l’étape pertinente au lieu de relancer toute la mission.
Le gain est particulièrement important pour les gestes déformables ou continus : nouer un sac, verser, visser ou ranger plusieurs objets. Pourtant, chaque classe de progression reste une estimation. Pour une application industrielle, elle doit être combinée à des capteurs de force, de position ou de présence, plus déterministes.
Infographie photographique : la progression continue devient un signal de décision. Visuel généré par IA.
Timeline : du modèle qui voit au système qui orchestre
Google DeepMind présente Gemini Robotics et Gemini Robotics-ER pour relier raisonnement multimodal et action.
La génération 1.5 met l’accent sur le raisonnement incarné et le transfert entre formes de robots.
ER 1.6 élargit l’accès en préversion et sert de base de comparaison.
ER 2 arrive en préversion avec orchestration, compréhension vidéo et collaboration multi-robots.
L’endpoint ER 1.6 doit être arrêté ; les développeurs sont invités à migrer.
La progression ne va pas seulement vers un robot plus habile, mais vers une coordination entre perception, planification et plusieurs corps. Visuel généré par IA.
Plusieurs robots, une mission partagée
La démonstration la plus stratégique associe Apptronik Apollo 2 et un système Franka à deux bras. Le premier possède une mobilité et une portée de type humanoïde ; le second est optimisé pour la manipulation précise sur table. ER 2 reçoit l’objectif, identifie les capacités disponibles et organise le passage d’un objet d’une machine à l’autre.
Ce fonctionnement ne suppose pas que les robots parlent entre eux comme des personnes. Ils partagent surtout un état sémantique : objet trouvé, étape terminée, zone occupée, prochain outil disponible. L’orchestrateur transforme ces informations en délégation. Un robot peut rechercher une pièce, un autre la positionner, un troisième contrôler le résultat.
La valeur industrielle apparaît dans les flux hétérogènes. Un quadrupède inspecte des couloirs, un bras fixe réalise une opération répétable et un mobile manipulateur transporte. Jusqu’ici, chaque flotte utilise souvent son propre logiciel. Une couche commune pourrait réduire le coût d’intégration, à condition que les interfaces soient stables et que le partage d’état soit fiable.
Le risque est un point de défaillance central. Si l’orchestrateur se trompe sur la disponibilité d’un robot ou sur la position d’un humain, plusieurs machines peuvent attendre, se gêner ou exécuter une mauvaise séquence. Une architecture sérieuse distribue donc les responsabilités : plan global au modèle, prévention des collisions et limites d’effort au niveau local.
Les chiffres de Google : progrès réel, portée limitée
Les résultats publiés couvrent plusieurs dimensions. En détection de succès, ER 2 affiche 87,7 % sur image et 82,4 % sur vidéo. Sur ERQA, un benchmark de questions-réponses incarnées, il atteint 78,5 %. Pour la lecture généralisée d’instruments, il obtient 65,7 %. Google le place en tête des modèles comparés sur ces tests.
Sur la performance d’agent physique, le taux annoncé passe de 48,6 à 60,0 % lorsqu’ER 2 contrôle un VLA réel, de 37,4 à 42,9 % dans le contrôle d’un VLA simulé, et de 63,6 à 74,0 % avec un humain en téléopération. Ces valeurs montrent que le modèle améliore l’orchestration sans résoudre toutes les tâches.
Il faut lire un benchmark comme une carte locale. La sélection des scènes, des instructions, des robots et des critères de réussite influence le score. Un gain mesuré sur une série de tâches ne se transpose pas automatiquement à un entrepôt encombré, à une cuisine ou à un chantier. Des réplications indépendantes et des protocoles publics seront nécessaires.
Le paradoxe est instructif : les chiffres impressionnants de moment finding coexistent avec 42,9 % de succès dans le contrôle simulé du VLA. Une compétence analytique excellente ne garantit pas l’exécution complète. La robotique additionne perception, planification, action, physique et récupération ; le produit des fiabilités peut chuter rapidement.
Infographie photographique : un score isolé ne résume pas la réussite d’une mission physique complète. Visuel généré par IA.
La latence devient une propriété du comportement
Un agent logiciel peut réfléchir quelques secondes avant d’envoyer un courriel. Un robot qui verse de l’eau ne dispose pas du même luxe. Si l’analyse arrive après le débordement, sa justesse théorique devient inutile. Google met donc en avant une version streaming et une détection du moment critique environ quatre fois plus rapide que des catégories de modèles plus lourdes dans son protocole.
La latence totale comprend caméra, encodage, réseau, inférence, retour, appel de fonction et contrôleur. Une moyenne favorable peut cacher une longue traîne : quelques réponses très tardives. Pour la sûreté, il faut mesurer les percentiles élevés et définir ce que le robot fait en cas de silence.
La bonne architecture exécute localement les réflexes : arrêt, limitation de vitesse, évitement immédiat et maintien d’équilibre. Le cloud peut proposer la prochaine étape, pas garantir chaque milliseconde. Un tampon de commandes ou une prédiction peut fluidifier le mouvement, mais doit être annulable dès que la scène change.
Le streaming augmente aussi le volume de données. Envoyer une vidéo continue d’un atelier soulève coût, confidentialité et bande passante. Des filtres en périphérie peuvent réduire la fréquence, masquer des zones ou transmettre seulement des événements. Le compromis entre contexte riche et minimisation des données doit être conçu dès le prototype.
Sûreté : bons scores, interdiction explicite des usages critiques
Google annonce 97,9 % de suivi d’instructions de sûreté et 93,0 % sur une évaluation de proximité humaine à un mètre. Ces scores montrent un effort ciblé. Ils signifient aussi qu’il reste des erreurs dans le jeu de test. Une machine physique ne peut pas traiter 2,1 % de mauvaises décisions de sécurité comme un simple défaut conversationnel.
La fiche modèle officielle demande aux utilisateurs d’exercer leur jugement avant tout déploiement commercial ou public. Elle interdit l’usage des modèles robotiques dans des applications critiques, notamment santé, transport ou situations où une panne peut raisonnablement entraîner blessure, décès ou dommage matériel.
Cette restriction doit apparaître dans tout dossier de projet. Une démonstration avec Spot qui rapporte du pop-corn n’est pas une validation pour une centrale, un hôpital ou un véhicule. Les intégrateurs doivent appliquer analyse de risque, normes machines, arrêt indépendant, validation des zones et supervision humaine.
La sûreté conversationnelle n’est pas la sûreté fonctionnelle. Refuser une instruction dangereuse est utile ; garantir qu’un relais coupe l’énergie lors d’un défaut relève d’une autre discipline. Les deux couches doivent se compléter sans se confondre.
Une frontière de sécurité ne doit jamais dépendre uniquement de l’interprétation d’un modèle génératif. Visuel généré par IA.
Ce que les développeurs peuvent réellement tester
La documentation propose des exemples de raisonnement spatial : pointer des objets, produire des boîtes englobantes, suivre une cible et planifier une trajectoire. Ces sorties structurées peuvent alimenter un simulateur ou une API de robot. Le premier test raisonnable consiste à travailler hors ligne sur des images et vidéos enregistrées.
Ensuite, le développeur peut exposer des outils factices : avancer, saisir, vérifier, demander de l’aide. Le modèle doit construire un plan sans piloter de matériel. Les journaux permettent d’examiner l’ordre des appels, les paramètres et les erreurs. Cette phase détecte les ambiguïtés de description.
La simulation vient avant le robot. Elle permet de tester obstacles, interruptions et échecs reproductibles. Une politique de reprise doit être évaluée avec des limites : deux tentatives, puis arrêt. Le passage au réel s’effectue avec vitesse réduite, zone vide et bouton d’arrêt tenu par un opérateur.
Google publie aussi un SDK Gemini Robotics, appelé Safari SDK dans le dépôt. Il contient des bibliothèques pour journaliser les données, accéder aux modèles et construire des agents. Le dépôt est utile, mais certaines fonctions et certains modèles restent réservés à des testeurs approuvés. Il ne faut donc pas confondre code visible, service public et modèle téléchargeable.
Un modèle accessible n’est pas un modèle ouvert
ER 2 est disponible par API. Les développeurs peuvent l’appeler et lire la documentation, mais ils ne disposent pas des poids pour l’exécuter librement. Cette distinction influence la souveraineté, la prévisibilité des coûts et la pérennité. L’arrêt programmé d’ER 1.6 à la fin août illustre la vitesse du cycle de versions.
Une usine fonctionne dix ou vingt ans ; un endpoint peut changer en quelques mois. Les intégrateurs doivent isoler le fournisseur derrière une interface, versionner les prompts, enregistrer les réponses et prévoir un mode dégradé. Sans abstraction, chaque migration peut modifier subtilement les comportements.
La dépendance n’est pas seulement technique. Les conditions d’utilisation déterminent quelles données peuvent être envoyées et quels usages sont autorisés. Les équipes juridiques, cybersécurité et métier doivent participer dès le début. Un prototype réalisé avec une clé personnelle ne préfigure pas une exploitation industrielle conforme.
Les modèles ouverts comme ceux intégrés à LeRobot offrent une autre forme de contrôle, mais demandent davantage de calcul et de compétences. La stratégie la plus robuste peut être hybride : raisonnement cloud pour les tâches non critiques, modèles locaux pour les fonctions fréquentes et contrôleurs certifiables pour la sécurité.
Les données vidéo : matière première et risque organisationnel
Pour savoir si une tâche avance, le système regarde en continu. Il peut alors capter personnes, badges, écrans, procédés industriels ou intérieurs privés. La minimisation des données devient une propriété de l’architecture : cadrage, floutage, rétention, chiffrement et contrôle d’accès.
Les vidéos sont aussi indispensables au diagnostic. Lorsqu’un robot échoue, l’équipe doit relier l’image, la décision du modèle, l’appel de fonction et l’état des moteurs. Sans horodatage commun, l’analyse devient approximative. Une journalisation complète facilite la sécurité, mais augmente la quantité d’informations sensibles à protéger.
En Europe, le RGPD peut s’appliquer dès qu’une personne identifiable apparaît. Dans le travail, l’usage doit être transparent et proportionné. La caméra d’un robot ne doit pas devenir un outil de surveillance implicite des salariés. Les représentants du personnel et le délégué à la protection des données ont un rôle concret.
Pour la recherche, un jeu de données bien documenté améliore les modèles. Il faut préciser lieu, capteurs, consentement, licences et filtrage. Une collaboration multi-robots ne devrait pas exiger une centralisation illimitée de toutes les scènes.
Quels cas d’usage sont les plus crédibles ?
Inspection et intervention légère
Un quadrupède peut naviguer dans une installation, puis appeler son bras ou un autre robot pour actionner un levier. ER 2 fournit le plan et interprète le résultat. La sûreté locale reste gérée par la plateforme.
Logistique hétérogène
Un robot mobile apporte un bac, un bras fixe prélève et un humanoïde traite les objets hors gabarit. L’orchestrateur répartit selon la disponibilité. Le bénéfice vient de la continuité entre machines, pas de l’apparence humaine.
Laboratoires
Plusieurs instruments peuvent être lus, actionnés et contrôlés. La vision temporelle aide à suivre un protocole. Les applications médicales ou chimiques critiques restent exclues tant que les exigences réglementaires et de sûreté ne sont pas satisfaites.
Assistance à distance
ER 2 peut travailler avec un humain en téléopération : le modèle planifie, l’opérateur réalise une étape délicate, puis l’agent reprend. Le score de 74 % annoncé dans ce mode suggère que l’hybridation peut être plus réaliste que l’autonomie totale.
La place de la France et de l’Europe
Les laboratoires européens disposent de compétences fortes en robotique, perception et sûreté. ER 2 peut servir de composant d’expérimentation, mais les projets publics devraient éviter de construire toutes leurs données autour d’une API unique. Des interfaces compatibles avec ROS 2 et des jeux de données exportables préservent la capacité de comparaison.
France 2030 peut soutenir des bancs d’essai multi-robots où modèles propriétaires et ouverts sont évalués sur les mêmes tâches. Les critères devraient couvrir réussite, latence, consommation, reprise, confidentialité et intervention humaine. Une démonstration spectaculaire ne suffit pas à attribuer un financement.
L’Europe possède un avantage possible : traiter ensemble IA, machine et organisation du travail. Les règles peuvent sembler contraignantes, mais elles forcent à documenter les responsabilités. Pour une technologie qui agit dans l’espace partagé, cette discipline est un actif.
Les PME peuvent commencer par la simulation et des fonctions non critiques. Le coût d’intégration sera plus important que celui de quelques appels API. Il faut budgéter capteurs, interfaces, tests, maintenance et formation, puis mesurer un gain précis : temps de cycle, disponibilité ou réduction d’exposition à un risque.
Conclusion : le robot généraliste sera peut-être une équipe
La vision populaire attend une machine universelle capable de tout faire. Gemini Robotics ER 2 propose une autre trajectoire : un cerveau de haut niveau coordonne plusieurs corps spécialisés. Le quadrupède se déplace, le bras fixe manipule avec précision, l’humanoïde utilise un environnement conçu pour les personnes.
La contribution la plus intéressante n’est donc pas la conversation naturelle. C’est la boucle temporelle : observer, estimer la progression, trouver le moment critique, vérifier le succès et relancer si nécessaire. Elle transforme une suite de gestes en mission suivie.
Les chiffres de Google témoignent d’un progrès, mais aussi des limites. 57,4 % sur la progression et 60 % de succès avec un VLA réel ne justifient aucun déploiement sans contrôles. La fiche modèle exclut d’ailleurs les usages critiques. La maturité se construira par des tests indépendants, des interfaces stables et des responsabilités réparties.
Notre appel : avant de choisir un « cerveau » robotique, dessinez les frontières. Que décide le modèle ? Que garantit le contrôleur ? Quand l’humain reprend-il ? C’est cette cartographie, plus que la vidéo de démonstration, qui dira si l’intelligence incarnée devient réellement utile.
FAQ
Qu’est-ce que Gemini Robotics ER 2 ?
Gemini Robotics ER 2 est un modèle de raisonnement incarné de Google DeepMind. Il analyse du texte, des images, de la vidéo et de l’audio, planifie des tâches physiques et appelle des interfaces de contrôle robotique.
Contrôle-t-il directement les moteurs ?
Pas nécessairement. ER 2 agit comme un orchestrateur de haut niveau et délègue l’exécution motrice à des API, des contrôleurs ou des modèles vision-langage-action adaptés à chaque robot.
Peut-il coordonner plusieurs robots ?
Oui, Google présente des démonstrations où des robots de formes différentes se répartissent une mission et se transmettent des objets grâce à une compréhension sémantique partagée.
Que signifient les scores de 57,4 % et 91,3 % ?
Selon les évaluations publiées par Google, 57,4 % correspond à la classification de l’avancement d’une tâche vidéo et 91,3 % à la détection d’un moment critique. Ce sont des benchmarks du fabricant, pas des garanties universelles.
Le modèle peut-il être utilisé en production ?
Il est proposé en préversion. La fiche modèle demande de la prudence avant tout usage commercial ou public et exclut les applications critiques comme la santé ou le transport.
Comment les développeurs y accèdent-ils ?
Deux endpoints sont disponibles via Gemini API et Google AI Studio : une version standard et une version streaming via Live API pour les flux audio-vidéo continus.
Sources et méthode
Dernière vérification : 24 août 2026. La date de publication du 30 juillet, la disponibilité actuelle en préversion et l’arrêt annoncé d’ER 1.6 au 31 août ont été distingués. Les performances sont attribuées à Google.
- Google — annonce Gemini Robotics ER 2, 30 juillet 2026
- Google DeepMind — capacités et benchmarks ER 2
- Google DeepMind — fiche modèle, usages et limites
- Google AI for Developers — documentation des endpoints robotiques
- Gemini API — notes de version
- Google DeepMind — SDK robotique officiel sur GitHub
Le volume SEO est une estimation éditoriale, non une mesure certifiée. Les visuels sont générés par IA et ne constituent pas des preuves des performances présentées.
Comprendre les robots avant de leur confier une mission
Une analyse claire chaque jour.