Spirit AI : le cerveau des humanoïdes cherche son moment ChatGPT
Un millier d’humains entraînent les gestes de Moz1. Spirit AI promet un tournant logiciel en 2027 : enquête sur une échéance ambitieuse.
Le robot humanoïde sait désormais courir, danser et parfois se relever après une chute. Mais face à une demande aussi banale que « range la cuisine », la démonstration spectaculaire se heurte encore à une réalité moins photogénique : comprendre l’objectif, découper la mission, identifier les objets, agir sans les casser et corriger chaque imprévu. Pour Gao Yang, cofondateur et directeur scientifique de la jeune entreprise chinoise Spirit AI, « le cerveau est effectivement le maillon le plus faible » de la chaîne robotique.
Dans un entretien accordé à Reuters le 17 septembre 2026 et publié le lendemain, le chercheur avance une échéance très précise : vers le milieu de 2027, les cerveaux robotiques pourraient connaître un jalon comparable, selon lui, à celui de GPT-3 pour les modèles de langage. Sa définition est concrète : une personne donne une instruction en langage naturel et la machine construit une suite raisonnable d’actions physiques pour l’exécuter.
Cette formule a un potentiel médiatique évident. Elle ne doit pourtant pas être prise pour l’annonce d’une intelligence générale imminente. « Moment GPT-3 » n’est ni un protocole d’essai partagé ni une norme industrielle. C’est l’analogie d’un dirigeant qui cherche à situer une rupture attendue. L’intérêt du dossier est ailleurs : Spirit AI met en lumière la bataille décisive de la robotique humanoïde, celle des données et des modèles capables de relier les mots au monde réel.
L’entreprise affirme avoir déjà placé des dizaines de Moz1, des humanoïdes sur roues, sur des lignes de production de CATL et de JD.com. Elle dit atteindre 90 % de réussite sur des tâches simples dans un salon structuré et mobiliser environ mille prestataires pour enregistrer des gestes en maison ou en usine. Ces chiffres proviennent de Spirit AI et de l’entretien Reuters ; aucun rapport public indépendant ne permet encore d’en vérifier la portée complète.
Ce que Spirit AI annonce vraiment
La date compte. Reuters a interrogé Gao Yang le 17 septembre, puis publié son article le 18. L’événement n’est donc pas le lancement d’un nouveau robot ce jour-là, mais une prise de position stratégique très récente sur la trajectoire de l’intelligence incarnée. Spirit AI avait déjà présenté Moz1 auparavant ; l’information nouvelle est l’objectif logiciel fixé à mi-2027 et le détail de sa méthode de collecte.
Gao décrit un système qui recevrait une instruction en langage naturel, raisonnerait sur le but et produirait une suite d’actions physiques cohérente. Cela suppose plusieurs étages. Le robot doit reconnaître la scène, localiser son corps, comprendre les objets, estimer les conséquences d’un geste, choisir une trajectoire puis réagir si la réalité diffère de sa prévision.
Un assistant textuel peut générer une mauvaise phrase sans renverser une casserole. Un humanoïde engage de la masse, de la force et de l’énergie au contact de personnes. Le mot « raisonnable » contient donc une exigence de sécurité : la bonne action n’est pas seulement celle qui atteint le but, mais celle qui le fait avec une force limitée, une marge de collision et une capacité d’arrêt.
« Le cerveau est effectivement le maillon le plus faible », a déclaré Gao Yang à Reuters. Cette phrase résume le déplacement actuel de la compétition : après les articulations et la locomotion, l’avantage se joue dans les modèles, les données et l’évaluation.
Une analogie, pas une équivalence
GPT-3 a marqué l’histoire des modèles de langage par son changement d’échelle et ses capacités de généralisation. Transposer cette référence à la robotique suggère qu’un même modèle pourrait apprendre de nombreuses tâches et répondre à des consignes nouvelles. Mais les deux domaines ne disposent pas des mêmes volumes de données ni des mêmes critères de réussite.
Le web offre des milliards de phrases. Les gestes robotiques de qualité sont coûteux à enregistrer : il faut des capteurs, des caméras, un environnement instrumenté, une personne qui démontre l’action et souvent une vérification manuelle. Chaque robot possède en outre une géométrie, des moteurs et des limites différentes. Un modèle brillant sur Moz1 ne se transfère pas automatiquement à un autre corps.
Mille humains pour apprendre aux machines
Spirit AI indique s’appuyer sur environ mille prestataires répartis en Chine pour collecter des données dans des logements et des usines. Dans son centre de formation de Pékin, des personnes reproduiraient notamment l’ouverture d’un réfrigérateur, le déverrouillage d’un coffre ou la découpe de légumes. Des capteurs enregistrent le mouvement et les interactions afin de transformer chaque démonstration en exemple d’apprentissage.
Ce dispositif rappelle une réalité souvent masquée par le vocabulaire de l’autonomie : avant qu’un robot agisse seul, de nombreux humains exécutent, corrigent, annotent et nettoient ses données. La valeur ne réside pas seulement dans la quantité de gestes, mais dans leur diversité. Une poignée de porte dure, un emballage souple ou un couteau légèrement décalé produisent des situations très différentes.
Pourquoi préférer le réel à la simulation ?
Spirit AI revendique une forte dépendance aux données réelles. En simulation, une porte possède souvent une charnière parfaite, un objet une friction stable et un tissu un comportement simplifié. Dans le monde physique, la poignée accroche, le sac se déforme, le capuchon résiste et la caméra est éblouie. Ces imperfections constituent précisément les informations dont un modèle a besoin pour apprendre à récupérer après une erreur.
La simulation conserve pourtant des avantages majeurs : elle permet de multiplier les essais, de provoquer des incidents sans danger et de varier rapidement les décors. L’opposition entre réel et virtuel est donc trop simple. La stratégie la plus robuste pourrait combiner préentraînement simulé, démonstrations humaines, essais sur robot et retour des déploiements industriels.
La boucle d’apprentissage revendiquée
Humain démonstrateur→2
Capteurs et vidéo→3
Modèle d’action→4
Essai sur Moz1→5
Erreur réinjectée
Le schéma résume la logique générale ; Spirit AI ne publie pas l’intégralité de sa chaîne de traitement.
Moz1 : le corps qui porte la promesse
Spirit AI présente Moz1 comme un humanoïde à contrôle intégral de force. Le terme signifie que le système cherche à mesurer et réguler l’effort dans les articulations, au lieu de viser seulement une position. Cette capacité est essentielle pour manipuler un objet fragile, entrer en contact avec une surface et limiter les conséquences d’une collision.
Les unités mentionnées par Reuters reposent sur une base mobile à roues. Ce choix sacrifie la capacité à monter les escaliers, mais réduit l’un des problèmes les plus difficiles des bipèdes : maintenir l’équilibre à chaque pas. Dans une usine au sol plat, les roues peuvent offrir davantage de stabilité, d’autonomie énergétique et de charge utile. La forme humanoïde demeure pertinente au niveau du torse et des bras, conçus pour des postes pensés pour des humains.
L’entreprise affirme que des dizaines de Moz1 sont présents sur des lignes de CATL, géant des batteries, et de JD.com, groupe de commerce et de logistique qui compte aussi parmi ses investisseurs. Cette présence constitue un signal commercial important. Elle ne permet pas, à elle seule, de conclure à un déploiement rentable ou autonome.
Les chiffres absents sont aussi importants
Pour juger une installation industrielle, il faudrait connaître le nombre d’heures actives, le taux de réussite sans intervention, la cadence, la disponibilité, les arrêts d’urgence, les pièces remplacées et le coût par opération. Ni l’interview ni la page publique du constructeur ne fournissent un tableau complet de ces indicateurs.
« Déployé » peut désigner un essai limité, une station pilote ou une production régulière. Sans définition, le mot reste ambigu. PRÉSENCE HUMANOÏDE considère donc les dizaines d’unités comme un déploiement rapporté par l’entreprise et Reuters, pas comme une validation indépendante de performance.
Le piège du taux de réussite de 90 %
Spirit AI annonce environ 90 % de réussite sur des tâches simples dans un salon structuré. Le chiffre semble élevé, mais il faut comprendre son dénominateur. Quelles tâches ? Combien d’essais ? Les objets changent-ils de place ? Une intervention humaine remet-elle la scène à zéro ? Un échec est-il une action incomplète ou un incident dangereux ?
Dans une séquence de dix étapes, réussir chacune avec une probabilité de 90 % ne donne qu’environ 35 % de chances de terminer toute la mission si les erreurs sont indépendantes. Cette illustration n’est pas une mesure du Moz1 ; elle montre pourquoi un bon score local peut s’effondrer dans une tâche longue. Le robot domestique doit enchaîner les gestes et récupérer sans repartir du début.
Un environnement structuré réduit les variations : objets attendus, éclairage contrôlé, passages dégagés. C’est une étape logique pour entraîner et comparer un système. Mais un logement réel contient des enfants, des animaux, des objets inconnus et des consignes incomplètes. Passer de l’un à l’autre est le cœur du problème de généralisation.
De la fondation au rendez-vous de 2027
Ce qu’un « cerveau robotique » doit réellement savoir faire
Le mot cerveau donne l’impression d’un module unique que l’on pourrait installer dans n’importe quelle machine. La réalité ressemble davantage à un empilement coordonné. La perception transforme les caméras, microphones et capteurs de force en représentation de la scène. Le langage relie une phrase à un objectif. La planification découpe cet objectif. Le contrôle traduit chaque sous-tâche en mouvements. Un superviseur surveille les risques et décide d’arrêter.
Le progrès décisif ne consistera pas seulement à améliorer chaque brique. Il faudra que le système sache transmettre l’incertitude. Si la vision hésite entre une tasse en verre et un récipient en plastique, la planification doit ralentir le geste. Si la main sent une résistance inattendue, elle doit interrompre sa trajectoire et réévaluer la scène.
Les modèles vision-langage-action tentent précisément d’apprendre cette continuité à partir d’images, de mots et de commandes. Leur ambition est de remplacer de nombreux programmes spécialisés par une politique plus générale. La difficulté est d’obtenir une flexibilité élevée sans perdre la prévisibilité exigée par la sécurité industrielle.
Du langage au geste sûr
Une consigne simple pour l’humain mobilise plusieurs modèles et boucles de contrôle chez le robot.
Le bouchon de bouteille, juge impitoyable
Gao reconnaît que les robots restent en difficulté devant des gestes fins comme dévisser un bouchon et face à des tâches jamais rencontrées. Cet exemple concentre une série de problèmes : détecter les stries du capuchon, estimer le sens de rotation, ajuster la pression sans écraser la bouteille et comprendre si le filetage a commencé à céder.
L’échec est parfois invisible à la caméra. La main semble bien placée, mais la force est trop faible ou légèrement désaxée. D’où l’importance du contrôle de force mis en avant pour Moz1. La vision dit où agir ; le toucher indique ce qui se passe réellement au contact.
Une démonstration réussie ne suffit pas. Il faut mesurer la répétabilité sur des bouteilles de tailles, matières, températures et niveaux de remplissage différents. Un système généraliste devrait aussi reconnaître quand la force nécessaire devient dangereuse et demander de l’aide.
Usine d’abord, maison beaucoup plus tard
Spirit AI anticipe une première adoption industrielle dans un horizon d’un à deux ans, puis des services commerciaux autour de deux ans. Le foyer demanderait beaucoup plus de temps : Gao évoque environ huit ans, soit autour de 2034. Cette chronologie paraît cohérente avec la structure des environnements, mais elle reste une prévision commerciale.
L’usine offre des sols réguliers, des postes balisés, des objets standardisés et des procédures répétables. Les erreurs peuvent être contenues par des barrières, un arrêt d’urgence et un opérateur formé. Une entreprise peut également accepter un robot spécialisé dans trois gestes si son taux de disponibilité est suffisant.
La maison inverse ces conditions. Les espaces sont étroits, les objets changent de place et les personnes ne portent pas d’équipement de sécurité. Le robot doit comprendre des habitudes implicites, manipuler des biens de valeur et intervenir près d’enfants ou d’animaux. Il doit être économique, silencieux, facile à entretenir et digne de confiance.
Le paradoxe de la polyvalence
Plus une machine accepte de tâches, plus le nombre de situations imprévues augmente. Un robot industriel spécialisé peut être validé sur un poste fixe. Un assistant domestique doit être évalué sur une distribution presque ouverte. La polyvalence qui justifie la forme humanoïde rend donc la certification plus difficile.
Une progression réaliste passera probablement par des domaines fermés : déplacement de bacs, rangement standardisé, nettoyage de zones définies, accueil ou réassort. Chaque déploiement fournira des erreurs réelles qui enrichiront les modèles. L’autonomie générale émergera, si elle émerge, d’une accumulation de compétences vérifiées.
La donnée humaine pose aussi des questions humaines
Collecter des gestes dans des logements et des usines soulève des questions de consentement, de confidentialité et de travail. Une vidéo domestique peut révéler des visages, des documents, une organisation familiale ou des habitudes. Les capteurs corporels enregistrent des mouvements susceptibles d’identifier une personne.
Spirit AI n’a pas détaillé publiquement, dans les sources consultées, l’ensemble des modalités de rémunération, d’anonymisation, de conservation et de retrait des données de ses prestataires. L’absence d’information ne prouve pas l’absence de règles ; elle empêche simplement le public d’en évaluer la robustesse.
La qualité du travail compte également. Si les démonstrateurs sont pressés, mal équipés ou insuffisamment formés, les gestes enregistrés peuvent devenir incohérents. Les entreprises de robotique auront besoin d’une profession de formateurs de robots, avec des protocoles, des droits et des critères de qualité comparables à ceux de la donnée industrielle.
670 millions de dollars pour gagner la course des modèles
Selon Reuters, Spirit AI a levé plus de 670 millions de dollars depuis sa création en 2024 et atteint une valorisation d’environ 20 milliards de yuans, soit 2,9 milliards de dollars. L’entreprise compterait environ 300 salariés. Ces montants illustrent l’intensité capitalistique de l’intelligence incarnée : il faut financer le matériel, les sites, la collecte, le calcul et les essais physiques.
JD.com est cité à la fois comme investisseur et terrain de déploiement. Cette proximité peut accélérer l’accès aux cas d’usage et aux données. Elle oblige aussi à distinguer une validation par un client indépendant d’une expérimentation menée dans l’écosystème financier de l’entreprise.
Le financement ne garantit pas la percée. Il donne du temps pour accumuler des données et recruter, mais il crée une pression pour annoncer des échéances ambitieuses. Le rendez-vous de mi-2027 devra donc être jugé sur des démonstrations reproductibles, pas sur la seule analogie avec l’histoire des modèles de langage.
Comment vérifier le rendez-vous de 2027
Un test crédible devrait commencer par des consignes jamais vues sous leur formulation exacte. Les objets et leur position devraient varier. Le robot devrait accomplir une tâche longue, expliquer brièvement son plan, détecter une impossibilité et demander de l’aide plutôt que d’improviser dangereusement.
Les résultats devraient inclure le nombre total d’essais, les échecs, les interventions humaines et les temps d’exécution. Une vidéo montée ne suffit pas. Les évaluateurs auraient intérêt à garder une partie des scénarios secrète pour limiter l’optimisation spécifique à la démonstration.
Enfin, il faudrait comparer plusieurs corps. Si l’intelligence est réellement générale, une partie significative du modèle devrait se transférer d’un robot à l’autre avec un ajustement limité. Cette étape sépare un cerveau robotique réutilisable d’un logiciel performant sur une seule plateforme.
Trois scénarios après l’annonce
1. Le jalon est atteint dans un domaine limité
Spirit AI démontre en 2027 une compréhension naturelle solide sur un ensemble de tâches industrielles ou domestiques structurées. Le résultat est important, même s’il ne couvre pas le monde ouvert. C’est le scénario le plus compatible avec les données disponibles.
2. La généralisation progresse, mais le matériel limite l’usage
Le modèle planifie correctement, tandis que les mains, batteries, capteurs et coûts de maintenance empêchent un déploiement massif. Le « cerveau » cesse d’être le seul maillon faible ; la fiabilité globale devient le verrou.
3. L’analogie GPT-3 reste une formule
Les démonstrations nécessitent des scènes préparées et de nombreuses reprises. L’entreprise repousse l’échéance ou redéfinit le jalon. Ce résultat ne signifierait pas l’échec de toute la robotique, mais montrerait que les données physiques ne se mettent pas à l’échelle comme le texte.
Ce que cette course change pour l’Europe et la France
L’enjeu ne consiste pas seulement à fabriquer un corps humanoïde. La propriété des données, des modèles et des outils d’évaluation déterminera qui contrôle la couche la plus rentable. Une entreprise européenne pourrait acheter des moteurs et des capteurs, puis rester dépendante d’un cerveau entraîné ailleurs.
La France possède des compétences en robotique, mathématiques, vision et systèmes critiques. Elle peut se différencier par des jeux de données industriels documentés, des bancs d’essai indépendants et une sécurité conçue dès l’entraînement. Les secteurs de l’aéronautique, de l’énergie, de la logistique et de la santé offrent des environnements où la précision et la traçabilité comptent davantage que le spectacle.
Le risque serait de répondre aux annonces chinoises ou américaines par des slogans équivalents. L’avantage durable viendra d’évaluations reproductibles : taux d’intervention, durée moyenne entre pannes, consommation, force maximale en contact humain et transfert entre robots. La confiance peut devenir une technologie exportable.
FAQ
Qu’est-ce que Spirit AI ?
Spirit AI est une entreprise chinoise d’intelligence incarnée fondée en 2024. Elle développe des modèles de contrôle et le robot humanoïde sur roues Moz1.
Qu’est-ce que le robot Moz1 ?
Moz1 est présenté par Spirit AI comme un humanoïde à contrôle intégral de force. Les exemplaires évoqués dans l’interview de Reuters sont des robots sur roues déployés sur des lignes de CATL et JD.com.
Spirit AI a-t-elle atteint un niveau comparable à GPT-3 ?
Non. Son cofondateur Gao Yang prévoit un jalon analogue vers le milieu de 2027. Il s’agit d’une comparaison prospective, pas d’un benchmark reconnu ni d’un résultat déjà atteint.
Que signifie le taux de réussite de 90 % ?
Selon l’entreprise, ses robots réussissent environ 90 % de tâches simples dans un salon structuré. Ce chiffre ne décrit ni un logement imprévisible ni une autonomie générale et n’a pas été audité publiquement.
Pourquoi Spirit AI privilégie-t-elle les données réelles ?
L’entreprise estime que les contacts, objets déformables et erreurs humaines sont difficiles à reproduire fidèlement en simulation. Elle collecte donc des démonstrations à domicile, en usine et dans un centre de formation.
Quand ces robots arriveront-ils dans les maisons ?
Gao Yang évoque environ huit ans pour une présence domestique plus crédible, soit autour de 2034. C’est une estimation du dirigeant, pas un calendrier commercial garanti.
Les Moz1 sont-ils réellement autonomes en usine ?
Reuters rapporte des dizaines de Moz1 sur des lignes de CATL et JD.com, mais aucun indicateur public complet ne précise le taux d’intervention humaine, la cadence, la disponibilité ou le retour sur investissement.
Quel est le principal obstacle au robot humanoïde ?
Pour Spirit AI, le cerveau logiciel est le maillon faible. En pratique, la difficulté combine perception, raisonnement, planification, contrôle du mouvement, sécurité et adaptation aux situations inédites.
Conclusion : le moment ChatGPT ne se décrète pas
Spirit AI formule une thèse convaincante : la robotique humanoïde n’est plus seulement bloquée par le corps. Les machines deviennent assez stables et assez sensibles pour que l’attention se déplace vers le cerveau qui relie langage, perception et action. Les mille collecteurs de données et les Moz1 rapportés en usine donnent à cette stratégie une matérialité.
Mais l’objectif de mi-2027 reste une prévision du cofondateur. Le taux de 90 % concerne des tâches simples dans un environnement structuré. Les dizaines de robots déployés ne s’accompagnent pas encore de mesures publiques complètes. Et l’horizon domestique évoqué autour de 2034 rappelle l’ampleur du chemin.
Le véritable « moment GPT-3 » de la robotique arrivera lorsque plusieurs observateurs pourront donner une consigne nouvelle à un robot, déplacer un objet et constater la même capacité de replanning sûr. Ce jour-là, le progrès ne tiendra pas dans une vidéo parfaite, mais dans la répétition d’un comportement utile au milieu des imperfections ordinaires.
Sources et bibliographie
- Reuters — entretien avec Gao Yang sur le jalon 2027, entretien du 17 septembre, publication du 18 septembre 2026.
- Spirit AI — présentation officielle du robot Moz1, source fabricant consultée le 19 septembre 2026.
- Google DeepMind — apprentissage entre plusieurs types de robots, 3 octobre 2023, pour le contexte scientifique.
- Open X-Embodiment — jeu de données et modèles multi-robots, publication scientifique, 2023.
- International Federation of Robotics — demande mondiale de robots industriels, contexte sectoriel.
Recevez nos analyses robotiques
Une analyse claire chaque jour.