PRÉSENCE HUMANOÏDENewsletter de référence sur la robotique et l’intelligence artificielle
Robot humanoïde sur roues dans un appartement-laboratoire sous le regard de deux ingénieurs
Image éditoriale originale générée par IA. Elle ne représente pas le robot Moz1 réel.
INTELLIGENCE INCARNÉE · HUMANOÏDES · CHINE

Spirit AI : le cerveau des humanoïdes cherche son moment ChatGPT

Un millier d’humains entraînent les gestes de Moz1. Spirit AI promet un tournant logiciel en 2027 : enquête sur une échéance ambitieuse.

19 septembre 2026 · 28 min de lecture

Le robot humanoïde sait désormais courir, danser et parfois se relever après une chute. Mais face à une demande aussi banale que « range la cuisine », la démonstration spectaculaire se heurte encore à une réalité moins photogénique : comprendre l’objectif, découper la mission, identifier les objets, agir sans les casser et corriger chaque imprévu. Pour Gao Yang, cofondateur et directeur scientifique de la jeune entreprise chinoise Spirit AI, « le cerveau est effectivement le maillon le plus faible » de la chaîne robotique.

Dans un entretien accordé à Reuters le 17 septembre 2026 et publié le lendemain, le chercheur avance une échéance très précise : vers le milieu de 2027, les cerveaux robotiques pourraient connaître un jalon comparable, selon lui, à celui de GPT-3 pour les modèles de langage. Sa définition est concrète : une personne donne une instruction en langage naturel et la machine construit une suite raisonnable d’actions physiques pour l’exécuter.

Cette formule a un potentiel médiatique évident. Elle ne doit pourtant pas être prise pour l’annonce d’une intelligence générale imminente. « Moment GPT-3 » n’est ni un protocole d’essai partagé ni une norme industrielle. C’est l’analogie d’un dirigeant qui cherche à situer une rupture attendue. L’intérêt du dossier est ailleurs : Spirit AI met en lumière la bataille décisive de la robotique humanoïde, celle des données et des modèles capables de relier les mots au monde réel.

L’entreprise affirme avoir déjà placé des dizaines de Moz1, des humanoïdes sur roues, sur des lignes de production de CATL et de JD.com. Elle dit atteindre 90 % de réussite sur des tâches simples dans un salon structuré et mobiliser environ mille prestataires pour enregistrer des gestes en maison ou en usine. Ces chiffres proviennent de Spirit AI et de l’entretien Reuters ; aucun rapport public indépendant ne permet encore d’en vérifier la portée complète.

À retenir. Spirit AI ne prétend pas avoir déjà créé un « ChatGPT des robots ». Elle prévoit pour 2027 un saut dans la capacité à traduire une consigne orale en séquence d’actions. Le défi reste de généraliser hors des décors préparés.

Ce que Spirit AI annonce vraiment

La date compte. Reuters a interrogé Gao Yang le 17 septembre, puis publié son article le 18. L’événement n’est donc pas le lancement d’un nouveau robot ce jour-là, mais une prise de position stratégique très récente sur la trajectoire de l’intelligence incarnée. Spirit AI avait déjà présenté Moz1 auparavant ; l’information nouvelle est l’objectif logiciel fixé à mi-2027 et le détail de sa méthode de collecte.

Gao décrit un système qui recevrait une instruction en langage naturel, raisonnerait sur le but et produirait une suite d’actions physiques cohérente. Cela suppose plusieurs étages. Le robot doit reconnaître la scène, localiser son corps, comprendre les objets, estimer les conséquences d’un geste, choisir une trajectoire puis réagir si la réalité diffère de sa prévision.

Un assistant textuel peut générer une mauvaise phrase sans renverser une casserole. Un humanoïde engage de la masse, de la force et de l’énergie au contact de personnes. Le mot « raisonnable » contient donc une exigence de sécurité : la bonne action n’est pas seulement celle qui atteint le but, mais celle qui le fait avec une force limitée, une marge de collision et une capacité d’arrêt.

« Le cerveau est effectivement le maillon le plus faible », a déclaré Gao Yang à Reuters. Cette phrase résume le déplacement actuel de la compétition : après les articulations et la locomotion, l’avantage se joue dans les modèles, les données et l’évaluation.

Une analogie, pas une équivalence

GPT-3 a marqué l’histoire des modèles de langage par son changement d’échelle et ses capacités de généralisation. Transposer cette référence à la robotique suggère qu’un même modèle pourrait apprendre de nombreuses tâches et répondre à des consignes nouvelles. Mais les deux domaines ne disposent pas des mêmes volumes de données ni des mêmes critères de réussite.

Le web offre des milliards de phrases. Les gestes robotiques de qualité sont coûteux à enregistrer : il faut des capteurs, des caméras, un environnement instrumenté, une personne qui démontre l’action et souvent une vérification manuelle. Chaque robot possède en outre une géométrie, des moteurs et des limites différentes. Un modèle brillant sur Moz1 ne se transfère pas automatiquement à un autre corps.

Mille humains pour apprendre aux machines

Spirit AI indique s’appuyer sur environ mille prestataires répartis en Chine pour collecter des données dans des logements et des usines. Dans son centre de formation de Pékin, des personnes reproduiraient notamment l’ouverture d’un réfrigérateur, le déverrouillage d’un coffre ou la découpe de légumes. Des capteurs enregistrent le mouvement et les interactions afin de transformer chaque démonstration en exemple d’apprentissage.

Ce dispositif rappelle une réalité souvent masquée par le vocabulaire de l’autonomie : avant qu’un robot agisse seul, de nombreux humains exécutent, corrigent, annotent et nettoient ses données. La valeur ne réside pas seulement dans la quantité de gestes, mais dans leur diversité. Une poignée de porte dure, un emballage souple ou un couteau légèrement décalé produisent des situations très différentes.

Techniciens équipés de capteurs réalisant des tâches domestiques devant un robot humanoïde sur roues
Reconstitution éditoriale originale générée par IA. Elle illustre une collecte de données et ne représente pas le centre de Spirit AI.

Pourquoi préférer le réel à la simulation ?

Spirit AI revendique une forte dépendance aux données réelles. En simulation, une porte possède souvent une charnière parfaite, un objet une friction stable et un tissu un comportement simplifié. Dans le monde physique, la poignée accroche, le sac se déforme, le capuchon résiste et la caméra est éblouie. Ces imperfections constituent précisément les informations dont un modèle a besoin pour apprendre à récupérer après une erreur.

La simulation conserve pourtant des avantages majeurs : elle permet de multiplier les essais, de provoquer des incidents sans danger et de varier rapidement les décors. L’opposition entre réel et virtuel est donc trop simple. La stratégie la plus robuste pourrait combiner préentraînement simulé, démonstrations humaines, essais sur robot et retour des déploiements industriels.

La boucle d’apprentissage revendiquée

1
Humain démonstrateur
2
Capteurs et vidéo
3
Modèle d’action
4
Essai sur Moz1
5
Erreur réinjectée

Le schéma résume la logique générale ; Spirit AI ne publie pas l’intégralité de sa chaîne de traitement.

Moz1 : le corps qui porte la promesse

Spirit AI présente Moz1 comme un humanoïde à contrôle intégral de force. Le terme signifie que le système cherche à mesurer et réguler l’effort dans les articulations, au lieu de viser seulement une position. Cette capacité est essentielle pour manipuler un objet fragile, entrer en contact avec une surface et limiter les conséquences d’une collision.

Les unités mentionnées par Reuters reposent sur une base mobile à roues. Ce choix sacrifie la capacité à monter les escaliers, mais réduit l’un des problèmes les plus difficiles des bipèdes : maintenir l’équilibre à chaque pas. Dans une usine au sol plat, les roues peuvent offrir davantage de stabilité, d’autonomie énergétique et de charge utile. La forme humanoïde demeure pertinente au niveau du torse et des bras, conçus pour des postes pensés pour des humains.

L’entreprise affirme que des dizaines de Moz1 sont présents sur des lignes de CATL, géant des batteries, et de JD.com, groupe de commerce et de logistique qui compte aussi parmi ses investisseurs. Cette présence constitue un signal commercial important. Elle ne permet pas, à elle seule, de conclure à un déploiement rentable ou autonome.

Robot humanoïde sur roues manipulant un composant dans une usine de modules de batteries sous surveillance humaine
Reconstitution éditoriale originale générée par IA, sans logo ni représentation d’un site CATL ou JD.com.

Les chiffres absents sont aussi importants

Pour juger une installation industrielle, il faudrait connaître le nombre d’heures actives, le taux de réussite sans intervention, la cadence, la disponibilité, les arrêts d’urgence, les pièces remplacées et le coût par opération. Ni l’interview ni la page publique du constructeur ne fournissent un tableau complet de ces indicateurs.

« Déployé » peut désigner un essai limité, une station pilote ou une production régulière. Sans définition, le mot reste ambigu. PRÉSENCE HUMANOÏDE considère donc les dizaines d’unités comme un déploiement rapporté par l’entreprise et Reuters, pas comme une validation indépendante de performance.

Le piège du taux de réussite de 90 %

Spirit AI annonce environ 90 % de réussite sur des tâches simples dans un salon structuré. Le chiffre semble élevé, mais il faut comprendre son dénominateur. Quelles tâches ? Combien d’essais ? Les objets changent-ils de place ? Une intervention humaine remet-elle la scène à zéro ? Un échec est-il une action incomplète ou un incident dangereux ?

Dans une séquence de dix étapes, réussir chacune avec une probabilité de 90 % ne donne qu’environ 35 % de chances de terminer toute la mission si les erreurs sont indépendantes. Cette illustration n’est pas une mesure du Moz1 ; elle montre pourquoi un bon score local peut s’effondrer dans une tâche longue. Le robot domestique doit enchaîner les gestes et récupérer sans repartir du début.

Un environnement structuré réduit les variations : objets attendus, éclairage contrôlé, passages dégagés. C’est une étape logique pour entraîner et comparer un système. Mais un logement réel contient des enfants, des animaux, des objets inconnus et des consignes incomplètes. Passer de l’un à l’autre est le cœur du problème de généralisation.

De la fondation au rendez-vous de 2027

2024Création de Spirit AI et début de ses levées de capitaux.
2025–2026Présentation de Moz1 et premiers déploiements industriels rapportés.
17 septembre 2026Entretien de Gao Yang avec Reuters à Pékin.
18 septembre 2026Publication de l’objectif d’un jalon « GPT-3 » vers mi-2027.
Mi-2027Échéance annoncée pour convertir une consigne naturelle en séquence d’actions plus générale.
Vers 2034Horizon domestique évoqué par Gao, sans garantie commerciale.

Ce qu’un « cerveau robotique » doit réellement savoir faire

Le mot cerveau donne l’impression d’un module unique que l’on pourrait installer dans n’importe quelle machine. La réalité ressemble davantage à un empilement coordonné. La perception transforme les caméras, microphones et capteurs de force en représentation de la scène. Le langage relie une phrase à un objectif. La planification découpe cet objectif. Le contrôle traduit chaque sous-tâche en mouvements. Un superviseur surveille les risques et décide d’arrêter.

Le progrès décisif ne consistera pas seulement à améliorer chaque brique. Il faudra que le système sache transmettre l’incertitude. Si la vision hésite entre une tasse en verre et un récipient en plastique, la planification doit ralentir le geste. Si la main sent une résistance inattendue, elle doit interrompre sa trajectoire et réévaluer la scène.

Les modèles vision-langage-action tentent précisément d’apprendre cette continuité à partir d’images, de mots et de commandes. Leur ambition est de remplacer de nombreux programmes spécialisés par une politique plus générale. La difficulté est d’obtenir une flexibilité élevée sans perdre la prévisibilité exigée par la sécurité industrielle.

Du langage au geste sûr

« Range la cuisine »Percevoir la scèneDécouper le butAgir et sentirVérifier ou arrêter

Une consigne simple pour l’humain mobilise plusieurs modèles et boucles de contrôle chez le robot.

Le bouchon de bouteille, juge impitoyable

Gao reconnaît que les robots restent en difficulté devant des gestes fins comme dévisser un bouchon et face à des tâches jamais rencontrées. Cet exemple concentre une série de problèmes : détecter les stries du capuchon, estimer le sens de rotation, ajuster la pression sans écraser la bouteille et comprendre si le filetage a commencé à céder.

L’échec est parfois invisible à la caméra. La main semble bien placée, mais la force est trop faible ou légèrement désaxée. D’où l’importance du contrôle de force mis en avant pour Moz1. La vision dit où agir ; le toucher indique ce qui se passe réellement au contact.

Main robotique tentant de dévisser le bouchon d’une bouteille sous le regard d’une ingénieure
Reconstitution éditoriale originale générée par IA. La scène illustre une difficulté de motricité fine évoquée par Gao Yang.

Une démonstration réussie ne suffit pas. Il faut mesurer la répétabilité sur des bouteilles de tailles, matières, températures et niveaux de remplissage différents. Un système généraliste devrait aussi reconnaître quand la force nécessaire devient dangereuse et demander de l’aide.

Usine d’abord, maison beaucoup plus tard

Spirit AI anticipe une première adoption industrielle dans un horizon d’un à deux ans, puis des services commerciaux autour de deux ans. Le foyer demanderait beaucoup plus de temps : Gao évoque environ huit ans, soit autour de 2034. Cette chronologie paraît cohérente avec la structure des environnements, mais elle reste une prévision commerciale.

L’usine offre des sols réguliers, des postes balisés, des objets standardisés et des procédures répétables. Les erreurs peuvent être contenues par des barrières, un arrêt d’urgence et un opérateur formé. Une entreprise peut également accepter un robot spécialisé dans trois gestes si son taux de disponibilité est suffisant.

La maison inverse ces conditions. Les espaces sont étroits, les objets changent de place et les personnes ne portent pas d’équipement de sécurité. Le robot doit comprendre des habitudes implicites, manipuler des biens de valeur et intervenir près d’enfants ou d’animaux. Il doit être économique, silencieux, facile à entretenir et digne de confiance.

Le paradoxe de la polyvalence

Plus une machine accepte de tâches, plus le nombre de situations imprévues augmente. Un robot industriel spécialisé peut être validé sur un poste fixe. Un assistant domestique doit être évalué sur une distribution presque ouverte. La polyvalence qui justifie la forme humanoïde rend donc la certification plus difficile.

Une progression réaliste passera probablement par des domaines fermés : déplacement de bacs, rangement standardisé, nettoyage de zones définies, accueil ou réassort. Chaque déploiement fournira des erreurs réelles qui enrichiront les modèles. L’autonomie générale émergera, si elle émerge, d’une accumulation de compétences vérifiées.

La donnée humaine pose aussi des questions humaines

Collecter des gestes dans des logements et des usines soulève des questions de consentement, de confidentialité et de travail. Une vidéo domestique peut révéler des visages, des documents, une organisation familiale ou des habitudes. Les capteurs corporels enregistrent des mouvements susceptibles d’identifier une personne.

Spirit AI n’a pas détaillé publiquement, dans les sources consultées, l’ensemble des modalités de rémunération, d’anonymisation, de conservation et de retrait des données de ses prestataires. L’absence d’information ne prouve pas l’absence de règles ; elle empêche simplement le public d’en évaluer la robustesse.

La qualité du travail compte également. Si les démonstrateurs sont pressés, mal équipés ou insuffisamment formés, les gestes enregistrés peuvent devenir incohérents. Les entreprises de robotique auront besoin d’une profession de formateurs de robots, avec des protocoles, des droits et des critères de qualité comparables à ceux de la donnée industrielle.

670 millions de dollars pour gagner la course des modèles

Selon Reuters, Spirit AI a levé plus de 670 millions de dollars depuis sa création en 2024 et atteint une valorisation d’environ 20 milliards de yuans, soit 2,9 milliards de dollars. L’entreprise compterait environ 300 salariés. Ces montants illustrent l’intensité capitalistique de l’intelligence incarnée : il faut financer le matériel, les sites, la collecte, le calcul et les essais physiques.

JD.com est cité à la fois comme investisseur et terrain de déploiement. Cette proximité peut accélérer l’accès aux cas d’usage et aux données. Elle oblige aussi à distinguer une validation par un client indépendant d’une expérimentation menée dans l’écosystème financier de l’entreprise.

Le financement ne garantit pas la percée. Il donne du temps pour accumuler des données et recruter, mais il crée une pression pour annoncer des échéances ambitieuses. Le rendez-vous de mi-2027 devra donc être jugé sur des démonstrations reproductibles, pas sur la seule analogie avec l’histoire des modèles de langage.

Comment vérifier le rendez-vous de 2027

Un test crédible devrait commencer par des consignes jamais vues sous leur formulation exacte. Les objets et leur position devraient varier. Le robot devrait accomplir une tâche longue, expliquer brièvement son plan, détecter une impossibilité et demander de l’aide plutôt que d’improviser dangereusement.

Les résultats devraient inclure le nombre total d’essais, les échecs, les interventions humaines et les temps d’exécution. Une vidéo montée ne suffit pas. Les évaluateurs auraient intérêt à garder une partie des scénarios secrète pour limiter l’optimisation spécifique à la démonstration.

Enfin, il faudrait comparer plusieurs corps. Si l’intelligence est réellement générale, une partie significative du modèle devrait se transférer d’un robot à l’autre avec un ajustement limité. Cette étape sépare un cerveau robotique réutilisable d’un logiciel performant sur une seule plateforme.

Le test décisif. Donner au robot un objectif nouveau, modifier discrètement la scène, puis mesurer s’il détecte l’écart, replannifie et s’arrête en sécurité lorsqu’il ne sait plus.

Trois scénarios après l’annonce

1. Le jalon est atteint dans un domaine limité

Spirit AI démontre en 2027 une compréhension naturelle solide sur un ensemble de tâches industrielles ou domestiques structurées. Le résultat est important, même s’il ne couvre pas le monde ouvert. C’est le scénario le plus compatible avec les données disponibles.

2. La généralisation progresse, mais le matériel limite l’usage

Le modèle planifie correctement, tandis que les mains, batteries, capteurs et coûts de maintenance empêchent un déploiement massif. Le « cerveau » cesse d’être le seul maillon faible ; la fiabilité globale devient le verrou.

3. L’analogie GPT-3 reste une formule

Les démonstrations nécessitent des scènes préparées et de nombreuses reprises. L’entreprise repousse l’échéance ou redéfinit le jalon. Ce résultat ne signifierait pas l’échec de toute la robotique, mais montrerait que les données physiques ne se mettent pas à l’échelle comme le texte.

Ce que cette course change pour l’Europe et la France

L’enjeu ne consiste pas seulement à fabriquer un corps humanoïde. La propriété des données, des modèles et des outils d’évaluation déterminera qui contrôle la couche la plus rentable. Une entreprise européenne pourrait acheter des moteurs et des capteurs, puis rester dépendante d’un cerveau entraîné ailleurs.

La France possède des compétences en robotique, mathématiques, vision et systèmes critiques. Elle peut se différencier par des jeux de données industriels documentés, des bancs d’essai indépendants et une sécurité conçue dès l’entraînement. Les secteurs de l’aéronautique, de l’énergie, de la logistique et de la santé offrent des environnements où la précision et la traçabilité comptent davantage que le spectacle.

Le risque serait de répondre aux annonces chinoises ou américaines par des slogans équivalents. L’avantage durable viendra d’évaluations reproductibles : taux d’intervention, durée moyenne entre pannes, consommation, force maximale en contact humain et transfert entre robots. La confiance peut devenir une technologie exportable.

FAQ

Qu’est-ce que Spirit AI ?

Spirit AI est une entreprise chinoise d’intelligence incarnée fondée en 2024. Elle développe des modèles de contrôle et le robot humanoïde sur roues Moz1.

Qu’est-ce que le robot Moz1 ?

Moz1 est présenté par Spirit AI comme un humanoïde à contrôle intégral de force. Les exemplaires évoqués dans l’interview de Reuters sont des robots sur roues déployés sur des lignes de CATL et JD.com.

Spirit AI a-t-elle atteint un niveau comparable à GPT-3 ?

Non. Son cofondateur Gao Yang prévoit un jalon analogue vers le milieu de 2027. Il s’agit d’une comparaison prospective, pas d’un benchmark reconnu ni d’un résultat déjà atteint.

Que signifie le taux de réussite de 90 % ?

Selon l’entreprise, ses robots réussissent environ 90 % de tâches simples dans un salon structuré. Ce chiffre ne décrit ni un logement imprévisible ni une autonomie générale et n’a pas été audité publiquement.

Pourquoi Spirit AI privilégie-t-elle les données réelles ?

L’entreprise estime que les contacts, objets déformables et erreurs humaines sont difficiles à reproduire fidèlement en simulation. Elle collecte donc des démonstrations à domicile, en usine et dans un centre de formation.

Quand ces robots arriveront-ils dans les maisons ?

Gao Yang évoque environ huit ans pour une présence domestique plus crédible, soit autour de 2034. C’est une estimation du dirigeant, pas un calendrier commercial garanti.

Les Moz1 sont-ils réellement autonomes en usine ?

Reuters rapporte des dizaines de Moz1 sur des lignes de CATL et JD.com, mais aucun indicateur public complet ne précise le taux d’intervention humaine, la cadence, la disponibilité ou le retour sur investissement.

Quel est le principal obstacle au robot humanoïde ?

Pour Spirit AI, le cerveau logiciel est le maillon faible. En pratique, la difficulté combine perception, raisonnement, planification, contrôle du mouvement, sécurité et adaptation aux situations inédites.

Conclusion : le moment ChatGPT ne se décrète pas

Spirit AI formule une thèse convaincante : la robotique humanoïde n’est plus seulement bloquée par le corps. Les machines deviennent assez stables et assez sensibles pour que l’attention se déplace vers le cerveau qui relie langage, perception et action. Les mille collecteurs de données et les Moz1 rapportés en usine donnent à cette stratégie une matérialité.

Mais l’objectif de mi-2027 reste une prévision du cofondateur. Le taux de 90 % concerne des tâches simples dans un environnement structuré. Les dizaines de robots déployés ne s’accompagnent pas encore de mesures publiques complètes. Et l’horizon domestique évoqué autour de 2034 rappelle l’ampleur du chemin.

Le véritable « moment GPT-3 » de la robotique arrivera lorsque plusieurs observateurs pourront donner une consigne nouvelle à un robot, déplacer un objet et constater la même capacité de replanning sûr. Ce jour-là, le progrès ne tiendra pas dans une vidéo parfaite, mais dans la répétition d’un comportement utile au milieu des imperfections ordinaires.

Appel à l’action. Face à la prochaine annonce de cerveau humanoïde, demandez quatre preuves : le nombre d’essais, la variété des scènes, le taux d’intervention humaine et la réaction à un événement inédit.

Sources et bibliographie

Recevez nos analyses robotiques

Une analyse claire chaque jour.

PRÉSENCE HUMANOÏDE — Newsletter robotique & intelligence artificielle