PRÉSENCE HUMANOÏDE
Newsletter de référence sur la robotique et l’intelligence artificielle
Homme filmant une tâche de cuisine pour transmettre le geste à un robot humanoïde générique
Dossier · Intelligence physique

Nos gestes deviennent l’école des robots

Avec Index, Figure AI veut transformer des millions de vidéos tournées par des humains en une mémoire mondiale du travail physique.

28 août 2026 · 19 minutes de lecture

Un robot ne peut pas apprendre à faire un lit, débarrasser une table ou ranger un atelier uniquement en lisant Internet. Il lui faut voir le geste, ses hésitations, les objets qui glissent, les pièces qui changent de place et les milliers de manières humaines d’atteindre le même résultat. Le 25 août 2026, Figure AI a dévoilé Index, une application qui rémunère des personnes pour filmer ces tâches réelles et constituer ce que l’entreprise présente comme le plus vaste ensemble de données physiques destiné aux robots.

L’annonce déplace la compétition humanoïde. La bataille ne porte plus seulement sur la force des moteurs, la dextérité des mains ou le nombre de robots sortant d’une usine. Elle concerne désormais la capacité à capturer le monde quotidien à une échelle comparable à celle qui a nourri les grands modèles de langage. Figure affirme avoir recueilli plus de 16 millions de vidéos en quatre mois, auprès de 264 000 téléchargements dans 108 pays, avec 44 000 utilisateurs actifs chaque semaine. Ces chiffres sont spectaculaires. Ils sont aussi publiés par l’entreprise elle-même et n’ont pas encore fait l’objet d’un audit indépendant accessible.

16 M+vidéos revendiquées
44 000actifs hebdomadaires
15 M$versés
1 Md$+dépenses prévues

Index, une application grand public au cœur de la robotique

Le principe est simple en apparence. Une personne choisit une tâche, l’exécute dans une maison ou un lieu de travail et enregistre la séquence selon les consignes de l’application. Cuisine, ménage, lessive, rangement, service en restauration, mise en rayon, opérations logistiques ou entretien mécanique peuvent entrer dans le corpus. Figure appelle ces participants des « Creators » et indique leur avoir versé 15 millions de dollars depuis le lancement discret du dispositif.

La collecte ne repose donc pas d’abord sur une flotte de robots. Elle utilise le corps humain comme capteur et comme démonstrateur. Chaque vidéo documente une relation entre une intention, un environnement, des objets et une suite de mouvements. À grande échelle, ce matériau peut aider un modèle à reconnaître les régularités d’une tâche, mais aussi ses variantes : une poignée différente, un torchon plus lourd, une étagère plus haute ou une méthode personnelle de plier un vêtement.

Figure annonce que l’application traite trente minutes de vidéo chaque seconde, soit l’équivalent déclaré de 4,9 années de travail humain déposées chaque jour. Pour 1 000 heures collectées, l’entreprise dénombre en moyenne 373 tâches distinctes, 1 146 objets manipulés et 116 environnements. Cette diversité est le cœur de sa thèse : la généralisation ne viendrait pas seulement d’un meilleur algorithme, mais d’une exposition massive aux différences du monde réel.

« Les données nécessaires pour faire évoluer un robot généraliste n’existent pas sur Internet : elles doivent venir du monde réel. » — Figure AI, annonce Index, 25 août 2026.
Personne filmant le pliage d’une chemise bleue sous le regard d’une main robotique
Un geste ordinaire devient une séquence d’apprentissage : vue, action, objets et résultat. Visuel éditorial généré.

Pourquoi la robotique manque encore de données

Les modèles de langage ont bénéficié de textes, de pages web, de livres, de code et de conversations disponibles en quantité gigantesque. Les robots rencontrent un problème différent. Une vidéo classique montre rarement tout ce qu’un système doit savoir pour agir. La caméra change de plan, les mains sortent du cadre, l’effort appliqué reste invisible et le résultat n’est pas toujours relié à l’intention initiale. Une recette filmée pour divertir n’est pas automatiquement une démonstration exploitable pour commander un bras.

L’apprentissage physique exige aussi une correspondance entre le corps du démonstrateur et celui du robot. Une main humaine possède des tendons, une peau sensible, une compliance naturelle et une géométrie différente d’une pince robotique. Copier littéralement une trajectoire ne suffit pas. Le modèle doit extraire le sens fonctionnel du geste — tenir sans écraser, pousser jusqu’au contact, aligner avant d’insérer — puis le traduire dans les capacités mécaniques de la machine.

Le problème des situations rares

Un laboratoire peut enregistrer des milliers de démonstrations propres d’une même tâche. Il aura plus de mal à reproduire la diversité des logements, des outils, des cultures et des habitudes. Or l’échec arrive souvent dans ces cas inattendus : l’assiette est ovale, le tiroir frotte, l’étiquette masque la prise ou un objet imprévu bloque la trajectoire. Index cherche précisément à industrialiser la découverte de ces situations rares.

La diversité géographique peut être un avantage décisif si elle est réelle et correctement équilibrée. Des vidéos issues de plus de cent pays exposent potentiellement le modèle à des dimensions, matériaux et organisations très variés. Mais un grand nombre de pays ne garantit pas une représentation équitable. Les contributeurs disposant d’un smartphone récent, d’une connexion rapide et de temps disponible peuvent dominer l’échantillon. La rémunération et les règles de sélection façonnent donc silencieusement le robot futur.

La chaîne Index en cinq filtres

Qualité technique
filtrer
Fraude
auditer
Doublons
écarter
Diversité
équilibrer
Contexte
annoter

Représentation éditoriale du pipeline décrit par Figure ; les proportions ne constituent pas des métriques publiées.

Du téléphone au modèle Helix

Figure décrit cinq étapes de traitement : contrôle automatique de la qualité visuelle et sémantique, détection de fraude, suppression des séquences trop similaires, rééquilibrage par tâche et annotation hiérarchique. Des analystes humains contrôlent des échantillons lorsque des comportements suspects apparaissent. Les vidéos sont également transformées en représentations mathématiques afin d’identifier les doublons au-delà d’une simple comparaison de fichiers.

Cette architecture répond à une règle connue de l’apprentissage automatique : plus de données n’aident que si l’information supplémentaire apporte une variation utile. Un million de vidéos presque identiques peut renforcer un comportement étroit. Une collection plus petite mais riche en angles, objets, erreurs et stratégies peut mieux préparer le modèle à une situation nouvelle. L’enjeu réel d’Index n’est donc pas d’atteindre un compteur impressionnant ; c’est de mesurer la nouveauté et la qualité marginale de chaque séquence.

Les données doivent ensuite être reliées au système Helix de Figure, qui associe perception, langage et action. Le passage reste techniquement difficile. Une vidéo humaine fournit des observations et une trajectoire apparente, mais pas nécessairement les forces, la profondeur précise, le toucher ou l’état interne du robot. Des méthodes de transfert doivent convertir la démonstration en objectif atteignable par une machine différente. Figure affirme observer des progrès de généralisation en interne, sans avoir encore publié les détails complets permettant une évaluation indépendante.

Équipe diversifiée contrôlant des vidéos d’apprentissage robotique dans un centre de données
Filtrer, dédupliquer, équilibrer et annoter : la donnée physique exige une infrastructure autant qu’une caméra. Visuel éditorial généré.

Une économie mondiale du geste

Index crée une nouvelle forme de travail numérique. Les plateformes de données ont longtemps payé des internautes pour classer des images, transcrire des voix ou évaluer des réponses. Ici, la contribution mobilise le corps et l’espace privé. Le travailleur ne décrit plus seulement le monde : il montre comment agir en son sein. Sa cuisine, son atelier ou son restaurant deviennent une extension distribuée du laboratoire de robotique.

La rémunération peut ouvrir un revenu complémentaire et diversifier les jeux de données. Elle soulève néanmoins des questions classiques de plateforme : comment le prix d’une tâche est-il fixé ? Combien de vidéos sont rejetées sans paiement ? Quels droits sont cédés ? Un contributeur participe-t-il seulement à un corpus, ou aide-t-il directement à automatiser une activité professionnelle similaire à la sienne ? Les réponses doivent être compréhensibles avant l’enregistrement, pas cachées dans des conditions longues.

Le chiffre de 15 millions de dollars versés signale que Figure ne traite pas la collecte comme une expérience marginale. Son engagement annoncé de plus d’un milliard de dollars sur douze mois, mêlant données et calcul, place Index au centre de sa stratégie. Il ne précise cependant pas quelle part reviendra aux contributeurs, aux infrastructures, au calcul d’entraînement ou aux équipes internes. Cette répartition déterminera l’impact économique réel du programme.

Quand la maison devient un site de captation

Filmer chez soi produit une diversité difficile à obtenir en laboratoire, mais expose des informations sensibles. Visages, voix, photos familiales, documents, habitudes, adresse visible par une fenêtre ou détails d’un lieu de travail peuvent apparaître accidentellement. Même si la tâche principale semble anodine, l’arrière-plan raconte parfois beaucoup. Une politique responsable doit prévoir des avertissements concrets, un floutage efficace, une suppression accessible et un contrôle strict des usages secondaires.

Le consentement ne concerne pas uniquement la personne qui tient la caméra. Un collègue, un client, un enfant ou un voisin peut entrer dans le champ. Les entreprises participantes doivent protéger leurs secrets, leurs procédures et les données personnelles de leurs clients. L’application devra donc distinguer clairement les environnements autorisés et fournir des mécanismes de vérification. L’échelle mondiale rend cette gouvernance plus complexe, car les règles de protection et les attentes culturelles diffèrent.

Helix est présenté

Figure décrit un modèle vision-langage-action destiné au contrôle généraliste de ses humanoïdes.

Transfert humain-robot

Le projet Go-Big formalise l’ambition d’un préentraînement à grande échelle à partir de données humaines.

L’application démarre discrètement

Figure lance une collecte en mode furtif pour tester débit, qualité et diversité.

Index sort de l’ombre

264 000 téléchargements, 16 millions de vidéos et 15 millions de dollars versés sont revendiqués.

Le passage à l’échelle

Figure annonce plus d’un milliard de dollars de dépenses en données et calcul, avec un objectif de croissance par cent.

Suite du dossier

Un pari comparable au préentraînement des grands modèles

La stratégie de Figure rappelle l’histoire récente de l’intelligence artificielle générative : rassembler un corpus immense, entraîner un modèle général, puis l’adapter à des tâches précises. Mais la robotique impose un coût d’erreur supérieur. Une phrase maladroite peut être corrigée ; une mauvaise prise peut briser un objet ou blesser quelqu’un. Le système doit associer généralisation et contraintes physiques, avec une connaissance explicite de ce qu’il ne sait pas faire.

Le passage à l’échelle ne sera donc pas une simple répétition de la recette du texte. Les données doivent refléter l’action dans le temps, les contacts et les conséquences. Elles doivent aussi être compatibles avec plusieurs générations de matériel. Si une démonstration n’est exploitable que par une seule main robotique, sa valeur diminue lorsque la mécanique évolue. Figure devra apprendre des représentations suffisamment abstraites pour survivre aux changements de capteurs, d’articulations et de dimensions.

De la vidéo au service robotique

Démonstration humaine → filtrage → représentation du geste → transfert au robot → test réel → correction

La boucle n’est utile que si les erreurs du robot retournent vers le système de données. Index fournit l’amont ; les déploiements doivent produire le signal de validation.

Ce qui permettrait de vérifier la promesse

Pour évaluer Index, il faudra davantage que le nombre de vidéos. Figure pourrait publier des courbes montrant l’amélioration d’une tâche selon la quantité et la diversité des données, sur des environnements jamais vus pendant l’entraînement. Le protocole devrait préciser le taux de réussite, le nombre d’essais, la part de téléopération, la vitesse, les interventions humaines et les types d’échec. Des comparaisons avec des modèles entraînés sans Index rendraient l’apport du corpus mesurable.

La robustesse est le test décisif. Un robot peut ranger une cuisine utilisée durant l’entraînement et échouer lorsque les portes, la vaisselle ou l’éclairage changent. Un benchmark crédible séparerait strictement les foyers de collecte et ceux d’évaluation. Il introduirait des perturbations contrôlées : objet déplacé, consigne ambiguë, personne traversant la scène ou outil manquant. Le système devrait non seulement réussir, mais savoir demander de l’aide lorsqu’il rencontre une situation trop incertaine.

Une documentation des données renforcerait également la confiance. Elle pourrait décrire les zones géographiques, familles de tâches, taux de rejet, mécanismes de consentement, durée de conservation et procédures de suppression. Les chercheurs ne demandent pas nécessairement l’accès au corpus propriétaire pour analyser sa conception. Des statistiques détaillées et des audits externes permettraient déjà de distinguer une infrastructure rigoureuse d’un simple récit de volume.

La course mondiale aux données robotiques

Figure n’est pas seule à considérer la donnée comme le goulet d’étranglement. Les fabricants collectent des heures dans leurs usines pilotes, utilisent la téléopération, construisent des laboratoires reproduisant des logements et génèrent des trajectoires en simulation. Des projets ouverts cherchent parallèlement à mutualiser des jeux de données entre robots. Chaque approche échange contrôle, diversité, coût et confidentialité.

La simulation offre une échelle presque illimitée et des annotations parfaites, mais elle peine à reproduire toutes les subtilités du monde réel : frottement d’un tissu, transparence d’un verre, déformation d’un emballage. Les flottes physiques produisent des données proches du robot final, mais nécessitent des machines coûteuses. Les vidéos humaines sont abondantes et variées, tout en créant un problème de transfert entre deux corps. L’avantage pourrait revenir aux acteurs capables de combiner ces sources dans une boucle cohérente.

Index possède une autre dimension stratégique : le réseau. Plus la plateforme attire de contributeurs, plus elle rencontre de situations rares ; plus son modèle progresse, plus l’entreprise peut financer la collecte. Si la qualité suit, cette boucle peut devenir difficile à rattraper. Elle peut aussi se retourner si les contributeurs se lassent, si les paiements baissent ou si les inquiétudes de confidentialité limitent les environnements accessibles.

Robot humanoïde générique rangeant des assiettes dans une cuisine pendant qu’un homme observe
Le test ultime n’est pas de reproduire une vidéo, mais d’adapter le geste à un logement jamais rencontré. Visuel éditorial généré.

Travail, automatisation et partage de la valeur

Le contributeur d’Index occupe une position paradoxale. Il est payé pour montrer une tâche que le robot pourrait un jour automatiser. Cette relation n’est pas entièrement nouvelle : les ouvriers ont longtemps participé à la conception des procédures et machines qui transforment leur métier. La différence tient à l’échelle mondiale et au caractère invisible du lien entre une vidéo individuelle et un modèle utilisé ailleurs.

Une gouvernance équitable devrait rendre ce lien lisible. Le participant doit savoir à quelles fins générales ses données peuvent servir, pendant combien de temps et selon quels droits. La rémunération devrait refléter la difficulté, le risque, la rareté et la qualité de la tâche, pas seulement sa durée. Des mécanismes de recours sont nécessaires en cas de rejet ou d’utilisation contestée. Enfin, la plateforme devrait éviter que la compétition internationale ne tire le prix du geste vers le bas.

Pour les entreprises qui accueillent la collecte, la question dépasse le droit à l’image. Une vidéo peut révéler un agencement, une cadence, une méthode ou un équipement propriétaire. Les contrats devront préciser la propriété du corpus et interdire les usages incompatibles. Dans les secteurs réglementés, la captation peut être impossible sans anonymisation forte ou environnement reconstitué.

Pourquoi ce projet pourrait compter davantage que le prochain robot

Un nouveau modèle humanoïde attire immédiatement l’attention par sa silhouette. Une infrastructure de données est moins visible, mais peut influencer toutes les générations suivantes. Si Index réussit, sa valeur ne résidera pas dans une application grand public isolée. Elle résidera dans une cartographie dynamique des gestes humains, reliée à un système capable de transférer ces gestes vers des machines.

Cette perspective explique l’ampleur du budget annoncé. Dépenser plus d’un milliard de dollars en données et calcul ne garantit pas le résultat, mais indique où Figure situe son avantage futur. L’entreprise semble considérer le matériel comme une condition nécessaire et la donnée comme le multiplicateur. Un robot produit en série sans intelligence utile reste un stock coûteux ; un modèle très capable sans corps disponible reste une démonstration logicielle. La stratégie cherche à faire progresser les deux ensemble.

Le projet peut toutefois échouer de plusieurs façons. Les vidéos peuvent être trop éloignées des capteurs du robot, les annotations trop bruitées, le transfert insuffisant ou les coûts de contrôle trop élevés. Les tâches collectées peuvent surreprésenter ce qui est facile à filmer plutôt que ce qui crée de la valeur. Les performances internes peuvent plafonner malgré l’augmentation du volume. C’est pourquoi les prochaines publications techniques compteront davantage que les compteurs de téléchargement.

Ce que l’Europe devrait retenir

L’Europe dispose d’une tradition forte en robotique, en protection des données et en dialogue social. Elle pourrait transformer ces exigences en avantage si elle construit des corpus physiques traçables, consentis et adaptés à ses industries. Les programmes publics pourraient financer des espaces de collecte partagés, des standards d’annotation et des évaluations indépendantes, au lieu de laisser chaque entreprise reconstruire seule une infrastructure coûteuse.

Les données issues de la maintenance, du bâtiment, de la logistique, de l’agriculture ou du soin ne peuvent pas toutes être captées de la même manière. Une stratégie européenne devrait associer fabricants, travailleurs, chercheurs, assureurs et autorités. Le but ne serait pas seulement d’accumuler des heures, mais de définir les droits, la sécurité et les bénéfices collectifs. Une donnée plus chère mais fiable et juridiquement exploitable peut valoir davantage qu’un volume opaque.

La France possède des laboratoires et entreprises capables de contribuer à cette approche. Le défi sera de relier les démonstrations à des déploiements documentés, puis de faire revenir les enseignements du terrain vers l’entraînement. Le progrès de la robotique ne dépend pas seulement du modèle le plus médiatisé. Il dépend de la qualité de cette boucle d’apprentissage.

Les questions encore sans réponse

Figure n’a pas communiqué publiquement tous les détails du contrat proposé aux contributeurs, la distribution exacte des rémunérations, la proportion de vidéos acceptées, la durée de conservation ou les performances quantitatives de Helix attribuables à Index. L’entreprise indique qu’elle partagera prochainement davantage de résultats sur la généralisation. Tant que ces éléments manquent, l’annonce doit être comprise comme une stratégie ambitieuse appuyée par des chiffres internes, non comme la preuve d’un robot généraliste déjà acquis.

Il faudra également savoir comment Index gère les demandes de suppression après entraînement. Retirer un fichier d’un stockage est différent d’effacer son influence sur un modèle. Cette difficulté, déjà centrale pour les modèles génératifs, devient plus sensible lorsque les données montrent un domicile ou un savoir-faire professionnel. La transparence technique et juridique devra progresser avec le volume.

FAQ

Qu’est-ce que Figure AI Index ?

Index est une application de Figure AI qui rémunère des contributeurs pour enregistrer des vidéos de tâches physiques destinées à entraîner le système robotique Helix.

Combien de vidéos Figure affirme-t-elle avoir collectées ?

Figure annonce plus de 16 millions de vidéos collectées en quatre mois, auprès d’utilisateurs répartis dans 108 pays. Ce total provient de l’entreprise et n’est pas présenté comme audité indépendamment.

Pourquoi les vidéos d’Internet ne suffisent-elles pas ?

Elles montrent souvent le résultat sans fournir une vue continue des mains, du contexte, des contacts et des erreurs nécessaires à l’apprentissage précis d’un geste physique.

Ces données garantissent-elles un robot généraliste ?

Non. Le volume est une condition possible du progrès, mais la qualité, les modèles, les capteurs, le matériel, l’évaluation et la sécurité restent déterminants.

Quels sont les principaux risques ?

Ils concernent la vie privée, le consentement des tiers, la propriété des données, la rémunération, les biais et la vérification indépendante des résultats annoncés.

Conclusion : le robot apprend désormais chez nous

Index marque un changement de perspective. Jusqu’ici, le robot humanoïde était surtout observé depuis l’extérieur : on évaluait sa marche, sa main ou sa vitesse. Figure propose désormais d’en faire un élève mondial, nourri par les gestes de milliers de personnes dans des environnements ordinaires. La promesse est puissante parce qu’elle vise le principal défaut des démonstrations actuelles : leur incapacité à absorber toute la variété du réel.

Mais une école ne vaut pas uniquement par le nombre de leçons. Elle vaut par leur qualité, leur diversité, les droits de ceux qui les produisent et les progrès mesurables de l’élève. Les 16 millions de vidéos revendiquées constituent un départ impressionnant. La véritable preuve arrivera lorsqu’un robot rencontrera une cuisine, un atelier ou un objet qu’il n’a jamais vu — et saura agir correctement, prudemment, sans humain caché derrière la scène.

Sources

  1. Figure AI, « Introducing Index », 25 août 2026 — annonce, chiffres de collecte et description du pipeline.
  2. Figure AI News — chronologie de Helix, Figure 03 et du transfert humain-robot.
  3. Figure AI, financement Series C, 16 septembre 2025 — contexte financier et stratégie de déploiement.
  4. Figure AI, présentation de Helix, 20 février 2025 — architecture vision-langage-action.
PRÉSENCE HUMANOÏDE — Newsletter robotique & intelligence artificielle