Rédaction : Zen, PANews
Le 8 septembre, une start-up américaine appelée Antioch a bouclé un tour de financement de série A de 32 millions de dollars, mené par Greylock, une institution de capital-risque très connue de la Silicon Valley. En ajoutant les 8,5 millions de dollars de seed round réalisés au début de l’année, cette société créée il y a à peine un peu plus d’un an a déjà atteint un total de 40,5 millions de dollars de financement.
La stratégie principale d’Antioch consiste à transposer, sur ordinateur, des robots, capteurs, systèmes logiciels et environnements d’exécution du monde réel, afin d’entraîner, tester et valider à grande échelle les machines dans un monde numérique aussi proche que possible du réel. Dans le monde réel, les défaillances et scénarios extrêmes — coûteux, difficiles à reproduire, voire dangereux — peuvent ici se produire à répétition.
Antioch n’est pas un cas isolé. À mesure que Physical AI devient une nouvelle orientation d’investissement pour l’industrie de l’IA, un groupe d’entreprises centrées sur l’espace 3D, les jumeaux numériques, la simulation physique et les données synthétiques attire à nouveau l’attention des investisseurs. Leur objectif, au fond, est de savoir comment créer dans l’ordinateur un monde suffisamment proche du réel.
Si l’on se contente de regarder les descriptions comme « construire un monde virtuel et reproduire la réalité », on pense facilement à la précédente vague technologique du « métavers ». Mais la différence, c’est qu’Antioch ne cherche pas à faire naviguer les utilisateurs dans le monde virtuel avec des casques VR : cette fois, ce qui a réellement besoin d’« y vivre » à long terme, ce sont les robots.
Le monde virtuel n’a pas disparu ; simplement, cette fois, les « résidents » qui y vivent ont changé.
Les humains n’ont pas emménagé dans le métavers
En août 2021, lors de SIGGRAPH, le plus important congrès mondial en infographie, NVIDIA a annoncé l’expansion de la plateforme Omniverse. À l’époque, la position de NVIDIA était très claire : Omniverse est une suite de plateformes pour la simulation et la collaboration 3D, et elle est en train de « fournir les bases du métavers ».
Son idée centrale consiste à faire entrer dans le même monde virtuel des contenus 3D initialement dispersés dans différents logiciels.
L’une des technologies de base les plus importantes s’appelle USD, c’est-à-dire Universal Scene Description (description universelle de scène). C’est un standard de description de scènes 3D développé initialement par PixAR pour des films d’animation complexes, puis publié en open source. Pour le comprendre simplement : c’est comme une « langue universelle » pour un monde 3D. Dans une scène virtuelle, quels objets s’y trouvent, où ils sont, avec quels matériaux, comment ils bougent et quels sont leurs rapports respectifs — tout peut être organisé à l’aide de USD.
C’est pourquoi, à l’époque, les designers utilisant des logiciels de modélisation 3D comme Blender, les artistes qui fabriquent des textures et des matériaux avec Adobe Substance 3D, ainsi que les ingénieurs utilisant différents logiciels d’ingénierie, peuvent connecter leur contenu via USD à Omniverse et collaborer dans un même monde 3D.
À l’époque, NVIDIA décrivait même ce futur comme un « Internet 3D » : aujourd’hui, Internet connecte des pages web ; demain, Internet pourrait connecter d’innombrables espaces 3D dans lesquels on peut entrer et interagir en temps réel.
La même année, en octobre, Facebook a changé le nom de l’entreprise pour Meta, et le métavers est alors entré dans sa phase la plus effrénée.
Par rapport à NVIDIA, la vision de Zuckerberg est encore plus ambitieuse. Dans son idée, les gens ne se contentent plus d’utiliser Internet en passant par des écrans 2D : ils entrent dans un monde numérique doté d’une sensation d’espace et de « présence », où l’on se réunit, travaille, se divertit, fait ses achats et socialise. À l’époque, Meta estimait qu’au cours des dix prochaines années environ, le Metaverse pourrait couvrir 1 milliard de personnes et créer une économie numérique de très grande échelle.
Le métavers est un panier dans lequel on peut tout mettre. Pendant les deux années qui ont suivi, des récits autour de la VR, de la AR, des personnages numériques, du travail virtuel, des jeux 3D, de la jumeau numérique et des NFT, entre autres actifs numériques, ont tous été rassemblés dans une imagination unifiée d’un « monde numérique à grande échelle ».
Cependant, à ce jour, l’industrie du métavers grand public n’a toujours pas réussi à atteindre son objectif : une grande partie des participants d’alors a déjà quitté discrètement la scène. Meta n’a pas abandonné la VR, la AR et les lunettes intelligentes, mais le Reality Labs qui soutient ces activités reste un investissement de long terme extrêmement coûteux. En 2025, le revenu annuel de Reality Labs était d’environ 2,207 milliards de dollars, tandis que sa perte opérationnelle s’élevait à 19,193 milliards de dollars. Meta prévoit également que, pour 2026, la perte opérationnelle de cette division restera globalement au même niveau qu’en 2025.
En revanche, les changements d’Omniverse sont plus intrigants. Il y a cinq ans, NVIDIA décrivait Omniverse comme « la base du métavers ». Aujourd’hui, la définition donnée par le site officiel de NVIDIA est devenue : « un ensemble de bibliothèques et de microservices pour développer des applications de Physical AI ».
Le récit et le centre de gravité des produits d’Omniverse ont déjà basculé vers la jumeau numérique industriel, la simulation de robots et le développement de la conduite autonome. En dessous, il est relié à toute une série d’outils pour robots et Physical AI : Isaac Sim, Isaac Lab, Cosmos, PhysX, Warp, etc. Sur la même plateforme, l’histoire principale la plus importante a changé.
En réalité, l’histoire de la simulation de robots, des jumeaux numériques industriels et des moteurs physiques remonte bien avant « l’année zéro du métavers ». La précédente vague du métavers n’a fait que rassembler, dans une imagination unifiée d’un « monde numérique à grande échelle », des technologies jusque-là relativement dispersées : modélisation 3D, rendu temps réel, jumeau numérique, collaboration virtuelle, standards 3D ouverts et aussi des NFT.
Ainsi, après la décrue de l’ère du métavers, ces infrastructures n’ont pas disparu. Les gens ont simplement fini par se rendre compte que les robots pourraient avoir davantage besoin d’un monde virtuel que les humains.
Pourquoi les robots ont-ils besoin d’un monde virtuel
Cette année, lors de la conférence GTC, NVIDIA a de nouveau présenté un ensemble très intuitif de « pyramide des données de robots » en expliquant le système d’entraînement des robots humanoïdes.
À la base, il y a les données Internet et humaines en plus grand volume, par exemple des pages web, des images, des vidéos et des traces des comportements humains. Elles sont presque inépuisables : elles peuvent dire au robot quel est le monde et ce que font les gens, mais elles ne fournissent généralement pas les angles des articulations, la force, le toucher et les signaux de contrôle dont les robots ont réellement besoin pour exécuter des actions.
Au sommet de la pyramide, il y a les données de robots réels. En permettant au robot, via téléopération ou fonctionnement autonome, de réellement saisir, manipuler et se déplacer, on obtient des données très proches de la tâche finale — mais c’est aussi le plus coûteux : une machine ne peut au mieux vivre réellement que 24 heures par jour, et cela implique en plus des machines, des sites, des opérateurs et la maintenance des équipements.
Entre les deux, il y a la simulation et les données synthétiques. Elles ne sont pas aussi précises que des données réelles de robots, mais elles peuvent être copiées et produites en parallèle à très grande vitesse dans des GPU. Et contrairement aux vidéos sur Internet, qui ne font que « montrer ce que font les humains », elles peuvent directement générer les actions, états et données de capteurs nécessaires à l’exécution de tâches par les robots.
C’est pourquoi NVIDIA propose d’élargir continuellement, dans la pyramide, la couche de données synthétiques du milieu afin qu’elle devienne une source de données importante pour l’entraînement des robots.
Les avantages et inconvénients de ces trois types de données sont en réalité très simples : les données issues de l’Internet et des humains sont bon marché, avec une échelle immense, mais elles sont encore trop éloignées de l’exécution réelle par les robots ; les données de robots réels sont les plus proches du déploiement effectif des robots et la fidélité physique est la plus élevée, mais elles coûtent cher et sont lentes ; les données de simulation se situent au milieu : une part de réalisme est perdue, mais l’avantage en termes d’échelle, de coût et de contrôlabilité est bien supérieur à celui des machines réelles.
Et c’est aussi précisément pour cela que la simulation devient l’une des directions les plus soutenues par le capital et les grands acteurs comme infrastructure de Physical AI aux États-Unis.
Et le problème qu’elle résout ne se limite pas au volume des données. La caractéristique majeure du monde réel, c’est qu’on ne peut pas le reproduire librement. Si une entreprise a 100 robots, elle ne peut en faire fonctionner 100 en même temps ; un entrepôt ne peut pas, pour entraîner des robots, être entièrement reconfiguré — rayonnages, éclairage, sol et produits — toutes les dix minutes. Mais dans un environnement virtuel, le même robot peut être dupliqué en des milliers, voire des dizaines de milliers de doubles numériques.
Un bras mécanique peut faire face en même temps à 1000 configurations de bureau ; le robot peut changer en permanence la position, la masse et le matériau des objets ; la lumière, la position des caméras, la force de frottement au sol, voire même l’erreur de capteur peuvent être ajustées aléatoirement manuellement. Cette méthode d’entraînement, dans le domaine des robots, s’appelle le Domain Randomization (randomisation du domaine). Elle ne demande pas que le robot apprenne par cœur un environnement virtuel parfait : elle modifie volontairement l’environnement en continu, afin que le modèle apprenne à accomplir la même tâche dans une variété de changements.
Il faut aussi noter que, en plus de données pour « fonctionner normalement », les développeurs doivent gérer des données dans des situations extrêmes. Un capteur vidéo tombe soudainement en panne, le robot glisse brusquement sous ses pieds, ou le robot tombe : ce sont des scénarios qu’il faut pouvoir dépasser. Dans le monde réel, il est impossible de provoquer des accidents chaque jour juste pour collecter des données, mais le monde virtuel, lui, le permet.
C’est aussi une raison que certaines personnes avancent pour dire que le développement de robots ne peut pas dépendre indéfiniment de véritables bancs d’essai. Les tests dans le réel nécessitent en effet du matériel, des sites et du temps d’ingénierie, et des défaillances extrêmes sont difficiles à reproduire. Mais en simulation, une mise à jour du système peut immédiatement être testée en parallèle sur des milliers de conditions.
Le plus gros problème auquel le métavers a été confronté, c’est : pourquoi les gens devraient-ils entrer dans le monde virtuel ? Aujourd’hui, les robots ont apporté une réponse totalement différente. Pour l’humain, le monde virtuel n’est qu’une alternative possible à la vie réelle. Mais pour les robots, le monde virtuel peut devenir un terrain d’entraînement avant d’entrer dans le réel.
Le « monde virtuel » redevient une affaire
Autour de Physical AI, une nouvelle industrie de « l’infrastructure des mondes virtuels » apparaît, et la spécialisation entre ces entreprises devient de plus en plus fine.
En août 2026, NavVis, dont le siège est à Munich en Allemagne, a finalisé un tour de financement de 85 millions de dollars.
NavVis est une société de données spatiales. Son activité principale n’est pas d’entraîner des robots, mais d’utiliser des équipements de scan mobiles pour convertir rapidement des usines, des bâtiments et des infrastructures du monde réel en données 3D très précises. La société a indiqué qu’en seulement un an, en 2025, l’espace réel traité et distribué par ses systèmes dépassait 1 milliard de mètres carrés.
Désormais, NavVis a directement positionné cette activité comme une « base de données » de Physical AI : si, à l’avenir, les robots doivent travailler dans de vraies usines, il faut d’abord permettre à l’ordinateur de savoir avec exactitude à quoi ressemble cette usine.
L’entreprise sud-coréenne NdotLight s’attaque à un autre niveau de problème. NdotLight est une société de données Physical AI spécialisée dans la création d’actifs 3D de simulation de robots. En août de cette année, elle a obtenu un nouveau financement de 15 milliards de wons coréens, soit environ 10,6 millions de dollars, mené par la banque de développement sud-coréenne KDB.
Les modèles 3D ordinaires n’ont généralement besoin que d’être suffisamment réalistes pour être utilisés dans des jeux ou des animations. Mais pour l’entraînement des robots, c’est bien insuffisant : il faut aussi savoir le poids de cette chaise, où les collisions peuvent se produire, la force de frottement des surfaces, et quelles parties peuvent bouger.
Le TRINIX, développé par NdotLight, consiste à transformer du contenu 3D classique en des actifs dits « SimReady », c’est-à-dire des actifs 3D directement utilisables par des simulateurs de robots. En plus de l’apparence, il ajoute des données de qualité, de frottement, de structure des articulations et de collisions, et s’intègre à NVIDIA Omniverse et Isaac Sim. Le problème qu’il résout, c’est comment des objets virtuels ne font pas seulement que reproduire le réel, mais peuvent aussi être utilisés par des robots comme des objets réels.
Le 17 septembre, une autre société, Treble, venue d’Islande, a également obtenu un financement de 18 millions de dollars. Treble est une société de simulation acoustique. Une fois qu’elle construit un espace virtuel, elle peut simuler comment le son se propage dans une pièce, un bâtiment et d’autres environnements, et produire des données acoustiques synthétiques.
À mesure que les robots, les lunettes intelligentes et d’autres équipements Physical AI dépendent de plus en plus du microphone pour comprendre l’environnement réel, les entreprises ont commencé à utiliser leurs technologies de jumeaux numériques acoustiques pour l’entraînement Physical AI. Leur objectif principal est de résoudre, dans le monde virtuel, la manière dont le robot « entend » des sons proches du réel.
En additionnant ces types d’entreprises, on s’aperçoit qu’elles ont déjà commencé à reconstruire un monde numérique, et qu’elles en sont déjà très proches de ce que l’on appelait « monde virtuel » il y a cinq ans. La différence est que le métavers recherche l’immersion, tandis que Physical AI recherche la fiabilité.
C’est là qu’intervient un concept essentiel dans le domaine de la simulation de robots : le Sim-to-Real, c’est-à-dire « de la simulation vers le réel ». On y étudie ce que le robot apprend dans le monde virtuel : une fois de retour dans le monde réel, pourra-t-il encore l’utiliser ?
C’est aussi la raison pour laquelle Isaac Sim de NVIDIA ne met pas seulement l’accent sur le rendu visuel : il inclut aussi la dynamique des corps rigides, les articulations, les collisions et divers capteurs virtuels, afin de réduire au maximum cet écart ; Isaac Lab permet ensuite aux développeurs d’exécuter simultanément de nombreux environnements de robots et d’entraîner en parallèle des stratégies de robots sur GPU.
C’est pourquoi la principale différence entre le monde virtuel des robots d’aujourd’hui et le cœur de nombreux métavers grand public tient au fait que, pour le premier, sa valeur doit finalement être vérifiée dans le monde réel.
Finalement, les humains n’ont pas emménagé dans le métavers comme imaginé à l’époque. Mais les routes tracées pour le monde virtuel n’ont pas été complètement abandonnées : les robots y reviennent et empruntent ce chemin pour retourner au réel.
