Que s'est-il passé
TechCrunch rapporte que les entreprises d'IA physique attirent des investissements majeurs mais n'ont pas encore produit de robots aux capacités étendues et capables d'effectuer un travail précieux de manière fiable. Les développeurs présents à la conférence Actuate ont décrit le manque de données de formation de haute qualité, les exigences informatiques lourdes et les désaccords non résolus sur la question de savoir si les entreprises de robotique devraient co-concevoir du matériel et de l'IA ou créer des modèles plus indépendants du matériel.
TechCrunch rapporte que l'IA physique est devenue l'un des domaines les plus en vogue de l'investissement en capital-risque, les entreprises appliquant à la robotique des techniques associées à de grands modèles de langage. Le média relie l’enthousiasme du secteur à Unitree, décrit comme le premier fabricant chinois de robots, qui a atteint une valorisation de 66 milliards de dollars après son introduction en bourse avant de perdre près de la moitié de cette valeur au cours de la semaine du rapport. TechCrunch affirme que les analystes ont souligné un problème central : les capacités physiques des robots s’améliorent, mais leur capacité à effectuer un travail créateur de valeur reste limitée. Le rapport ne confirme pas de manière indépendante la valorisation, l’ampleur de la baisse ou l’identité des analystes au-delà du récit fourni par TechCrunch.
TechCrunch rapporte qu'Actuate, une conférence destinée aux développeurs créant des systèmes d'IA pour robots, comptait 1 500 participants et représentait trois fois sa taille de 2023, selon l'organisateur Foxglove. L’événement a révélé à la fois l’enthousiasme et l’inquiétude face à une « crise des données robotiques » : une pénurie de données de haute qualité pour les modèles de formation. Le rapport indique que les robots généralisés capables d’effectuer n’importe quelle tâche restent encore loin, tandis que l’apprentissage de bout en bout pour des tâches spécifiques n’a pas encore produit de performances commerciales fiables. Les développeurs tentent donc d’adapter les pratiques des laboratoires d’IA pionniers, notamment en collectant des données plus variées, en expérimentant des méthodes de formation et en concevant de meilleurs environnements d’apprentissage par renforcement.
Un désaccord majeur concerne la mesure dans laquelle l’intelligence robotique doit être étroitement liée à un matériel et à des secteurs particuliers. TechCrunch rapporte que le PDG de Wayve, Alex Kendall, est favorable à commencer par des véhicules autonomes, où les entreprises peuvent collecter des données de conduite pertinentes et où l'objectif principal est d'éviter les contacts plutôt que de manipuler l'environnement. Il a déclaré au média que l'infrastructure de données, les opérations de simulation et d'apprentissage automatique pourraient être partagées entre les modes de réalisation, tandis que les modèles du monde physique nécessiteraient une certaine spécialisation. Théophile Gervet, PDG de Genesis AI, a adopté le point de vue opposé, déclarant à TechCrunch que le secteur était trop tôt pour une « stratégie cérébrale » distincte et que le matériel et l'IA devraient être co-conçus. Le rapport indique également qu'Uber et Wayve ont lancé des laboratoires de robotique axés sur les humanoïdes, tandis que Tesla poursuit une direction similaire avec Optimus.
Détails de la source: techcrunch.com ↗
Pourquoi c'est important
Le rapport suggère que les progrès de la robotique dépendent moins d'un seul modèle généraliste que de l'infrastructure de données, de la simulation, de l'expérience de déploiement et de tâches commerciales soigneusement choisies. Cela met également en évidence une tension entre la création de produits restreints qui génèrent dès maintenant des revenus et des données et la recherche de systèmes à usage général qui pourraient éventuellement les remplacer.
Le rapport est important car il décrit un goulot d'étranglement pratique dans l'IA physique : un modèle performant doit relier la perception, la planification et le mouvement aux conditions désordonnées du monde réel. Dans l’IA textuelle, l’ajout de données et de calculs peut améliorer les performances sans nécessiter qu’une machine interagisse physiquement avec son environnement. Les robots doivent plutôt faire face aux changements d’objets, de surfaces, d’éclairage, de lectures de capteurs et aux contraintes de sécurité. Le récit de TechCrunch indique que le secteur n’a pas encore trouvé de moyen largement fiable de transformer ces contributions en travail utile.
La stratégie commerciale décrite par TechCrunch est un compromis. Les entreprises qui se concentrent sur une tâche précise peuvent placer leurs robots dans des environnements réels plus rapidement, générant ainsi des revenus et collectant des données de déploiement. Le rapport cite comme exemples les travaux de ferme solaire de Gritt, les déploiements industriels d’Agility et les excavatrices autonomes de Bedrock. Mais les données spécifiques à une tâche ne sont peut-être pas suffisamment diversifiées pour produire un modèle à usage général. Gervet a déclaré à TechCrunch qu'une entreprise étroite construite sur un modèle de première génération pourrait éventuellement être dépassée par une entreprise dotée d'un modèle général plus solide. À l’inverse, un robot polyvalent qui ne réussit qu’environ 80 % du temps peut ne pas être suffisamment utile pour les clients.
Le récit montre également pourquoi l’infrastructure peut avoir autant d’importance que le robot lui-même. TechCrunch rapporte que la simulation haute fidélité nécessite plus de données et de ressources informatiques, y compris des GPU adaptés au lancer de rayons. Foxglove, fondée par d'anciens employés de Cruise, est décrite comme créant des outils pour rechercher et gérer les données visuelles et lidar denses générées par les systèmes robotiques. Son nouveau produit, construit sur le modèle mondial à poids ouvert Cosmos de Nvidia, est destiné à permettre aux ingénieurs d'utiliser des requêtes en langage naturel pour créer des évaluations et des simulations et pour accélérer le tri et le débogage. Ces affirmations proviennent des rapports de TechCrunch et des descriptions des entreprises ; la source ne fournit aucun test de performance indépendant, aucun résultat client ou comparaison avec des outils alternatifs.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Que regarder ensuite
Les signaux les plus importants seront des déploiements fiables, des performances reproductibles et la preuve que les robots peuvent gérer des manipulations en dehors d’environnements contrôlés. TechCrunch rapporte également que Foxglove a introduit un produit de recherche de données en langage naturel basé sur le modèle mondial Cosmos de Nvidia, qui pourrait aider les développeurs à évaluer et à déboguer plus rapidement les systèmes d'IA physique.
Le test le plus clair sera de savoir si les entreprises d’IA physique peuvent démontrer des performances reproductibles dans des déploiements réels plutôt que dans des démonstrations isolées. TechCrunch rapporte que les véhicules autonomes sont en avance en partie parce que les entreprises peuvent collecter de grandes quantités de données de conduite et parce que conduire nécessite principalement d'éviter les contacts. La manipulation est plus difficile : un robot doit saisir, pousser, tirer, positionner et relâcher des objets malgré les variations de l'environnement. Le rapport ne fournit pas de taux de réussite, de volumes de déploiement, de taux d'échec ou d'évaluations indépendantes standardisés pour les entreprises étudiées.
TechCrunch identifie plusieurs étapes possibles. Kendall a déclaré qu'une avancée significative pour le consommateur serait l'autonomie du véhicule en utilisant moins de 1 000 $ de matériel, tandis que Gervet a décrit un robot capable de comprendre une requête en langage naturel et d'effectuer des tâches de manipulation de base avec au moins environ 80 % de fiabilité dès la sortie de la boîte. Ce sont les définitions du succès données par les personnes interrogées, et non les résultats démontrés. La source n'établit pas quand l'une ou l'autre étape pourrait se produire, si le seuil de coût matériel inclut tous les coûts du système ou comment la fiabilité serait mesurée entre les tâches et les environnements.
L’orientation du secteur dépendra également de la question de savoir si les déploiements spécialisés créent une voie durable vers le renseignement général ou produisent simplement des systèmes isolés. Le CTO de Bedrock a déclaré à TechCrunch que l'excavation était un premier moyen d'étudier la manipulation dans des environnements incontrôlés, avec un objectif à plus long terme d'une couche d'intelligence couvrant plusieurs machines de construction. Adrian Macneil, PDG de Foxglove, a fait valoir que la robotique ne connaît peut-être pas un seul moment de style ChatGPT, car la distribution de machines utiles dans le monde physique est beaucoup plus difficile que la distribution de logiciels. Ce qui reste inconnu, c'est si de meilleurs outils de simulation et de données peuvent combler cet écart, combien de surveillance humaine nécessitera les déploiements et si les clients paieront pour des robots avant l'arrivée de capacités à usage général.