Nvidia a présenté un système pour entraîner des robots

Nvidia a présenté un système pour entraîner des robots

Des chercheurs de Nvidia, de l'Université Carnegie Mellon et de l'Université de Californie à Berkeley ont introduit ENPIRE, un cadre qui permet aux agents de programmation d'IA d'améliorer les politiques de contrôle des robots sur du matériel réel.

Le système démarre une boucle fermée : le robot exécute la tâche, l'environnement évalue automatiquement le résultat et revient à son état d'origine, et l'agent IA analyse les erreurs, réécrit le code et lance la prochaine série de tests.

Comment fonctionne ENPIRE

En robotique, la formation sur du matériel réel reste un processus coûteux et lent. Après une tentative infructueuse, vous devez remettre la scène à son état d'origine, vérifier le résultat, modifier l'algorithme et relancer le test. Généralement, certains de ces travaux nécessitent la participation d’ingénieurs.

ENPIRE apporte ce que Nvidia appelle AutoResearch au monde physique : les agents d'IA écrivent du code, le testent et l'améliorent dans les itérations futures. Cependant, contrairement à l’environnement numérique, chaque expérience implique de vrais robots, caméras, objets, erreurs de préhension, frictions et autres contraintes physiques.

Le cadre se compose de quatre modules :

  • L'environnement est responsable de la réinitialisation automatique de la scène, de la vérification des résultats, de la journalisation et des interfaces de sécurité ;
  • L'amélioration des politiques lance l'amélioration des politiques de gestion ;
  • Le déploiement évalue la politique sur un ou plusieurs robots physiques ;
  • Evolution permet aux agents d'analyser les journaux, de rechercher des idées dans la littérature, de modifier l'infrastructure de formation et de corriger le code.

Après la configuration initiale de l’environnement, le cycle peut se dérouler sans surveillance humaine constante. L'agent reçoit des données de vidéos, de trajectoires et de fonctions de récompense, propose une nouvelle hypothèse, modifie le code, teste le résultat sur le robot et enregistre les modifications si elles améliorent l'indicateur.

Pourquoi avons-nous besoin d'une vérification et d'une réinitialisation automatiques ?

L'élément clé d'ENPIRE est l'automatisation de deux opérations : la vérification du résultat et le retour de la scène à son état d'origine. Le premier est nécessaire pour que le système puisse déterminer si la tâche est terminée. Par exemple, dans le scénario du serre-câble, la fonction d'évaluation combinait un détecteur, un modèle de segmentation et un test à deux caméras. De cette façon, l'agent a reçu un signal de réussite ou d'erreur sans marquer manuellement chaque exécution.

La réinitialisation automatique vous permet d'exécuter plusieurs tentatives consécutives. Après une action infructueuse, le robot doit remettre l'objet ou la scène dans un état adapté à la prochaine expérience. Sans cela, la formation sur du matériel réel devient vite dépendante d’une intervention humaine constante.

Comme l'a noté Decrypt, dans un premier temps, une personne aide l'agent à créer des outils permanents – une procédure de réinitialisation et une fonction de récompense. Ils sont ensuite réutilisés et l'agent apporte d'autres améliorations à la politique.

Ce qui a été montré sur les robots

Dans le cadre d'expériences réelles, l'équipe a testé ENPIRE sur plusieurs tâches de manipulation. Push-T teste si le robot peut pousser un objet en forme de T dans une zone donnée. L'insertion des broches nécessite l'insertion de broches dans des trous de 4 mm de diamètre. Installation également illustrée GPU et les opérations d'attaches de câbles.

Capture d'écran - 2026-06-18 au 15.12.16Capture d'écran - 2026-06-18 au 15.12.16
Source : Nvidia

La page du projet de Nvidia indique que dans les tâches de manipulation réelles, le système a réussi la tâche dans 99 % des cas lorsque l'agent a reçu jusqu'à huit tentatives, en tenant compte des erreurs précédentes. La métrique reflète la capacité du système à se remettre des échecs et à répéter les actions en fonction du contexte, plutôt que la précision d'une tentative isolée.

En tant qu'agents de programmation, l'équipe a comparé Codex sur GPT-5.5, Claude Code sur Opus 4.7 et Kimi Code sur Kimi K2.6. L'évaluation a eu lieu dans le benchmark AutoEnvBench sur les tâches Push-T et Pin Insertion.

Capture d'écran - 2026-06-18 au 20.12.12Capture d'écran - 2026-06-18 au 20.12.12
Source : Nvidia

Les chercheurs ont également testé ENPIRE dans RoboCasa, un simulateur de tâches quotidiennes telles que ouvrir des armoires, des tiroirs et allumer ou éteindre des objets dans la cuisine. Dans ces scénarios, ENPIRE a surpassé les GR00T et CaP-X de Nvidia, un système basé sur des agents qui utilise des outils mais n'exécute pas un cycle d'exploration entièrement automatisé.

Apprentissage accéléré de huit robots

Un bloc de travail distinct est consacré à la mise à l’échelle d’une flotte de robots. Nvidia a mené une expérience sur huit stations robotiques avec deux manipulateurs. Chacun avait son propre matériel, son ordinateur et son agent d'IA pour la programmation.

Les stations partageaient les résultats via Git : une bonne idée ou un changement de code pouvait rapidement se propager entre les agents. Cette approche nous a permis de réduire le temps de formation. Selon Decrypt, passer d'un robot à huit a réduit la courbe d'apprentissage de Push-T d'environ cinq heures à deux heures. Pour l’insertion des broches, le temps est passé de plus de 90 minutes à environ 40 minutes.

Restrictions

Les auteurs soulignent que la mise à l’échelle ne résout pas tous les problèmes. Lorsque les agents lisent des journaux, écrivent du code, le déboguent ou attendent que le modèle de langage sous-jacent réponde, les robots et les ressources informatiques sont sous-utilisés. À mesure que le nombre de robots augmente, l'activité du GPU augmente, mais la charge moyenne des robots eux-mêmes diminue. Les équipes d'agents passent plus de temps à résumer les résultats des autres branches et à coordonner plutôt que de se contenter d'effectuer des courses physiques.

Une autre limitation est l’augmentation de la consommation de jetons. Une flotte de robots plus importante amène la politique à un état de fonctionnement plus rapide, mais nécessite plus de jetons en raison de la lecture des journaux, de l'échange d'idées et de la coordination entre les agents.

De plus, ENPIRE a jusqu'à présent été démontré sur un ensemble limité de tâches de manipulation. Ses résultats ne signifient pas que les robots peuvent déjà maîtriser de manière indépendante des compétences physiques arbitraires dans un environnement ouvert sans formation d’ingénieur.

Rappelons qu'en juin, Nvidia a présenté le robot humanoïde de référence Isaac GR00T – une conception de référence de recherche pour développer et tester les compétences des robots humanoïdes. La configuration comprend un corps Unitree H2 Plus et des mains tactiles à cinq doigts Sharpa Wave.

Unitree a précédemment dévoilé le « premier robot habité au monde prêt pour la production ». L'androïde est capable de se déplacer sur deux et quatre membres.

Abonnez-vous à ForkLog sur les réseaux sociaux

Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE

Voir l’article original en russe