Alibaba a introduit des modèles d'IA pour contrôler les robots

Alibaba a introduit des modèles d'IA pour contrôler les robots

Alibaba a présenté la suite Qwen-Robot, un ensemble de modèles d'IA pour les robots et les tâches dans l'environnement physique : Qwen-RobotNav pour la navigation, Qwen-RobotManip pour la manipulation d'objets et Qwen-RobotWorld pour la prédiction de scènes. L'équipe a décrit le projet comme « une pile complète pour l'intelligence artificielle incarnée ».

Nous parlons de modèles logiciels qui devraient aider les agents physiques à percevoir l'environnement, à planifier des actions et à exécuter des commandes en langage naturel. Qwen-Robot Suite est déjà en cours de test auprès de certains clients de robotique d'entreprise d'Alibaba Cloud.

Pourquoi Alibaba introduit Qwen dans le monde physique

Les grands modèles linguistiques et multimodaux savent déjà travailler avec du texte, des images, des vidéos et de la parole, mais cela ne suffit pas pour les robots. Les agents physiques doivent non seulement comprendre la commande, mais aussi la traduire en mouvement, prendre en compte l'espace, les propriétés des objets, les limitations des capteurs et les conséquences des actions.

Alibaba appelle cela la direction de l’IA physique, ou « IA incarnée ». Dans cette approche, le modèle doit fonctionner non seulement avec des données numériques, mais aussi avec l'environnement physique : se déplacer, trouver des objets, contrôler des manipulateurs et prédire ce qui se passera après une action.

Qwen-RobotNav : cinq tâches de navigation dans un seul modèle

Qwen-RobotNav est responsable de la navigation. Le modèle combine cinq groupes de tâches :

  • suivre les instructions ;
  • mouvement vers un point donné;
  • recherche d'objets ;
  • suivi de cible ;
  • conduite autonome.

Selon Alibaba, Qwen-RobotNav est construit sur Qwen3-VL et formé sur 15,6 millions d'échantillons liés à la planification d'itinéraire et au raisonnement visuo-linguistique.

La société a déclaré un taux de réussite de 76,5 % sur VLN-CE RxR et 90% sur Banc EVT. Alibaba a également précisé que le modèle peut fonctionner comme un outil pour des systèmes d'agents plus vastes : le modèle de niveau supérieur planifie la tâche et Qwen-RobotNav est responsable du mouvement.

Capture d'écran - 17/06/2026 au 12/01/51Capture d'écran - 17/06/2026 au 12/01/51
Source : Qwen

Dans les démos, Alibaba décrit des scénarios tels que rechercher un objet perdu dans un local ou vérifier si un objet particulier dans un bâtiment est ouvert. Dans de telles tâches, le robot ne doit pas seulement se déplacer, mais collecter des preuves visuelles et renvoyer une réponse à l'utilisateur.

Qwen-RobotManip : actions avec des objets

Qwen-RobotManip est conçu pour les actions physiques avec des objets. Le modèle devrait aider les robots à ramasser, déplacer et placer des objets, ainsi qu'à transférer des compétences entre différents types d'appareils.

Capture d'écran - 17/06/2026 au 12/03/11Capture d'écran - 17/06/2026 au 12/03/11
Source : Qwen-RobotManip.

L’un des principaux problèmes de la robotique est que les robots décrivent les actions différemment. Un manipulateur, une plateforme à deux mains, un robot manuel ou un système mobile utilisent différents formats de coordonnées, d'articulations et de commandes. Qwen-RobotManip essaie de rassembler ces données dans une vue commune afin que la formation sur un type de robot en aide un autre.

Alibaba a utilisé plus de 38 100 heures de données pour la formation. Ce volume comprenait 11 320 heures de données robotiques ouvertes, 1 933 heures de vidéos à la première personne d’actions humaines et 24 808 heures de démonstrations robotiques synthétiques créées à partir de ces vidéos.

La société a déclaré que le modèle avait pris la première place dans le RoboChallenge Table30 v1 dans la piste de modèles polyvalents. Selon Alibaba, Qwen-RobotManip a également montré une résistance aux nouvelles instructions, aux objets inconnus et au transfert de compétences entre différents robots.

Qwen-RobotWorld : une maquette du monde pour les robots

Qwen-RobotWorld est un modèle vidéo du monde basé sur le langage naturel. Il doit prédire comment la scène évoluera après une action donnée.

Capture d'écran - 17/06/2026 au 31/12/08Capture d'écran - 17/06/2026 au 31/12/08
Source : Qwen-RobotWorld

Par exemple, le modèle reçoit une observation actuelle et une commande textuelle puis génère un état futur probable de l'environnement. Cette approche peut être utilisée pour la manipulation, la conduite autonome, la navigation, la planification et la création de données d'entraînement synthétiques pour les robots.

Pour former Qwen-RobotWorld, l’équipe a rassemblé le corpus Embodied World Knowledge. Il comprend 8,6 millions de paires vidéo-texte et plus de 200 millions d'images, couvre plus de 20 types de plates-formes robotiques et plus de 500 catégories d'actions.

Alibaba a déclaré que Qwen-RobotWorld s'est classé premier dans EWMBench et DreamGen Bench, et a battu tous les modèles ouverts dans WorldModelBench et PBench. La description technique indique également que le modèle présente une grande cohérence avec la physique de base : mouvement, conservation de la masse, des fluides et de la gravité.

Les robots sont encore loin de la production de masse

Malgré les résultats annoncés, Qwen-Robot Suite reste un ensemble de modèles et non une plate-forme robotique grand public toute faite. Les déploiements dans le monde réel sont confrontés au bruit des capteurs, à l'usure des actionneurs, à des situations inhabituelles, à des erreurs de perception et à un grand nombre de scénarios rares. De nombreux benchmarks comparant de tels systèmes ont lieu dans des simulations ou dans des conditions expérimentales limitées.

Alibaba n'a pas non plus divulgué le coût d'accès, le moment du lancement public ou la liste des clients qui testent déjà la suite Qwen-Robot.

Rappelons qu'en avril Alibaba Cloud a introduit le modèle d'agent Qwen3.6-Plus avec une fenêtre contextuelle de 1 million de tokens et la prise en charge d'outils externes.

Abonnez-vous à ForkLog sur les réseaux sociaux

Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE



Voir l’article original en russe