
En résumé
- L'équipe Qwen d'Alibaba a présenté trois modèles d'IA : Qwen-RobotNav, Qwen-RobotManip et Qwen-RobotWorld pour la robotique incarnée.
- Qwen-RobotManip s'est classé premier dans le RoboChallenge Table30-v1, surpassant les approches précédentes de 20 %.
- Alibaba n'a pas révélé les prix ni les calendriers, bien que les modèles fonctionnent déjà sur du matériel de Franka et Unitree.
L'équipe Qwen d'Alibaba a lancé mardi la suite Qwen-Robot : trois modèles fondamentaux qui constituent ce qu'ils appellent une « pile complète pour l'intelligence incarnée ». Qwen-RobotNav gère la mobilité. Qwen-RobotManip gère la manipulation. Qwen-RobotWorld simule la physique qui rend les deux possibles. Chacun travaille indépendamment. Ensemble, ils représentent le moment Android de la robotique : le système d'exploitation, pas le matériel.
📣 Présentation de la suite Qwen-Robot — Qwen-RobotNav, Qwen-RobotManip, Qwen-RobotWorld, trois modèles de base, une pile complète pour l'intelligence incarnée.
🧭 Qwen-RobotNav — la passerelle vers la mobilité.
• Unifie 5 tâches de navigation en un seul modèle : suivi d'instructions, point-but,… pic.twitter.com/noumjTtTeS– Qwen (@Alibaba_Qwen) 16 juin 2026
Alibaba est actuellement la seule entreprise en Chine qui couvre les puces, le cloud, les modèles, les plates-formes de services et les applications. Pour l’entreprise, la robotique est l’expression la plus physique de cet engagement, ce qu’on appelle l’IA incarnée.
Les agents d’IA s’appuient actuellement sur les LLM pour prendre leurs décisions. La manière habituelle dont les robots fonctionnent repose sur des modèles d’apprentissage automatique qui, bien que avancés, n’ont pas l’adaptabilité de l’IA générative. Les agents physiques sont confrontés à une classe d’échecs différente, plus difficile : la physique, pas les invites.
Pour ces cas d’usage, Alibaba a présenté cette nouvelle suite d’IA avec différents composants :
Qwen-RobotNav unifie cinq tâches de navigation : suivi d'instructions, navigation vers un point cible, recherche d'objets, suivi de cible et conduite autonome, chacune exigeant des stratégies de mémoire visuelle différentes. La plupart des modèles codent de manière fixe une seule stratégie. Qwen-RobotNav expose une interface paramétrée : budget de jetons, décroissance temporelle, poids par caméra qu'un planificateur peut reconfigurer en milieu d'épisode.
Entraîné avec 15,6 millions d'échantillons avec randomisation dans tous les paramètres, il atteint 76,5 % de réussite dans VLN-CE RxR, une référence pour la navigation visuo-linguistique dans des environnements réels, et 90 % de suivi dans EVT-Bench, qui évalue la capacité d'un agent à suivre de manière cohérente des cibles en mouvement.
Qwen-RobotManip répond à l'un des plus grands défis de la manipulation robotique : différents robots représentent des actions de manières fondamentalement différentes. Un bras Franka (un type de robot à sept axes de mouvement) fonctionne selon les angles des articulations, tandis qu'un robot ALOHA (une plate-forme robotique bimanuelle peu coûteuse largement utilisée dans la recherche en robotique) représente les actions à travers la position et l'orientation de ses pinces (poses de l'effecteur final). Les humanoïdes ajoutent une autre couche de complexité, en utilisant les coordonnées de tout le corps.
Pour connecter ces espaces d'action incompatibles, Alibaba a synthétisé environ 38 100 heures de données d'entraînement à partir d'ensembles de données robotiques open source et de vidéos humaines, sans s'appuyer sur une collecte de données exclusive. Le modèle se classe premier dans le RoboChallenge Table30-v1, surpassant de 20 % les approches précédentes.

Qwen-RobotWorld est le plus ambitieux : un modèle de monde vidéo conditionné par le langage qui traite le langage naturel comme une interface d'action universelle. « Prends le gobelet rouge et verse de l'eau sur la fleur » fonctionne que l'acteur soit une pince, un véhicule autonome ou un agent de navigation mobile.
Le corpus Embodied World Knowledge couvre 8,6 millions de paires vidéo-texte (200 millions d'images) en manipulation (5,9 millions d'échantillons, plus de 1 300 compétences, plus de 20 morphologies), conduite autonome (Waymo, NVIDIA PhysicalAI-AD, Bench2Drive), navigation intérieure (VLNVerse) et transfert humain-robot via 14 bras robotiques.
Il se classe premier dans EWMBench et DreamGen Bench, deux benchmarks qui évaluent si les modèles mondiaux prédisent et génèrent des environnements physiques réalistes. Il surpasse également tous les modèles open source de WorldModelBench et PBench, et obtient un score parfait en matière de respect des lois physiques : lois de Newton, conservation de la masse, dynamique des fluides, gravité.

Le ChatGPT des robots ?
Alors que les laboratoires occidentaux (Google DeepMind, Nvidia, Figure, Physical Intelligence) poursuivent des objectifs similaires, la plupart se concentrent sur la navigation ou la manipulation, et non sur une suite unifiée et composable. L'intégration verticale d'Alibaba, des puces aux applications, signifie qu'ils contrôlent l'ensemble de la pile. La base open source les différencie des concurrents qui dépendent des données privées des robots.
Certaines idées fausses méritent d’être dissipées : il ne s’agit pas de robots mais de modèles logiciels – des cerveaux et non des corps. Ils fonctionnent sur du matériel d'AgileX, Franka, Universal Robots, Unitree et autres.
De plus, bien qu’il s’agisse de modèles d’IA génératifs pour les robots, ce ne sont pas des LLM comme le ChatGPT typique. Un modèle de langage prédit les jetons. Ces modèles doivent comprendre la physique, les relations spatiales et les conséquences des actions physiques. Un modèle de langage vous indique qu'un verre se brise s'il tombe. Qwen-RobotWorld prédit comment il se brise : schéma de fracture, dynamique des fluides, collisions secondaires. Qwen-RobotManip prévoit une prise en main qui empêche complètement la chute.
Ne vous attendez pas à avoir votre propre robot domestique de si tôt. L'écart entre une démonstration contrôlée d'un robot plaçant des fruits dans un panier et un robot travaillant de manière fiable dans votre maison est énorme. RoboCasa365, LIBERO-Plus, RoboTwin-Clean2Rand : ce sont des références de simulation. Le déploiement dans le monde réel introduit le bruit des capteurs, la dérive des actionneurs et la longue traîne de cas extrêmes qui ont humilié tous les efforts de robotique de l'histoire, et Alibaba le reconnaît.
Les prouesses techniques sont pourtant réelles. L'approche axée sur l'alignement de RobotManip résout un véritable goulot d'étranglement dans la formation inter-incarnations. L'interface d'observation paramétrée de RobotNav est une solution ingénieuse au problème de stratégie contextuelle. L'interface universelle de langage en tant qu'action de RobotWorld est la bonne abstraction pour la modélisation du monde inter-domaines.
Alibaba n'a pas révélé les prix, les délais ou les clients qui auront accès au-delà des programmes pilotes.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.
Voir l’article original en espagnol
