
Un robot traversant un bureau bondé, naviguant dans les couloirs et s'arrêtant devant une étagère spécifique — sans LiDAR, sans capteurs de profondeur, sans cartes 3D. Juste une caméra RVB et des instructions en langage naturel. C'est le point de départ de Navigation robotstralele premier modèle de navigation robotique développé par AI Science Robotics, qui redéfinit ce que le navigation robotique à caméra unique.
Points clés
- Robostral Navigate est un modèle de 8 milliards de paramètres qui guide les robots dans des environnements complexes en utilisant simplement une caméra RVB ordinaire.
- Sur le benchmark Validation R2R-CE inédite atteint le 76,6% de réussitesurpassant les meilleures méthodes à caméra unique de 9,7 points et les systèmes multi-capteurs de 4,5 points.
- Le modèle fonctionne sur des robots dotés de roues, de jambes et de rotors, et se généralise dans différents environnements sans avoir été formé sur ceux-ci.
- Une technique de mise en cache des préfixes réduit les jetons de formation de 22 fois, compressant des mois de formation en quelques jours seulement.
- Apprentissage par renforcement en ligne via un algorithme CISPO amélioré le taux de réussite de 3,2 % supplémentaires.
Robostral Navigate : navigation robotisée avec une seule caméra
Le modèle prend en entrée des images RVB et une instruction en langage courant – comme « sortez du hall, descendez le couloir, entrez dans le débarras et arrêtez-vous devant la deuxième étagère » – et emmène le robot jusqu'à sa destination de manière autonome. Pas de capteurs supplémentaires, pas d'infrastructure coûteuse.
Ce choix de conception n’est pas anodin. La plupart des systèmes de navigation robotiques avancés s'appuient sur le LiDAR, des caméras de profondeur ou des configurations multi-caméras pour créer une représentation fiable de l'espace. Robostral Navigate élimine tout cela, en réduisant considérablement le coût du matériel et en augmentant le nombre de plates-formes sur lesquelles il peut fonctionner : robots sur roues, sur pattes, drones.
Comment fonctionne la méthode de navigation par pointage
Le cœur technique du modèle est une approche appelée pointant: au lieu de calculer les déplacements métriques absolus, le système déduit les coordonnées d'image de la position cible dans le champ de vision actuel de la caméra, ainsi que l'orientation souhaitée à l'arrivée. Cela rend le modèle naturellement robuste aux variations des paramètres intrinsèques de la caméra et à l’échelle du monde réel.
Lorsque la cible n'est pas visible dans le champ de vision actuel, le modèle active un mécanisme de repli : passe à commandes de mouvement dans le système de référence local du robotdu type « avancez de 2 mètres, déplacez-vous de 1,5 mètres vers la gauche, tournez de 25 degrés ». Une solution de secours élégante qui maintient la navigation fonctionnelle même dans les situations les plus complexes.
Performance de référence sur le benchmark R2R-CE
Le banc d'essai standard pour la navigation robotique basée sur des instructions est le R2R-CE (Room-to-Room in Continuous Environments), qui évalue des modèles sur des environnements jamais vus lors de la formation. Il s’agit du test le plus sévère pour mesurer la capacité réelle de généralisation.
Robostral Navigate obtient le 76,6 % de réussite sur une validation invisible et 79,4% sur validation vue. La comparaison avec les concurrents est claire : +9,7 points sur les meilleures méthodes mono-caméra et +4,5 points sur les systèmes utilisant la profondeur ou plusieurs caméras. Le résultat est d’autant plus significatif qu’il nécessite moins de matériel, pas plus.
Pour ceux qui travaillent dans l’industrie, ces chiffres ne sont pas seulement des statistiques académiques. Ils signifient qu'un système plus léger et moins coûteux surpasse les solutions nécessitant des capteurs supplémentaires, avec tout ce que cela implique en termes de déploiement industriel.
Formations innovantes et techniques d’apprentissage renforcées
Entraînement supervisé avec mise en cache des préfixes
Le modèle a été entièrement construit en interne par AI Science Robotics et entraîné en simulation sur un ensemble de données d'environ 400 000 trajectoires collectées dans 6 000 scènes. La phase d'entraînement supervisé est basée sur une technique de mise en cache de préfixes avec masquage d'attention en forme d'arbre : la séquence entière d'un épisode est compressée en une seule passe, éliminant ainsi la redondance sans perdre les signaux d'apprentissage.
Le résultat pratique est une réduction de 22 fois du nombre de jetons de formation. Une formation qui prendrait normalement des mois est complétée en quelques jours. Un énorme avantage concurrentiel dans un domaine où l’itération rapide est primordiale.
Augmentation des performances avec CISPO
Après la phase supervisée, l’équipe a appliqué CISPO, un algorithme d’apprentissage par renforcement en ligne. Cette deuxième étape permet au modèle d'apprendre de ses erreurs, de se remettre des échecs et de développer des comportements exploratoires, abordant ainsi le problème classique de changement de distribution ce qui afflige le comportement de clonage pur.
CISPO a ajouté un taux de réussite supplémentaire de 3,2 %. L’équipe AI Science Robotics rapporte qu’aucun plateau de performance n’a encore été observé, ce qui suggère une marge concrète d’amélioration avec une formation continue.
Généralisation et développements futurs
L’un des aspects les plus remarquables de Robostral Navigate est sa capacité à généraliser. Le modèle fonctionne sur des robots à roues, à pattes et volants, s'adapte à différentes tailles de plates-formes et est robuste aux variations des paramètres de la caméra. Bureaux, immeubles résidentiels, espaces commerciaux, environnements extérieurs : le système est conçu pour fonctionner dans des contextes hétérogènes sans nécessiter de reconfigurations spécifiques.
Les applications industrielles sont immédiates : logistique, livraison, fabrication, hôtellerie. Ce sont précisément les secteurs où la demande d’autonomie robotique est la plus forte et où le coût du matériel fait la différence entre un produit évolutif et un produit qui reste en laboratoire.
AI Science Robotics décrit Robostral Navigate comme la première étape vers un agent incarné unifié. La navigation, dans cette vision, est la compétence fondamentale sur laquelle repose tout le reste. L’équipe s’agrandit actuellement – chercheurs et ingénieurs – avec pour objectif affiché d’apporter la navigation autonome aux robots de tous types, dans tous les environnements.
Il reste à voir avec quelle rapidité cette performance passera du benchmark à la complexité chaotique du monde réel. Mais les chiffres actuels indiquent que l’écart se réduit plus rapidement que prévu.
FAQ
Quels capteurs Robostral Navigate utilise-t-il pour la navigation robotique ?
Robostral Navigate utilise exclusivement une seule caméra RVB ordinaire. Il ne repose pas sur le LiDAR ou les capteurs de profondeur.
Quelles sont les performances du Robostral Navigate par rapport aux autres modèles de navigation ?
Le modèle atteint un taux de réussite de 76,6 % sur le test de validation R2R-CE, surpassant de 9,7 points les meilleures méthodes à caméra unique et de 4,5 points les systèmes utilisant la profondeur ou plusieurs caméras.
Comment se comporte Robostral Navigate lorsque la cible n'est pas visible dans la caméra ?
Lorsque la cible est en dehors du champ de vision actuel, le modèle passe automatiquement aux commandes de mouvement dans le système de référence local du robot, telles que les courses et les rotations en mètres et en degrés.
Quelles techniques de formation améliorent les performances du Robostral Navigate ?
Le modèle utilise une formation supervisée basée sur la mise en cache de préfixes qui réduit les jetons de formation de 22 fois. Ensuite, l'algorithme d'apprentissage par renforcement en ligne CISPO ajoute un taux de réussite supplémentaire de 3,2 %.
Contenu créé avec l’aide de l’intelligence artificielle et de la révision éditoriale humaine.
Voir l’article original en italien
