
Dans l'expérience technique de Nvidia, la précision du modèle Cosmos 3 Nano sur un test à quatre choix est passée de 54,41 % à 93,35 % en moins de 24 heures. Les principales étapes de la formation complémentaire ont été réalisées par l'agent Codex AI selon des instructions préalablement préparées TAO.
Le résultat a été obtenu sur un ensemble de données spécialisé – Tissé Traffic Safety de Tissé par Toyota. Il contient des vidéos de situations de circulation et des questions avec quatre options de réponse. Plus de 8 000 exemples ont été utilisés pour la formation et les tests.
Sans adaptation supplémentaire, Cosmos 3 Nano a répondu correctement à 54,41 % des questions. Ensuite, les développeurs ont demandé au Codex d'évaluer le modèle de base et d'effectuer une formation supplémentaire en utilisant la méthode. LoRA.
L'agent a sélectionné l'instruction spécialisée Cosmos-reason, a vérifié les annotations de l'ensemble de données et a trouvé un paramètre de fréquence d'images manquant. Après avoir corrigé la configuration, il a chargé les poids du modèle, préparé les paramètres et lancé le conteneur de formation.
LoRA ne modifie pas tous les paramètres du modèle, mais entraîne de petits adaptateurs supplémentaires. Selon les calculs de Nvidia, dans cette expérience, la méthode nécessitait environ sept fois moins GPU-heures de formation supplémentaire complète sur Cosmos 3 Nano.
Une exécution LoRA a duré environ 30 minutes sur huit accélérateurs NVIDIA A100 avec 80 Go de mémoire. La précision a augmenté à 87,14 %.
Comme deuxième invite, les développeurs ont lancé TAO AutoML pour sélectionner le taux d'apprentissage, la taille du lot, les paramètres LoRA et d'autres paramètres. Le système a effectué 43 tests parallèles. Le meilleur résultat avec l'optimisation bayésienne était de 93,35 %. Cette phase a duré 19,5 heures sur plusieurs nœuds A100 sur Oracle Cloud Infrastructure.
Le Codex dans l'expérience ne s'est pas limité à analyser les résultats. Il a sélectionné un flux de travail, vérifié les données, corrigé la configuration, lancé les conteneurs et comparé les métriques. L'autonomie de l'agent reste limitée ; il a agi selon des instructions préparées à l'avance.
L'indicateur de 93,35 % reflète l'exactitude des réponses dans la partie vérification d'un ensemble de données de recherche. Il ne mesure pas la sécurité de la conduite autonome ni ne valide la capacité du modèle à prendre des décisions en temps réel.
Rappelons qu'en juin, des chercheurs de Nvidia, de l'Université Carnegie Mellon et de l'Université de Californie à Berkeley ont présenté ENPIRE, un framework qui permet aux agents de programmation d'IA d'améliorer les politiques de contrôle des robots sur du matériel réel.
Voir l’article original en russe
