NVIDIA lance des modèles d'IA agentique pour les industries en demande

NVIDIA lance des modèles d'IA agentique pour les industries en demande

Nvidia relever la barre sur Modèles d'IA agentique NVIDIA avec le lancement de Nemotron 3.5 Lightning, un modèle ouvert de 30 milliards de paramètres conçu pour gérer des tâches volumineuses au sein de systèmes d'agents toujours actifs. Parallèlement au nouveau modèle, NeMo Switchyard est une bibliothèque open source qui bascule automatiquement les requêtes entre plusieurs modèles, réduisant ainsi les temps et les coûts d'exécution. Les deux innovations, présentées ensemble, marquent une avancée dans la stratégie de NVIDIA visant à rendre l'intelligence artificielle agentique plus rapide, moins chère et plus facile à personnaliser pour les entreprises.

Points clés

  • Nemotron 3.5 Lightning est un modèle mélange d'experts 30 milliards de paramètres ouverts, optimisés pour les charges de travail agents à volume élevé.
  • Comparé aux autres modèles de sa catégorie, il offre une sortie jusqu'à 4 fois plus rapide et exécute les tâches 30 % plus rapidement.
  • NeMo Switchyard achemine dynamiquement les demandes vers le modèle le plus approprié, réduisant ainsi le coût d'exécution des tâches à environ un tiers par rapport à l'utilisation d'un modèle unique.
  • Le modèle prend en charge le déploiement local sur le matériel NVIDIA RTX, DGX et Jetson, ainsi que sur le cloud et les centres de données.
  • Il est disponible sur Hugging Face, ModelScope, OpenRouter et via le réseau NVIDIA Cloud Partners.

NVIDIA lance Nemotron 3.5 Lightning pour les charges agents à haut volume

Nemotron 3.5 Lightning a été créé pour répondre à un besoin spécifique : les systèmes d'agents modernes ne fonctionnent plus avec un seul modèle monolithique, mais comme de véritables équipes de modèles, chacun spécialisé dans une tâche. Dans cette architecture, un modèle de raisonnement plus grand comme Nemotron 3 Ultra ou GPT-5.6 planifie et orchestre le flux de travail, tandis que des modèles plus petits et plus ciblés comme Nemotron 3.5 Lightning effectuent des tâches spécifiques : réviser le code, utiliser des outils, surveiller les alertes de sécurité ou répondre aux demandes de facturation.

Un modèle ouvert avec 30 milliards de paramètres conçus pour la vitesse

Le nouveau modèle arrive après le Nemotron 3 Nano et étend la famille Nemotron 3 avec ce que NVIDIA présente comme le modèle le plus efficace de sa catégorie pour les tâches d'agent de longue durée. Les performances parlent d'elles-mêmes : sortie jusqu'à 4 fois plus rapide Et réalisation des tâches 30 % plus rapidement par rapport à d'autres modèles comparables. Les benchmarks PinchBench, cités par NVIDIA, montrent que Nemotron 3.5 Lightning atteint ces résultats tout en conservant une précision de pointe. La Coalition Nemotron a également contribué au projet, le réseau de partenaires qui a fourni des méthodologies d'évaluation, des logiciels d'inférence et des ensembles de données pour affiner le modèle avant sa publication.

Personnalisation et post-formation pour la précision de l'industrie

En tant que modèle ouvert, Nemotron 3.5 Lightning peut être post-entraîné via NVIDIA NeMo en utilisant les propres données, outils et flux de travail de chaque organisation pour augmenter la précision sur des tâches spécifiques. Plusieurs entreprises ont déjà emprunté cette voie : Grève de foule le personnalise pour la cybersécurité, Harvey avec Trajectoire pour les services juridiques et CodeLapin avec Baseten pour la révision du code. Lila Sciences travaille à améliorer les capacités de raisonnement sur des tâches agentiques dans les sciences physiques et de la vie, tout en Laboratoires Fastino personnalisé le modèle pour obtenir des précisions élevées dans les charges de développement logiciel, de finance et de santé.

Le modèle prend également en charge de manière native le réglage fin des tâches de codage : aux côtés de Lightning, NVIDIA publie Nemotron-RL-Agentic-Terminal-Pivot, un ensemble de données d'apprentissage par renforcement d'agent utilisé pour entraîner le modèle sur les capacités des agents de terminal en matière d'écriture de code.

NeMo Switchyard : un routage intelligent qui réduit les coûts des agents IA

NeMo Switchyard résout un problème bien réel pour ceux qui créent des applications d'agent : s'appuyer sur un seul modèle par défaut signifie souvent dépenser trop ou perdre en qualité, tandis que gérer manuellement le routage entre les différents modèles devient un travail d'intégration qui ralentit le développement. La bibliothèque, publiée en open source, achemine automatiquement chaque requête vers le modèle le plus performant et le plus efficace pour cette étape de flux de travail spécifique, sans obliger les développeurs à réécrire leurs applications.

Comment fonctionne le routage dynamique et pourquoi il est pratique

Les développeurs peuvent modifier l'algorithme de routage en fonction de leurs priorités, qu'il s'agisse de qualité, de latence ou de coût. Selon les tests internes de NVIDIA, NeMo Switchyard maintient une précision de pointe tout en réduisant le coût de réalisation des tâches à environ un troisième par rapport à l'utilisation du modèle Opus 4.8 seul. C’est là que se mesure l’impact réel pour les entreprises : dans un système modèle bien orchestré, les agents d’IA deviennent non seulement plus rapides mais également économiquement viables à grande échelle, ce qui a jusqu’à présent freiné l’adoption par les entreprises de l’IA agentique à grand volume.

Les résultats des partenaires qui testent déjà le Switchyard

NVIDIA a travaillé avec un large écosystème de partenaires pour intégrer le routage intelligent directement dans les outils que les développeurs utilisent déjà. Les premiers résultats, rapportés par NVIDIA, montrent des gains d'efficacité significatifs :

  • Boomi a obtenu une précision de routage de domaine de 100 %, dirigeant 59 % du trafic vers un modèle affiné 5 fois plus rapidement et réduisant la latence de 21 % lors des tours suivants.
  • Cadence a amélioré son efficacité de 9,9 % en utilisant ChipStack AI Super Agent pour la vérification formelle.
  • Classmethod constate une réduction des coûts de 27 % tout en maintenant la qualité des chargements opencode et Fireworks.
  • Cognition a intégré le Switchyard dans Devin Desktop, atteignant des performances proches de la frontière à un coût moyen réduit de 28 % par rapport au routage de tout vers un modèle unique.
  • LangChain a obtenu une réduction de 74 % des coûts en acheminant seulement 7 % des appels vers un modèle frontière, avec un compromis de précision de 6 %.
  • Ramp a égalé les performances d'un modèle frontière en réduisant les coûts de 58 % et les délais d'exécution de 33 % lors du test SWE-Bench.

D'autres noms connus évoluent dans le même sens : Kong propose le routage nativement via Kong AI Gateway, LiteLLM l'intègre sous forme de plug-in dans sa couche proxy, Nous Research l'a intégré à Hermes et Siemens le teste pour améliorer l'efficacité de son Fuse EDA AI Agent.

Déploiement flexible : du PC domestique au centre de données

L’un des points forts de cette génération de modèles ouverts est le contrôle sur où et comment l’IA s’exécute. Nemotron 3.5 Lightning peut fonctionner sur des systèmes locaux, notamment NVIDIA RTX PC, DGX Spark, DGX Station et Jetson, pour exploiter l'infrastructure existante ou s'adapter aux appareils de périphérie, aux postes de travail RTX PRO, aux centres de données et aux environnements cloud pour les cas d'utilisation en entreprise. Cette flexibilité vous permet d'exécuter des tâches spécialisées à grand volume localement ou sur site lorsque vous avez besoin de réactivité et de contrôle sur la confidentialité des données, sans avoir à renoncer à la possibilité d'évoluer vers le cloud lorsque votre charge l'exige.

Données ouvertes et disponibilité sur plusieurs plateformes

Comme pour chaque version de la famille Nemotron, NVIDIA publie autant de données et de techniques de formation que les licences le permettent pour garantir la traçabilité, l'auditabilité et la réutilisation pour former d'autres modèles. Cette approche distingue les modèles Nemotron de nombreuses solutions propriétaires fermées et reste l'un des principaux arguments avec lesquels NVIDIA cherche à consolider sa position sur le marché des modèles ouverts pour l'IA agentique.

Nemotron 3.5 Lightning est déjà disponible sur Hugging Face, ModelScope, OpenRouter et sur build.nvidia.com en tant que microservice NVIDIA NIM, ainsi que via un large écosystème de partenaires NVIDIA Cloud, de plateformes de post-formation et d'inférence et de fournisseurs de cloud. NeMo Switchyard est disponible sur GitHub, avec une arrivée sur des plateformes partenaires supplémentaires attendue dans les mois à venir.

FAQ

Qu'est-ce que Nemotron 3.5 Lightning et qu'est-ce qui le rend différent ?

Nemotron 3.5 Lightning est un modèle d'IA ouvert de 30 milliards de paramètres optimisé pour les tâches d'agent à volume élevé, capable de fournir une sortie jusqu'à 4 fois plus rapide et une exécution des tâches 30 % plus rapide que les modèles concurrents de la même catégorie.

Comment NeMo Switchyard améliore-t-il l’efficacité de l’IA ?

NeMo Switchyard est une bibliothèque de routage open source qui achemine dynamiquement les demandes vers le modèle le mieux adapté à chaque étape du flux de travail, réduisant ainsi le coût d'exécution des tâches d'environ un tiers par rapport à l'utilisation d'un seul modèle.

Nemotron 3.5 Lightning peut-il être personnalisé pour les besoins spécifiques d'une organisation ?

Oui : le modèle peut être post-entraîné avec NVIDIA NeMo en utilisant les propres données d'une organisation pour améliorer la précision sur des tâches spécialisées telles que la cybersécurité, les services juridiques ou la révision de code.

Sur quelles plateformes Nemotron 3.5 Lightning est-il disponible pour le déploiement ?

Le modèle prend en charge les déploiements locaux et cloud sur les PC NVIDIA RTX, les systèmes DGX, Jetson, les appareils Edge et les centres de données, et est disponible sur des plates-formes telles que Hugging Face, ModelScope, OpenRouter et le réseau NVIDIA Cloud Partners.

Contenu créé avec l’aide de l’intelligence artificielle et de la révision éditoriale humaine.

Voir l’article original en italien