
La startup d'IA Anthropic a mis à jour son modèle phare Claude Opus vers la version 4.6. Le réseau neuronal est devenu meilleur pour planifier des actions, gérer des tâches longues et travailler plus efficacement avec de grandes bases de codes.
La fenêtre contextuelle a été étendue à 1 million de jetons. Ce volume permet d'analyser des documents massifs et de mener de longs dialogues sans perdre le fil logique.
Les algorithmes mis à jour sont adaptés pour résoudre des problèmes de travail : effectuer des analyses financières, des recherches, utiliser et créer des documents, des tableaux et des présentations.
Opus 4.6 a obtenu le score le plus élevé au test de programmation Terminal-Bench 2.0 et a battu la concurrence au Humanity's Last Exam, un test de raisonnement multidisciplinaire exigeant.

Dans GDPval-AA, qui évalue la qualité du raisonnement et de la prise de décision, le modèle a surpassé le GPT-5.2 d'OpenAI. LLM a également obtenu de meilleurs résultats sur BrowseComp, qui mesure la capacité à trouver des informations difficiles à trouver sur Internet.

Opus 4.6 extrait efficacement les données de documents volumineux. Grâce à la fenêtre contextuelle étendue, le modèle suit et capture les détails cachés non évidents.
Équipes d'agents
Une innovation clé est la possibilité de créer des groupes d’agents pour travailler ensemble. Dans ce mode, plusieurs assistants IA travaillent en parallèle et coordonnent leur travail de manière autonome.
L'outil convient aux commandes divisées en commandes indépendantes et nécessitant l'analyse d'une grande quantité de texte.
Boucle fermée
Anthropic a déclaré qu'il « créait Claude avec Claude ». Les développeurs écrivent le code en utilisant leur propre modèle d'IA, et chaque nouveau produit est testé sur les tâches internes de l'entreprise avant sa sortie.
L'équipe a constaté qu'Opus 4.6 accorde plus d'attention aux parties les plus difficiles d'une tâche sans conseils supplémentaires, accomplit des tâches simples rapidement, résout mieux les problèmes ambigus et reste efficace sur de longues distances.
« Opus 4.6 réfléchit souvent plus profondément et reconsidère soigneusement son raisonnement avant de prendre une décision. Cela donne de meilleurs résultats dans la résolution de cas complexes, mais peut augmenter les coûts et les dépenses dans le cas de cas simples », a noté la société.
Sécurité
Un audit automatisé a révélé que l'Opus 4.6 avait une faible propension aux comportements indésirables : tromperie, flatterie, renforcer les idées fausses des utilisateurs et faciliter les mauvaises conduites.

Pour valider le modèle, l'entreprise a mené la série d'évaluations la plus complète, en utilisant pour la première fois de nouvelles techniques de test et en améliorant celles existantes.
Disponibilité et nouvelles fonctionnalités
Claude Opus 4.6 est déjà disponible dans l'interface web, via API et sur les principales plateformes cloud.
Nouvelles fonctionnalités dans la boîte à outils du développeur :
- pensée adaptative – le réseau neuronal détermine de manière indépendante quand il est nécessaire d'engager le mode de raisonnement profond ;
- ajustement de la force – il existe quatre niveaux d'intensité de travail : de faible à maximum ;
- compactage du contexte : l'outil résume et remplace automatiquement l'ancien contexte lorsque la conversation approche du seuil de jeton.
Opus 4.6 fonctionne mieux avec les outils bureautiques comme Excel et PowerPoint.
Rappelons qu'en janvier, le PDG d'Anthropic, Dario Amodei, avait prédit l'apparition imminente de AGI et des suppressions d'emplois.
Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE
Newsletters ForkLog : restez à l’écoute de l’industrie Bitcoin !