
Le 3 septembre, OpenAI a publié son nouveau modèle phare d'IA, GPT-6 Astra. La société a commencé à se déployer auprès d'un nombre limité d'organisations dans le cadre du programme Trusted Access et ouvrira l'accès aux utilisateurs ChatGPT Plus, Pro, Business et Enterprise, ainsi qu'OpenAI dans les prochains jours. API et le substrat rocheux amazonien.
Il s'agit du GPT-6 Astra.
Tout ce que vous pouvez faire sur un ordinateur, Astra peut le faire pour vous. Rapide. pic.twitter.com/gDd0IsewJw
– OpenAI (@OpenAI) 3 septembre 2026
Microsoft a commencé à rendre le modèle disponible via le programme d'accès limité Microsoft Foundry dans Azure. L'accès pour les clients participants sera bientôt élargi.
Selon OpenAI, Astra surpasse GPT-5.6 Sol dans de nombreux tests informatiques, de programmation, scientifiques et de cybersécurité de l'entreprise. Dans le même temps, les modèles anthropiques montrent de meilleurs résultats dans certains benchmarks.
OpenAI a précisé que les tableaux comparatifs fournissent le maximum de résultats à tout niveau d'effort de calcul. Les modèles GPT ont été testés dans un environnement de recherche ou via l'API, les performances des versions disponibles pour les utilisateurs peuvent donc varier.
Fonctionnalités avancées
Selon la version, GPT-6 Astra est capable de travailler de manière indépendante avec le navigateur et les applications : remplir des formulaires, mettre à jour des enregistrements dans CRM, rechercher des informations, modifier des documents, analyser des données et tester des logiciels.
Sur le sous-ensemble hors ligne partiellement noté d'OSWorld 2.0, qui teste les tâches dans une interface graphique, Astra a obtenu un score de 72,6 % contre 65,7 % pour GPT-5.6 Sol. Dans les simulations de latence OpenAI, Astra a réalisé ces tâches environ 47 % plus rapidement : environ 40 minutes par tâche contre 75 minutes pour GPT-5.6 Sol.

Au dernier examen des agents, où l'IA résout des problèmes professionnels complexes dans des programmes réels, le résultat était de 59,3 %. GPT-5.6 Sol a reçu 53,6%, Claude Opus 5 – 55,5%.

Dans ScreenSpot-Pro, qui évalue la compréhension des éléments de l'interface informatique, Astra a affiché 92,7 % contre 76,9 % pour GPT-5.6 Sol.

OpenAI a également introduit un mécanisme expérimental pour stocker le contexte dans le Codex. Astra peut prendre des notes entre les fenêtres contextuelles remplies et rechercher des exigences ou des résultats de tests dans les messages précédents et les résultats des outils.
Vous devez maintenant activer la fonction vous-même. config.toml. OpenAI prévoit de le rendre standard sur Astra dans les semaines à venir.
Code, mathématiques et sciences
Dans Terminal-Bench 4.0 pour la programmation d'agents GPT-6, Astra a obtenu un score de 57,9 %. A titre de comparaison, GPT-5.6 Sol a obtenu 37,3%, Claude Fable 5,1 – 55,8%.

Sur FrontierCode 1.1 Extended, le nouveau modèle a atteint 64,5%, sur le scientifique Terminal-Bench Science 0,1 – 64,6% contre 22,4% pour GPT-5.6 Sol et 52,6% pour Claude Fable 5.1.
Dans FrontierMath Tier 4, le modèle a obtenu un score de 97,6 %. Selon les développeurs, Astra a contribué à améliorer deux résultats dans la théorie des nombres premiers : dans le premier cas, il a abaissé la limite supérieure de l'écart entre un nombre infini de paires de nombres premiers de 240 à 186, dans le second, il a modifié l'un des termes d'estimation des grands écarts entre nombres premiers, qui était resté inchangé depuis plus de 80 ans.

Dans le dernier examen de l'humanité avec outils, Astra a obtenu 57,2 %, perdant face à Claude Fable 5.1 avec 65 %.
Niveau critique de cybercapacités
GPT-6 Astra est devenu le premier modèle OpenAI à atteindre le niveau critique pour les cybercapacités au sein Cadre de préparation. Sans restrictions de production, il a reçu 100 % sur ExploitBench contre 78,5 % pour GPT-5.6 Sol. Sur ExploitGym, les résultats étaient respectivement de 42,4 % et 30,3 %.
Sur un ensemble interne d'ExploitBench (juin-août 2026) de 20 vulnérabilités de haute gravité récemment révélées dans la V8 couvrant 13 versions stables de Chrome, Astra a réalisé l'exécution de code arbitraire dans 39 % du temps. GPT-5.6 Sol a affiché 11,5%.

Lors de tests par les pairs, Astra, sans protection de production, a exploité des vulnérabilités inconnues pour exécuter du code arbitraire dans des navigateurs protégés et a créé des exploits d'élévation de privilèges dans des systèmes d'exploitation protégés.
« La capacité d'Astra à identifier et développer des exploits pour jour zéro peut aider à trouver et à éliminer les faiblesses, mais nécessite en même temps des mesures de sécurité plus strictes », a noté la société.
Des restrictions supplémentaires s'appliquent dans la version publiée. Astra renoncera aux cybertâches avancées, y compris la création exploits de preuve de concept. La société a l'intention de fournir progressivement un accès plus large aux scénarios de sécurité via OpenAI Daybreak.
Les développeurs ont également introduit une surveillance supplémentaire du raisonnement et des actions du modèle. Le système de classification doit identifier les comportements potentiellement non autorisés et arrêter automatiquement les actions correspondantes.
OpenAI a reconnu que la chaîne de raisonnement écrite d'Astra est moins contrôlable que celle de GPT-5.6 Sol. Cette conclusion repose principalement sur des tests contradictoires dans lesquels le modèle a été directement incité à échapper à l’observation.
L'entreprise attribue ce résultat à la capacité d'Astra à mieux gérer le raisonnement écrit de problèmes simples et à les résoudre en moins d'étapes de texte. Sur des tâches complexes, le modèle, selon le développeur, éprouve encore des difficultés à tenter de cacher le raisonnement nécessaire à la solution.
1 milliard de dollars pour la cyberdéfense
Parallèlement à la sortie d'Astra, OpenAI a annoncé un programme Daybreak for Frontline Defenders d'un milliard de dollars. Dans ce montant, l'entreprise comprenait un accès subventionné aux modèles et produits Daybreak, à la formation, au support technique et aux programmes de partenariat.
L'initiative sera lancée principalement aux États-Unis pour les opérateurs d'eau et d'électricité, les gouvernements étatiques et municipaux, les banques régionales et locales, les organisations à but non lucratif et les développeurs de logiciels open source disposant de ressources limitées en matière de cybersécurité. Dans les semaines à venir, ils prévoient d’étendre le programme aux pays partenaires.
« Les défenseurs ont une fenêtre d'opportunité de plus en plus étroite, et l'IA doit être utilisée pour combler les failles de sécurité avant les attaquants », a déclaré OpenAI.
Daybreak est déjà utilisé par des professionnels d'environ 2 000 organisations et espaces de travail agréés. Daybreak Blue est conçu pour les missions de sécurité standard, tandis que Daybreak Red permet aux organisations de confiance d'accéder à des cybermodèles spécialisés pour des scénarios plus sensibles.
Accès et coût
Les utilisateurs de ChatGPT Pro, Business et Enterprise auront également accès à une version autonome de GPT-6 Astra Pro. OpenAI n'a pas précisé en quoi il diffère de celui de base. Les administrateurs d'entreprise doivent eux-mêmes activer Astra pour leurs espaces de travail.
Pour les développeurs, le modèle apparaîtra dans l'API OpenAI sous l'identifiant gpt-6-astra. Selon la documentation, la fenêtre contextuelle est de 1,05 million de jetons, le volume de réponse maximum est de 128 000 jetons. La date limite de connaissance est le 30 avril 2026.
Le prix standard est de 10 $ pour 1 million de jetons d’entrée et de 50 $ pour 1 million de jetons de sortie. L'entrée en cache coûte 1 $ pour 1 million de jetons, l'entrée en cache coûte 12,5 $.
Pour les requêtes de plus de 272 000 jetons d’entrée, les taux d’entrée et de mise en cache sont doublés et les coûts de sortie sont multipliés par 1,5 pour l’ensemble de la requête. Le mode accéléré fonctionne jusqu'à deux fois plus vite que le mode standard et coûte deux fois plus cher que le tarif en vigueur.
Rappelons qu'en août, OpenAI a temporairement ralenti la mise à l'échelle des nouveaux modèles d'IA et suspendu la formation pendant deux semaines pour renforcer les derniers systèmes destinés à un déploiement ultérieur.
Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE
Voir l’article original en russe
