OpenAI a abandonné les longs scripts dans les invites GPT-5.6

OpenAI a abandonné les longs scripts dans les invites GPT-5.6

OpenAI a publié un guide rapide pour le produit phare GPT-5.6 Sol et toute la famille GPT-5.6. L'équipe du projet a encouragé les utilisateurs à formuler leurs demandes le plus brièvement possible.

Des tests internes sur les tâches de programmation basées sur des agents ont montré que les invites compactes :

  • augmentation des scores de qualité de 10 à 15 % ;
  • réduction de la consommation de jetons de 41 à 66 % ;
  • réduit le coût d'exécution des tâches de 33 à 67 %.

Les développeurs du chatbot ont comparé la nouvelle approche avec le document GPT-5 publié lors du lancement du modèle en août 2025. À l'époque, OpenAI se concentrait sur les blocs XML, les modèles pour collecter le contexte et les scripts pour appeler des outils avec une description étape par étape du processus.

Pour GPT-5.6 Sol, la société propose de supprimer les répétitions, les instructions de style sans influencer le comportement, les exemples inefficaces et les étapes que le modèle peut déjà gérer de manière fiable. En retour, vous devez laisser un résultat visible, des critères de réussite, des conditions d'arrêt et des restrictions strictes – par exemple des exigences de sécurité.

Par ailleurs, OpenAI a averti que GPT-5.6 suivait strictement les termes de la demande. Par conséquent, des règles contradictoires compliquent davantage le modèle qu’un manque de détails.

L'entreprise a conseillé d'utiliser les mots « toujours » et « jamais » uniquement pour les invariants. Pour les autres cas, ils recommandent de formuler des règles conditionnelles.

Le guide comporte également deux nouvelles sections :

  • paramètre text.verbosity — définit le niveau de détail de base de la réponse : faible, moyen ou élevé. Des exigences de longueur plus spécifiques sont toujours spécifiées dans l'invite. Cela a été ajouté car GPT-5.6 répond par défaut plus court que GPT-5.5. Les anciennes instructions « répondez brièvement » interrompaient parfois la réponse une fois de plus à cause de cela ;
  • Appel d’outil de programmation — appel d'outils logiciels. Il convient aux tâches aux limites claires. Là, le code lui-même filtre et regroupe les résultats des appels d'outils, renvoyant un total compressé au modèle au lieu de données brutes.

Avis mitigés

OpenAI a présenté la famille GPT-5.6 (les modèles Sol, Terra et Luna) fin juin. Ensuite, l'accès a été ouvert dans un format d'aperçu limité pour les partenaires de confiance. L'entreprise a expliqué sa décision par une demande des autorités américaines. La sortie complète a eu lieu le 9 juillet.

Les avis des utilisateurs sur le nouveau produit sont partagés. L'investisseur en IA Matt Schumer a signalé qu'un agent exécutant GPT-5.6 Sol avait supprimé presque tous les fichiers de son Mac.

GPT-5.6-Sol vient de supprimer accidentellement presque TOUS les fichiers de mon Mac.

Et c'est pourquoi je fais 1000 fois plus confiance à Fable. pic.twitter.com/442LjuClW2– Matt Shumer (@mattshumer_) 10 juillet 2026

La cause était une erreur dans le traitement de la variable système $HOME. La commande de suppression de fichiers s'est transformée en un nettoyage récursif du répertoire personnel.

OpenAI a décrit un scénario similaire dans la carte du système GPT-5.6 le 26 juin, avant le début de la version publique. Là, le modèle a supprimé les mauvaises machines virtuelles sans l'autorisation de l'utilisateur et a perdu les résultats de son travail. Le responsable du Codex, Thibault Sottiau, a confirmé les problèmes de lancement et promis des améliorations.

Les développeurs du projet ont aidé Schumer, dont il a parlé quelques jours après le problème.

Le fondateur du projet BridgeMind, Matthew Miller, a été confronté à une situation similaire. Il a écrit que le code de GPT-5.6 Sol annulait tous les abonnements dans Stripe sans sa commande.

GPT 5.6 SOL NE PEUT PAS ÊTRE CONFIÉ.

Je me suis réveillé ce matin et mon MRR avait perdu des MILLIERS de dollars.

Mes clients n'ont pas annulé. Le code écrit par GPT 5.6 Sol a annulé TOUS les abonnements Stripe actifs de mon entreprise. En 7 secondes. Pendant que je dormais.

Fable 5 ne m'a jamais fait ça.… https://t.co/NznNxdGJIi pic.twitter.com/1FAhZ7JoJc– BridgeMind (@bridgemindai) 13 juillet 2026

Lors des rediffusions, Miller lui-même en a expliqué la raison. Il a donné à l'agent un accès complet en écriture au lieu d'une clé limitée API.

Il existe des contre-exemples. Ethan Knight, contributeur d'OpenAI, a déclaré que GPT-5.6 Sol Ultra a prouvé l'hypothèse du cycle double couverture. Il s’agit d’un problème de théorie des graphes qui n’a pas été résolu depuis un demi-siècle. Le modèle avec 64 sous-agents a duré moins d’une heure. Cependant, aucune vérification indépendante des preuves n’a encore été publiée.

Hier, nous avons rendu GPT-5.6 Sol Ultra disponible pour tous. Aujourd'hui, nous partageons qu'il a produit une preuve de la conjecture du cycle à double couverture vieille de 50 ans en utilisant 64 sous-agents en un peu moins d'une heure. Nous partageons l'invite et la preuve ci-dessous. Nous sommes ravis de voir ce que vous faites tous avec…— Ethan Knight (@__eknight__) 10 juillet 2026

Karan Singal, responsable des soins de santé chez OpenAI, a également présenté les résultats du test HealthBench Professional. Sur celui-ci, GPT-5.6 Sol a marqué 60,5 points contre 59 pour GPT-5.5.

♥️ GPT-5.6 constitue une avancée majeure pour la santé, tant à la frontière qu’au niveau des coûts.

Ces modèles repoussent les limites de la performance par dollar, apportant à tous la meilleure intelligence en matière de santé. La plus petite variante, GPT-5.6 Luna, évaluée avec le plus faible effort de raisonnement, surpasse… https://t.co/jVXVXJOVAg pic.twitter.com/OhkRe2nVlT– Karan Singhal (@thekaransinghal) 10 juillet 2026

Les réponses des médecins aux mêmes tâches ont été évaluées à 43,7 points. Ils ont comparé aveuglément les réponses du modèle et celles des pairs sur cinq critères, dont la précision et le rappel. Au total, les experts ont attribué près de 20 000 notes.

Rappelons que le 9 juillet dernier, OpenAI a lancé le mode vocal nouvelle génération GPT-Live. Le réseau neuronal a appris à écouter et à parler en même temps, ainsi qu'à comprendre les interjections, à faire une pause et à ne pas interrompre l'utilisateur.


Voir l’article original en russe