Perplexity a publié une version post-entraînée du GLM 5.2 de Z.AI, un modèle chinois de 744 milliards de paramètres sous licence du MIT.
Le système intègre un « outil de conseil » qui adapte les tâches complexes aux modèles frontières, atteignant les performances de l'Opus 4.8 pour un tiers du coût.
Perplexity a déjà appliqué cette stratégie avec DeepSeek R1 en 2025 et prévoit de la répliquer avec Nemotron 3 Ultra, un modèle open source américain.
Perplexity a transformé un modèle open source chinois en un puissant outil de performance proche des frontières, pour environ un tiers du coût de Claude Opus 4.8.
Aujourd'hui, la société a publié un aperçu de recherche d'une version post-entraînée du GLM 5.2 de Z.AI, développée spécifiquement pour fonctionner au sein de son agent informatique, et désormais disponible en production.
Nous publions un aperçu de recherche d'un nouveau modèle d'orchestrateur dans Perplexity Computer.
Le modèle est une version adaptée du GLM 5.2, post-entraînée pour le harnais Computer. Il offre des performances proches de la frontière à 0,344 fois le coût d'Opus. pic.twitter.com/jcxikoFRfn
– Perplexité (@perplexity_ai) 9 juillet 2026
GLM 5.2 est un modèle d'environ 744 milliards de paramètres de Z.ai — anciennement connu sous le nom de Zhipu AI, un laboratoire de Pékin qui figure sur la liste des entités américaines depuis janvier 2025. (Les paramètres sont tous les paramètres et variables qu'un modèle peut gérer pendant l'entraînement. Plus le nombre de paramètres est grand, plus le modèle est complexe et puissant.) Sorti sous licence MIT en juin, il se classe parmi les meilleurs modèles d'IA actuellement disponibles dans les benchmarks de codage à long terme, à une fraction du coût de l'API.
Les poids ouverts signifient que n’importe qui peut le télécharger, le modifier et l’ajuster commercialement sans restrictions. C’est exactement ce que la perplexité a fait.
Qu'est-ce que le réglage fin
Le réglage fin consiste à prendre un modèle d'IA déjà entraîné et à le recycler avec un ensemble de données plus petit et plus spécifique pour le rendre plus efficace pour une tâche spécifique.
C'est comme régler une voiture. Différents mécaniciens peuvent prendre la même Honda Civic, par exemple, et la rendre plus rapide pour les courses d'accélération, plus attrayante visuellement, l'adapter pour le rallye, etc. En IA, les développeurs prennent un modèle de base et y ajoutent différents paramètres afin que le modèle ajusté acquière plus de connaissances dans un domaine spécifique, un parti pris politique différent, plus ou moins de restrictions, etc.
Perplexity a utilisé la post-formation (un processus similaire appliqué après la formation principale du modèle) pour enseigner à GLM 5.2 une compétence essentielle : savoir quand gérer une tâche elle-même et quand la faire évoluer vers quelque chose de plus puissant.
Cette escalade est au cœur de ce qu’ils ont construit. Le GLM 5.2 modifié inclut ce que Perplexity appelle un « outil de conseil » : une capacité native permettant de reconnaître lorsqu'une requête surpasse sa propre concurrence et de la pousser vers un modèle frontière tiers. La plupart des tâches n’atteignent jamais le modèle coûteux. Seulement ceux qui en ont vraiment besoin.
Cela finit par générer de grandes économies en inférence.
« Lorsqu'il est associé à un conseiller, ce modèle fonctionne au niveau de performance de l'Opus 4.8 pour une fraction du coût », a noté le PDG Aravind Srinivas dans X.
Nous avons post-formé une version de GLM qui est formée pour passer à un modèle frontière à l'intérieur du harnais informatique. Lorsqu'il est associé à un conseiller, ce modèle fonctionne avec les performances Opus 4.8 à une fraction du coût. Disponible dès maintenant en avant-première de recherche ! https://t.co/7y8CjOWOtI
– Aravind Srinivas (@AravSrinivas) 9 juillet 2026
Perplexity a évalué le système par rapport à la norme GLM 5.2 pour établir une base de référence en matière de coûts. En utilisant la mesure d'efficacité interne de l'entreprise, qui mesure le coût de l'exécution de tâches complexes, les résultats ont montré que le modèle affiné avec un conseiller coûte environ deux fois plus cher à exécuter que la version de base. Cependant, utiliser le modèle haut de gamme Opus 4.8 pour tout coûte beaucoup plus cher (environ 600 % plus cher).
En combinant ces outils, le système Perplexity atteint les mêmes performances de qualité qu'Opus, mais à environ un tiers du prix.
Pourquoi un modèle chinois et pourquoi l'open source le rend possible
La course à l’IA entre les États-Unis et la Chine est souvent présentée comme un jeu à somme nulle. En pratique, les modèles open source ne s’arrêtent pas aux frontières. La licence MIT de GLM 5.2 simplifie le calcul : il n'y a aucun contrat API à violer, aucun commutateur d'accès qu'un gouvernement ne peut activer. Les poids sont téléchargés et peuvent être ajustés selon les besoins.
La perplexité a déjà emprunté cette voie. Lorsque DeepSeek R1 a fait irruption dans le monde de l'IA au début de 2025, la société l'a peaufiné et l'a transformé en R1-1776 – cartographiant environ 300 sujets que l'original refusait d'aborder en raison de la censure du gouvernement chinois et reformant le modèle pour le rendre plus favorable aux États-Unis. Il est devenu une version hébergée en Occident du même moteur de raisonnement.
« Nous ne pouvons pas profiter des puissantes capacités de raisonnement de R1 sans d'abord atténuer ses préjugés et sa censure », écrivait l'équipe de Perplexity dans un article de blog à l'époque.
Ce mouvement avec GLM 5.2 suit le même schéma, sauf que l'objectif cette fois n'est pas politique mais économique. Le produit informatique de Perplexity orchestre déjà plus de 19 modèles d'IA ; Le GLM ajusté est conçu pour être le modèle économique par défaut qui absorbe la plupart des tâches avant même de toucher à un modèle frontière.
Srinivas a déclaré que la thèse à long terme est simple : post-former les modèles open source pour qu'ils soient bons à évoluer, au sein d'un agent qui sert déjà des millions d'utilisateurs. Perplexity est « particulièrement bien placé » pour le résoudre, a-t-il écrit, car l'infrastructure est déjà déployée à grande échelle.
Le modèle fonctionne sur les GPU Nvidia B200 aux États-Unis. Suivant sur la liste : un post-trainer Nemotron 3 Ultra, qui répliquerait la même architecture en utilisant un modèle open source américain.
Des benchmarks complets et un document de recherche sont attendus dans les semaines à venir. Le modèle est disponible sous forme d’aperçu de recherche.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !