
En résumé
- Perplexity a présenté au Computex 2026 un orchestrateur hybride qui achemine automatiquement les tâches entre votre PC et le cloud sans intervention de l'utilisateur.
- Le système gère localement des données sensibles telles que les dossiers financiers ou médicaux, en envoyant uniquement les travaux complexes aux serveurs.
- La fonctionnalité arrivera sur Perplexity Computer en juillet ; Apple, Microsoft et Nvidia s'orientent également vers des modèles d'inférence hybrides.
Le PDG de Perplexity, Aravind Srinivas, est monté sur scène au Computex 2026 à Taipei le 2 juin aux côtés du PDG d'Intel, Lip-Bu Tan, pour annoncer ce que la société appelle le premier orchestrateur d'inférence hybride sur serveur local. Le système, qui arrivera sur Perplexity Computer en juillet, décide automatiquement quelles parties d'une tâche d'IA exécuter sur votre ordinateur et lesquelles acheminer vers des modèles plus puissants dans le cloud, sans vous demander de choisir.
« Aujourd'hui, nous annonçons la prochaine étape pour l'ordinateur personnel : le premier orchestrateur d'inférence hybride sur serveur local », a annoncé Perplexity. « Décidez quel travail doit être exécuté sur votre appareil et quel travail doit être envoyé aux agents dans le cloud, en acheminant automatiquement chaque partie d'une tâche vers l'endroit approprié. »
« Le bon objectif d'un système d'IA est d'offrir la valeur de jeton par watt la plus élevée, pour chaque utilisateur », a noté Perplexity dans l'annonce officielle. Trois pressions concurrentes rendent cela difficile : la précision nécessite les modèles les plus performants, la confidentialité nécessite que certaines données ne quittent jamais votre ordinateur et le coût nécessite de ne pas consacrer les ressources informatiques d'un modèle frontière à une tâche qu'un modèle plus petit peut résoudre.
La solution que Perplexity appelle « inférence agentique hybride » aborde les trois simultanément. Un modèle compact s'exécute localement sur votre appareil et agit comme un contrôleur de trafic, déterminant quelles informations sont suffisamment sensibles pour rester locales et quelles tâches nécessitent toute la puissance d'un modèle périphérique basé sur le cloud.
« L'inférence agentique hybride est destinée aux travaux qui incluent des données sensibles mais nécessitent une IA puissante. Des éléments tels que les dossiers financiers, les informations de santé et les dossiers personnels », a expliqué la société. « Le modèle compact s'exécute localement sur votre appareil pour déterminer quand les données sensibles doivent également être conservées localement. Pendant ce temps, les travaux qui nécessitent la pleine capacité d'un modèle frontalier s'exécutent sur le serveur. »
Devez-vous vous en soucier ?
L'inférence (le processus d'exécution d'un modèle d'IA entraîné pour générer une réponse) est le travail de calcul qui se produit chaque fois que vous envoyez une invite à un chatbot. Pour l’instant, presque tout se passe sur des serveurs distants appartenant à des sociétés d’IA. Cela signifie que vos documents financiers, questions de santé et notes privées sont transférés sur l'ordinateur de quelqu'un d'autre avant que vous obteniez une réponse.
C'est pourquoi il existe des modes « Auto » ou « pensée réduite » dans les chatbots. Les sociétés d’IA essaieront toujours d’orienter les utilisateurs vers le mode de routage le plus économique possible pour eux.
Srinivas a été direct à ce sujet. Dans une interview accordée à Bloomberg Television au Computex, il a déclaré ce que beaucoup n'osent pas dire à haute voix : « Vous ne voulez pas que tout votre informatique soit centralisé sur des serveurs avec tout fonctionnant sur les plus grands modèles. Il y a des gens qui dépensent 500 millions de dollars par mois. Ce que vous voulez vraiment, c'est une valeur efficace par watt et par utilisateur. » Déplacer le travail d'inférence vers le matériel de l'utilisateur réduit ces factures, pour Perplexity.
L'inférence locale est la meilleure option pour ces entreprises, car elle réduit une grande partie des coûts, mais elle présente un avantage pour les utilisateurs d'IA : elle conserve les données sur votre ordinateur. Le compromis a toujours été la puissance : les modèles plus petits fonctionnant localement sont moins performants que les plus grands vivant dans des centres de données.
L'orchestrateur Perplexity tente d'obtenir les deux avantages. Les tâches simples (résumer un document que vous avez déjà rédigé, formater le texte, classer légèrement) sont exécutées localement. Les raisonnements complexes sont acheminés vers le cloud, idéalement sans que les parties sensibles de votre tâche soient associées. L'entreprise affirme que cela se produit automatiquement, au milieu de la tâche, de manière invisible pour l'utilisateur. La version de juillet répondra à la question de savoir si le routage est aussi fiable en pratique qu'il y paraît dans une démo Computex.
Cela vaut la peine de clarifier quelque chose : Perplexity ne propose pas un modèle local open source que vous contrôlez. Le composant local est un modèle compact que Perplexity déploie dans le cadre de son application. Le composant cloud fonctionne toujours via les serveurs de Perplexity. Les utilisateurs qui souhaitent une configuration entièrement hors ligne et auto-hébergée – du type proposé par des projets comme MiniCPM5-1B – ne la trouveront pas ici.
Les chiffres donnent un contexte à cette approche. Le chiffre d'affaires de Perplexity est passé de 100 millions de dollars à 500 millions de dollars tandis que le nombre d'employés n'a augmenté que de 34 %, a annoncé Srinivas en avril. Une entreprise qui achemine les requêtes via des modèles qu’elle n’entraîne pas est fortement incitée à maintenir les coûts de calcul aussi bas que possible. Transférer une partie de la charge d'inférence vers les appareils des utilisateurs (des milliards de PC déjà en circulation) est un moyen efficace d'y parvenir. L’argument de la vie privée est réel, mais il coïncide commodément avec l’argument financier.
Qui d'autre fait ça
Tous les grands acteurs de l’IA s’orientent actuellement vers l’inférence sur appareil ou hybride. Apple Intelligence exécute localement ses traitements les plus sensibles sur les puces de la série M. Microsoft Foundry Local a atteint une disponibilité générale en avril 2026, permettant une inférence complète d'IA sur Windows, macOS et Linux sans dépendance au cloud.
Nvidia a annoncé RTX Spark au même Computex où Perplexity a fait son annonce, ciblant l'inférence LLM locale sur les ordinateurs portables et de bureau. L'approche de Google, comme Décryptage signaléa été plus controversé : Chrome installait discrètement un modèle Gemini Nano de 4 Go sans le consentement de l'utilisateur, et le bouton « Mode AI » que la plupart des utilisateurs voient ne l'utilise même pas.
La différenciation de Perplexity réside dans la couche d'orchestration. Au lieu de demander aux utilisateurs de choisir dès le départ entre une solution sur site ou dans le cloud, le système décide par tâche, en temps réel. Srinivas a déclaré que l'approche était « indépendante des puces » : la démo Computex fonctionnait sur Intel Core Ultra Series 3, mais les processeurs Nvidia sont également pris en charge. La fonctionnalité est actuellement exclusive à l'application Perplexity pour PC Windows, et le calendrier de sortie plus large n'a pas encore été confirmé.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.
Voir l’article original en espagnol
