
En résumé
- Oppo a lancé X-OmniClaw, un framework d'agent IA open source pour Android qui exécute des tâches réelles directement sur le matériel de l'utilisateur.
- Le système combine une caméra, un microphone et un écran pour percevoir l'environnement, automatiser les applications et maintenir une mémoire sémantique entre les sessions.
- Contrairement à d'autres agents mobiles qui fonctionnent sur des serveurs distants, X-OmniClaw fonctionne nativement sur l'appareil et est désormais disponible sur GitHub.
Votre téléphone dispose déjà d'une caméra, d'un microphone et d'un écran. Vous pouvez voir ce que vous regardez dans la vraie vie et ce qui se passe sur votre propre écran. Et maintenant, l’équipe IA du fabricant chinois de smartphones Oppo a découvert que tout ce matériel en grande partie inutilisé est exactement ce qui est nécessaire pour créer un agent IA mobile véritablement utile.
Ce projet est X-OmniClaw, publié par l'équipe Multi-X. Il s'agit d'un framework d'agent IA open source pour Android qui transforme votre téléphone en un assistant mains libres et contextuel, capable d'exécuter de vraies tâches dans de vraies applications, sans tout acheminer via une copie virtuelle de votre appareil dans le cloud.
La plupart des systèmes d'IA mobiles ne fonctionnent pas sur votre téléphone. Ils le font sur des serveurs cloud qui hébergent des copies virtuelles d'Android, permettant à une IA de toucher et de faire défiler les applications à distance. Résultat : aucun accès à votre véritable appareil photo, à vos photos ou à vos fichiers locaux, juste un inconnu utilisant une copie de votre téléphone.
X-OmniClaw adopte l'approche inverse. Selon le livre blanc, il introduit « une architecture native sur l'appareil qui s'exécute directement sur le matériel physique de l'utilisateur, éliminant ainsi l'écart entre les environnements simulés et les contextes d'interaction réels ».
Le rapport utilise une analogie avec l’automobile : le smartphone est « le véhicule », X-OmniClaw est « le moteur de contrôle et de perception interne », et le modèle de langage cloud n’est invoqué comme « le carburant » que lorsqu’un raisonnement intensif est nécessaire. Tout le reste reste local.
Comment fonctionne l'agent IA pour les téléphones Oppo
L'architecture globale de
Omni Perception englobe tout ce que votre téléphone peut percevoir. Combinez les images de la caméra, le contenu de l'écran et la saisie vocale dans un seul pipeline. Un modèle de langage de vision interprète la scène avant que l'agent ne fasse quoi que ce soit. Ainsi, si vous pointez votre appareil photo vers une bouteille et demandez « combien ça coûte ? », l'agent détermine d'abord ce que vous regardez, puis ouvre l'application d'achat correspondante et commence la recherche. Aucune hypothèse.
Omni Memory est ce qui distingue X-OmniClaw d'un chatbot à réponse unique. L'agent maintient le contexte entre les tâches, les modifications d'application et les sessions. De plus, créez une mémoire sémantique à long terme à partir de votre galerie de photos, transformant les images en notes structurées sur les objets, les scènes et les événements. Le rapport note que « la continuité d'exécution est ce qui permet à X-OmniClaw de fonctionner comme un agent de périphérique continu plutôt que comme un système de réponse unique ».
Omni Action gère l'exécution. Il combine les données d'interface XML avec un modèle visuel intégré à l'appareil et l'OCR, une couche de reconnaissance de caractères permettant de déterminer exactement où appuyer, même sur des écrans chargés de publicités où la structure seule ne suffit pas. Cela inclut également le clonage comportemental : accédez une fois à une page d'application enterrée, et l'agent peut répéter instantanément ce voyage à l'aide d'un raccourci de lien profond Android la prochaine fois.
Ce que l'agent IA d'Oppo peut vraiment faire

Oppo a partagé certaines des capacités du modèle. Par exemple, l'agent identifie un produit physique grâce à la caméra, ouvre Taobao, fait défiler les résultats et renvoie un récapitulatif du prix, sans avoir besoin de taper quoi que ce soit.
Oppo a également présenté un assistant flottant à l'écran qui aide un utilisateur à résoudre des exercices de mathématiques étape par étape : il lit l'écran de manière autonome, traite chaque question et continue une fois terminé.
Il a également proposé un autre exemple dans lequel un utilisateur demande à l'agent de créer une vidéo avec les meilleurs moments à l'aide de photos de perroquets. Le système analyse la galerie, trouve les photos correspondantes à l'aide de sa mémoire sémantique, ouvre l'éditeur vidéo CapCut via un lien profond, sélectionne par lots les fichiers et sort la vidéo. Ce qui prenait auparavant « plusieurs minutes ou plus » devient une série d’étapes automatisées.

2026 : l'année de l'IA agentique
Les agents IA sont devenus l’une des catégories dont on parle le plus dans le monde de la technologie. OpenClaw, le framework d'agents open source qui a dépassé les 373 000 étoiles sur GitHub et a finalement été soutenu par OpenAI, a lancé la vague actuelle en démontrant ce que les agents persistants exécutés localement pouvaient faire sur les PC. Hermes Agent de Nous Research est allé encore plus loin avec une boucle d'apprentissage auto-améliorée qui renforce ses capacités au fil du temps.
Les deux fonctionnent principalement sur du matériel de bureau. X-OmniClaw étend la même architecture à l'appareil que vous transportez partout. L'équipe s'est appuyée sur l'open source d'HermesApp et l'article attribue explicitement le modèle de compétences structurées d'OpenClaw comme une source d'inspiration clé, puis l'adapte à la nature multimodale et toujours active d'un smartphone.
Le code est maintenant disponible sur GitHub. Oppo indique qu'il libérera toutes les ressources et continuera à mettre à jour le projet à mesure que le système évolue.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.