Examen du MiniCPM5-1B : le modèle d'IA qui exécute des agents locaux sur votre téléphone

Examen du MiniCPM5-1B : le modèle d'IA qui exécute des agents locaux sur votre téléphone

En résumé

  • OpenBMB a lancé MiniCPM5-1B, un modèle d'IA de 1 000 millions de paramètres avec prise en charge MCP et une fenêtre contextuelle de jetons de 128 000 exécutables sur les smartphones.
  • Le modèle a surperformé Qwen3-0.6B, Qwen3.5-0.8B et LFM2.5-1.2B dans les sept catégories de référence, avec la plus grande marge de performance agent.
  • Disponible dans Hugging Face sous licence Apache 2.0, il permet aux agents locaux sans connexion internet de consulter des calendriers, de synthétiser des documents et d'appeler des outils.

MiniCPM5-1B, un modèle d'un milliard de paramètres développé par OpenBMB, est la dernière version de la série MiniCPM pour appareils. Il prend en charge les appels d'outils natifs et le Model Context Protocol (MCP), tient dans la mémoire d'un smartphone et surpasse tous les modèles open source comparables dans sa catégorie de taille.

Le modèle est la première version de la famille MiniCPM5, conçue dès le départ pour un déploiement local sur du matériel aux ressources limitées. Avec un milliard de paramètres, c'est petit par rapport aux normes actuelles. (Les paramètres sont ce qui donne à un modèle d’IA toute l’étendue de ses connaissances ; un nombre plus grand signifie généralement une plus grande capacité.)

Le Gemma 4 de Google commence avec 2 milliards de paramètres effectifs, mais évolue jusqu'à 31 milliards. Llama 4 Scout gère 17 milliards de paramètres actifs. Le MiniCPM5-1B n’est pas destiné à les concurrencer. Sa proposition est de faire plus avec moins.

Comment il a été construit

La base architecturale provient de MiniCPM4, détaillée dans un livre blanc de l'équipe OpenBMB de THUNLP, de l'Université Tsinghua et de ModelBest. L'innovation centrale est InfLLM v2, un mécanisme d'attention entraînable qui traite chaque jeton par rapport à moins de 5 % des jetons environnants lors de l'inférence dans des contextes longs, réduisant considérablement le calcul sans perte significative de précision. (Un « jeton » est l'unité d'information de base gérée par un modèle d'IA.)

Du côté des données, l'équipe a développé UltraClean, un pipeline de filtrage qui a amené le modèle à des performances compétitives en utilisant 8 milliards de jetons d'entraînement, contre 36 milliards consommés par Qwen 3. La post-formation a utilisé un apprentissage par renforcement combiné à des techniques de distillation efficaces (en utilisant un modèle plus grand comme guide pour le plus petit), ce qui a augmenté les scores en mathématiques, en codage et en suivi des instructions de 16 points, et a réduit les réponses trop longues de 29 points de pourcentage.

La fenêtre contextuelle contient 128 000 jetons, ce qui équivaut à environ 96 000 mots de texte continu en un seul rendu. Pour un modèle comportant un milliard de paramètres, c’est un nombre important. Une mémoire persistante tout au long d'une longue session RPG, le traitement complet d'un PDF ou un contexte d'agent qui ne redémarre pas en cours de tâche sont tous à votre portée.

Pourquoi un simple agent peut suffire

Nous l'avons testé et confirmé que le MiniCPM5-1B prend en charge les appels MCP et d'outils. Cela le place sur une très courte liste de modèles avec moins de 2 milliards de paramètres capables de véritables flux de travail agentiques sans infrastructure cloud.

Cela dit, pour que cela fonctionne, les utilisateurs devront configurer des paramètres supplémentaires, tous détaillés dans le référentiel Github du modèle.

Le scénario pratique : un agent local sur un iPhone qui peut consulter un calendrier, effectuer une recherche dans une base de données locale ou appeler un serveur MCP de recherche Web, le tout sans connexion Internet. Comme nous l'avons vu, l'exécution de l'IA locale est déjà plus accessible que la plupart ne le pensent, et la course aux appareils s'est accélérée. Les modèles conçus pour fonctionner sur un téléphone sans backend cloud deviennent une véritable catégorie de produits et non une curiosité de recherche.

OpenAI n'est pas nécessaire pour vérifier le calendrier si un agent local peut simplement le consulter et vous dire ce que vous avez prévu pour aujourd'hui.

Pour les tâches agentiques légères et les contextes conversationnels étendus, le MiniCPM5-1B est compétitif. Cependant, même si OpenBMB n’y a peut-être pas pensé, le style conversationnel du modèle en fait un bon candidat pour les jeux de rôle locaux : 128 Ko de contexte signifie qu’une histoire peut se dérouler sur des dizaines, voire des centaines d’échanges sans que le modèle perde le fil.

Les petits agents lisant des notes, résumant des documents et répondant à des questions à leur sujet sont à l'aise dans leurs capacités, en particulier lorsqu'ils sont combinés à un serveur MCP de recherche pour combler les lacunes en matière de connaissances.

La concurrence à cette échelle comprend les Qwen3-0.6B et Qwen3.5-0.8B d'Alibaba, ainsi que le LFM2.5-1.2B-Thinking de Liquid AI. Le benchmark de capacités d'OpenBMB compare les quatre modèles en matière de connaissances générales, de connaissances du domaine, de programmation, de suivi d'instructions, de raisonnement mathématique, de raisonnement logique et de tâches agentiques. MiniCPM5-1B est en tête dans les sept catégories, avec les marges les plus importantes en termes de performances agents et de notoriété globale.

Tests rapides

Nous avons effectué trois évaluations rapides. Le premier était un piège logique classique : « S'il vous plaît, agissez en tant qu'avocat et législateur expert. Est-il légal pour un homme d'épouser la sœur de sa veuve dans le système juridique qui régit les îles Falkland ? »

La bonne réponse est évidente : un homme qui a une veuve est mort, et les morts ne signent pas d'actes de mariage. Le MiniCPM5-1B a produit une analyse détaillée du droit du mariage des îles Falkland et n'a pas réussi à détecter le piège, le traitant comme une question de compétence directe.

« Fondamentalement, vous devez identifier l'état civil réel aux îles Falkland. C'est un fait qui doit être déterminé par les autorités locales ou par une procédure judiciaire », a répondu le mannequin après un long raisonnement.

Le deuxième test demandait un choix décisif entre A et B. Le modèle n’a choisi ni l’un ni l’autre, optant pour une réponse incluant les deux options. Il s’agit d’un échec connu dans les petits modèles soumis à une pression conversationnelle. Le MiniCPM5-1B ne fait pas exception.

Nous avons demandé quelle industrie dominerait l’économie en 2100 : Crypto ou IA ? Au lieu de raisonner sur la question, la réflexion interne du modèle a commencé à analyser les investissements en crypto-monnaie et en IA comme étant synergiques à partir de zéro.

Pour être honnête, rien de tout cela n’est surprenant dans un modèle à 1 milliard de paramètres.

Les capacités agents sont ici la véritable histoire. Si vous combinez le MiniCPM5-1B avec un serveur MCP pour la recherche sur le Web, votre tendance à halluciner sur des questions factuelles obscures disparaît, ou du moins diminue considérablement.

Nous demandons au modèle le prix actuel du Bitcoin et trois recommandations de titres ; l'outil a été appelé avec succès et les recommandations (Amazon, Microsoft et Nvidia) étaient logiques.

Conclusion

Un agent conversationnel déployé localement, capable d'appeler des outils, de conserver 128 Ko de contexte et de s'exécuter entièrement sur l'appareil, est un produit plus intéressant qu'un modèle de réponse aux questions autonome qui rivalise avec GPT-4.

N'annulez pas votre abonnement à l'IA à cause de cela. Soyez clair sur ce avec quoi vous travaillez : il a peu de connaissances par rapport aux grands modèles ou aux LLM, il programmera mal (encore une fois, par rapport aux modèles plus grands) et il ne sera pas proche de l'AGI, si c'est ce que vous recherchez.

MiniCPM5-1B est désormais disponible auprès de Hugging Face sous une licence Apache 2.0, prenant en charge vLLM, SGLang et l'inférence standard avec Transformers.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !