
En résumé
- Jackrong a lancé Gemopus, une famille de modèles basés sur Gemma 4 de Google qui reproduit localement le style Claude Opus.
- La variante E4B fonctionne à 45-60 jetons/seconde sur iPhone 17 Pro Max et jusqu'à 120 sur MacBook Air M3/M4 via MLX.
- Le modèle 26B prend en charge un contexte natif de 131 Ko et jusqu'à 524 Ko avec YaRN, réussissant ainsi les tests d'aiguille dans une botte de foin.
Si vous avez suivi la scène locale de l'IA, vous connaissez probablement Qwopus, le modèle open source qui tentait de distiller le raisonnement de Claude Opus 4.6 dans Qwen d'Alibaba, afin que vous puissiez exécuter gratuitement quelque chose comme Opus sur votre propre matériel. Cela a étonnamment bien fonctionné. L’inconvénient évident : Qwen est un modèle chinois, et cela ne plaît pas à tout le monde.
Jackrong, le même développeur mieux connu comme le créateur de ce projet, a entendu les commentaires. Leur réponse est Gemopus, une nouvelle famille de modèles peaufinés à la Claude Opus, entièrement construits sur le Gemma 4 open source de Google. ADN entièrement américain, même idée : un raisonnement de niveau frontière, exécuté localement sur le matériel que vous possédez déjà.
La famille se décline en deux versions. Gemopus-4-26B-A4B est l'option la plus robuste : un modèle Expert Mixture avec 26 milliards de paramètres au total, mais il n'en active qu'environ 4 milliards pendant l'inférence, ce qui signifie qu'il dépasse largement son poids sur un matériel limité.
Les paramètres déterminent la capacité d’une IA à apprendre, raisonner et stocker des informations. Avoir 26 milliards de paramètres au total donne au modèle une énorme étendue de connaissances. Cependant, en « réveillant » uniquement les 4 milliards de paramètres pertinents pour votre invite spécifique, il fournit des résultats de haute qualité typiques d'une IA massive, tout en étant suffisamment léger pour fonctionner sans problème sur le matériel quotidien.
L'autre est Gemopus-4-E4B, un modèle de bord à 4 milliards de paramètres conçu pour fonctionner confortablement sur un iPhone moderne ou un MacBook ultra-mince, sans avoir besoin d'un GPU.
Le choix du modèle de base est ici important. Le Gemma 4 de Google, sorti le 2 avril, a été construit directement à partir des mêmes recherches et technologies que Gemini 3 – la société l'a explicitement confirmé lors de son lancement. Cela signifie que Gemopus porte en lui quelque chose qu'aucun modèle serré basé sur Qwen ne peut revendiquer : l'ADN du modèle fermé de pointe de Google sous le capot, enveloppé dans le style de raisonnement d'Anthropic. Le meilleur des deux mondes, plus ou moins.
Ce qui distingue Gemopus de la vague d'autres styles Gemma ajustés qui inondent actuellement Hugging Face, c'est la philosophie qui la sous-tend. Jackrong a délibérément choisi de ne pas imposer les traces de raisonnement en chaîne de Claude dans les poids de Gemma – un raccourci que prennent la plupart des versions concurrentes.
Leur argument, soutenu par des recherches récentes, est que le fait de remplir un modèle d’étudiant avec le texte de raisonnement superficiel d’un modèle maître ne transfère pas réellement la capacité de raisonner. Enseigne l'imitation, pas la logique. « Il n'est pas nécessaire de faire preuve d'une imagination excessive ou de reproduire de manière superstitieuse la chaîne de pensée du style Claude », indique la carte modèle. Au lieu de cela, elle s'est concentrée sur la qualité des réponses, la clarté structurelle et le naturel de la conversation, corrigeant le ton encyclopédique rigide de Gemma et sa tendance à vous faire la leçon sur des choses que vous n'avez pas demandées.
Kyle Hessling, ingénieur en infrastructure d'IA, a effectué des tests indépendants et publié les résultats directement sur la carte modèle. Leur verdict sur la variante 26B a été plutôt favorable. « Je suis heureux d'avoir évalué ce modèle de manière assez approfondie, et il s'agit d'un excellent réglage fin d'un modèle déjà exceptionnel », a-t-il noté dans X. « Il est très efficace pour les requêtes ponctuelles sur de longs contextes et fonctionne incroyablement vite grâce à l'architecture MoE (mélange d'experts). »
Gemopus-4-26B-A4B de Jackrong est LIVE !
Heureux d'avoir mis celui-ci assez fort (voir mes bancs dans la fiche modèle) et c'est une excellente mise au point d'un modèle déjà exceptionnel ! Mon ami Jackrong cuisine toujours le meilleur !
Il bascule sur des demandes ponctuelles sur une longue période…
-Kyle Hessling (@KyleHessling1) 10 avril 2026
La plus petite variante E4B a réussi les 14 tests de compétences de base (suivi des instructions, programmation, mathématiques, raisonnement en plusieurs étapes, traduction, sécurité, mise en cache) et a complété les 12 tests de contexte longs avec 30 000 et 60 000 jetons. Lors de la récupération d'une aiguille dans une botte de foin, il a réussi 13 des 13 tests, y compris un test étendu à un million de jetons avec la mise à l'échelle YaRN 8× RoPE.
Le modèle 26B s'étend nativement jusqu'à 131 Ko de contexte et jusqu'à 524 Ko avec YaRN, que Hessling a également testé : « Il a également écrasé mes simples tests d'aiguille dans la botte de foin jusqu'à un contexte étendu de 524 Ko !
Sur le matériel de pointe, l’E4B est véritablement rapide. Jackrong rapporte entre 45 et 60 jetons par seconde sur l'iPhone 17 Pro Max, et entre 90 et 120 jetons par seconde sur le MacBook Air M3/M4 via MLX. L'architecture MoE du modèle 26B permet un déchargement efficace sur des systèmes de mémoire unifiée ou des GPU avec moins de 10 Go de VRAM. Hessling l'a évalué comme sa recommandation d'utilisation quotidienne pour les configurations limitées en VRAM.
Les deux modèles sont disponibles au format GGUF, ce qui signifie que vous pouvez les intégrer directement dans LM Studio ou llama.cpp sans aucune configuration. Le code de formation complet et un guide de réglage étape par étape se trouvent sur le GitHub de Jackrong : le même pipeline qu'il a utilisé pour Qwopus, la même configuration Unsloth et LoRA, reproductible dans Colab.
Gemopus n’est pas sans défauts. L'appel d'outils reste problématique dans la série Gemma 4 dans llama.cpp et LM Studio (échecs d'appel, incompatibilités de format, boucles). Donc, si votre flux de travail repose sur des agents utilisant des outils externes, ce n'est pas encore votre modèle. Jackrong lui-même le décrit comme « une référence d'exploration technique plutôt qu'une solution entièrement prête pour la production » et recommande sa propre série Qwopus 3.5 à ceux qui ont besoin de quelque chose de plus stable pour les charges de travail réelles.
Et parce que Jackrong a délibérément évité la distillation agressive d'une chaîne de pensée à la Claude, ne vous attendez pas à ce qu'il semble aussi profondément Opus-cerveau que Qwopus – c'était un sacrifice conscient pour la stabilité, pas un oubli.
Oui, la philosophie sur celui-ci était d'abord la stabilité, je crois comprendre que les modèles Gemma ont tendance à devenir instables si vous y forcez un tas de traces de pensée de Claude, vous pouvez le voir en essayant de nombreux autres réglages fins de l'Opus Gemma sur le visage câlin.
Jackrong a essayé de…
-Kyle Hessling (@KyleHessling1) 10 avril 2026
Pour ceux qui souhaitent affiner Gemma pour le raisonnement spécifiquement, il existe également un projet communautaire distinct qui mérite d'être suivi : Ornstein, du développeur mieux connu sous le nom de DJLougen, qui reprend la même fondation Gemma 4 de 26B et se concentre spécifiquement sur l'amélioration de ses chaînes de raisonnement sans s'appuyer sur la logique ou le style d'un modèle tiers spécifique.
Un avertissement honnête : la dynamique d'entraînement de Gemma est plus compliquée que celle de Qwen pour ces réglages fins : des fluctuations de perte plus importantes, une plus grande sensibilité aux hyperparamètres. Jackrong l'admet lui-même. Si vous avez besoin d'un modèle sur site plus éprouvé pour les flux de production, leur série Qwopus 3.5 reste l'option la plus solidement validée. Cependant, si vous souhaitez un modèle américain avec un raffinement de style Opus, Gemopus est actuellement votre meilleure option disponible. Il existe également une variante Gemopus plus dense du 31B en développement, Hessling s'attendant à ce que ce soit « une explosion ».
Si vous souhaitez essayer d'exécuter des modèles locaux sur votre propre matériel, consultez notre guide pour démarrer avec l'IA locale.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.
Voir l’article original en espagnol
