
La startup chinoise d'IA Moonshot AI a présenté Kimi K3, le premier modèle ouvert de classe 3T au monde avec 2,8 billions de paramètres, une vision native et un contexte pour 1 million de jetons. Selon les propres estimations du projet, au classement général, il n'a perdu que face aux propriétaires Claude Fable 5 et GPT 5.6 Sol.
Kimi K3 est construit sur la nouvelle architecture Kimi Delta Attention (KDA) et Attention Residuals (AttnRes). KDA vous permet de traiter plus efficacement de longues séquences de données, et AttnRes extrait les informations nécessaires non pas de toutes les couches de manière égale, mais de manière sélective. En conséquence, le modèle a une compréhension plus profonde du contexte et conserve son sens même lors du traitement de textes complexes.
Le framework Stable LatentMoE est responsable de la rareté : sur 896 experts, seuls 16 travaillent simultanément. Ceci, combiné à de nouvelles données et paramètres de formation, a entraîné une efficacité deux fois et demie supérieure à celle de K2.
Selon les développeurs, pendant neuf des 12 derniers mois, les modèles Kimi ont détenu le record du plus grand modèle ouvert.
Le nouveau modèle Moonshot AI est déjà disponible sur le site Kimi Work, Code et API. Par défaut, le mode de réflexion maximale est activé, d'autres apparaîtront plus tard. Les poids complets et le rapport seront publiés le 27 juillet.
Résultats de référence
Dans certains tests, K3 a montré des résultats supérieurs à ceux de Fable 5 et GPT-5.6 Sol, mais dans d'autres, il était sensiblement en retard. Elle est en tête Marathon SUE (42 contre 35 et 39), ParcourirComp (91,2 contre 88 et 90,4) et Banc de programme (77,8 contre 76,8 et 77,6). Sur Banc de terminaux 2.1 K3 a 88,3 points : c'est plus élevé que Fable 5 (84,6) et seulement 0,5 point de moins que Sol (88,8).
En même temps, sur FrontièreSWE K3 a obtenu un score de 81,2 contre 86,6 pour Fable 5, et HLE-Complet – 43,5 contre 53,3. Les méthodes de test étaient différentes : certains modèles ont été évalués via Claude Code, d'autres via Codex ou notre propre KimiCode.
Tâches de codage et d'agent
K3 peut mener de longues sessions d'ingénierie sans pratiquement aucune intervention humaine, naviguer dans de grands référentiels et gérer les outils de terminal.
Dans le test d'optimisation GPULes modèles -core ont fonctionné indépendamment pendant jusqu'à 24 heures sur quatre tâches (y compris les cœurs AttnRes, KDA et MLA avec une taille de tête de 512) sur un NVIDIA H200 et un GPU tiers. K3 a montré des résultats au niveau de Fable 5 et a largement surpassé Opus 4.8, GPT-5.6 Sol et GPT-5.5. Tard dans le développement, une première version de K3 a réalisé l'essentiel de cette optimisation en interne au sein de l'équipe Moonshot.
Un modèle distinct a été écrit de toutes pièces par MiniTriton, un compilateur compact pour les cœurs GPU doté de son propre IR-couche par dessus MLIR et génération PTX-code.
Conception de puces et développement de jeux
À titre de démonstration, K3 a conçu indépendamment une puce de réseau neuronal utilisant sa propre architecture.
Le lancement autonome a pris 48 heures : le modèle utilisait l'open source AED– Outils et bibliothèque Nangate 45 nm. La puce s'insère dans 4 mm², fonctionne à 100 MHz et produit plus de 8 700 jetons par seconde en simulation. Il comprend 1,46 million de cellules standard, 0,277 Mo de SRAM et une matrice MAC INT4 avec déquantification intégrée.
K3 combine également le raisonnement, le code et la vision 3D pour créer des prototypes ludiques et interactifs à partir de concepts, d'images et de vidéos.
Travailler avec la connaissance et la vidéo
Dans l’un des cas, K3 a reproduit les relations universelles I-Love-Q issues de l’astrophysique computationnelle. Cela a pris environ deux heures au lieu d'une ou deux semaines de travail pour un chercheur expérimenté. Le modèle a vérifié plus de 20 articles scientifiques, évalué plus de 300 équations d'état, trouvé des incohérences dans les formules publiées et écrit plus de 3 000 lignes de code Python, formatant les résultats dans un tableau de bord HTML interactif.
Dans un autre cas, K3 a produit un rapport interactif couvrant 42 ans d'histoire de l'industrie ASIC à travers 120 cycles d'auto-amélioration récursive, traitant plus de 11 000 pages à partir de 87 rapports trimestriels et 99 PDF originaux.
Grâce au traitement vidéo natif, K3 peut éditer des vidéos : dans un exemple, le modèle a réalisé une animation explicative de sa propre architecture dans le style de 3Blue1Brown, dans un autre, il a édité indépendamment un teaser sur son lancement à partir de 56 clips sources, y compris la sélection des images, la synchronisation avec la musique et le traitement du son. Moonshot estime qu'un tel travail prendrait un à deux jours à un éditeur expérimenté et trois à cinq à un éditeur novice.
Restrictions
L'équipe du projet a souligné que K3 est sensible à la perte de l'historique de ses pensées lors du changement d'environnement d'agent au milieu d'une session et peut faire preuve d'une initiative excessive dans des situations ambiguës. En termes de facilité d'utilisation, le modèle est toujours sensiblement inférieur à Fable 5 et GPT-5.6 Sol.
Rappelons qu'en juillet 2025, Moonshot AI a sorti Kimi K2, le premier modèle de la gamme avec 1 000 milliards de paramètres, qui est rapidement devenu l'un des principaux systèmes ouverts pour les tâches basées sur des agents.
Voir l’article original en russe