Le 28 juillet, Moonshot AI a annoncé tard hier soir qu'il ouvrirait les poids du modèle Kimi K3, publierait un rapport technique et ouvrirait simultanément trois technologies d'infrastructure (Infra) clés : MoonEP, FlashKDA et AgentEnv. Cette ouverture couvre les modèles, les méthodes de formation et les systèmes de formation sous-jacents. Les développeurs peuvent télécharger des modèles pour le déploiement et le développement secondaire. Le domaine d'utilisation spécifique doit être conforme à la licence Kimi K3.

Selon l'introduction officielle, Kimi K3 adopte une architecture experte hybride (MoE), avec une échelle totale de paramètres de 2 800 milliards, des capacités de compréhension visuelle natives et la prise en charge d'un million de fenêtres contextuelles de jetons. Par rapport à la génération précédente du Kimi K2.5, l'échelle des paramètres du Kimi K3 a été augmentée d'environ 3 fois. The Dark Side of the Moon a déclaré qu'avec des ressources informatiques limitées, utilisant des technologies telles que Kimi Delta Attention, Attention Residuals et MoonEP, l'efficacité de son modèle à l'échelle a augmenté d'environ 2,5 fois.
Le rapport technique Kimi K3 est également publié simultanément avec les poids du modèle. Selon le contenu public, le rapport a divulgué de nombreux détails techniques sur la formation du modèle et la conception de l'architecture, notamment la structure d'attention hybride KDA et Gated MLA, le mécanisme de routage expert Stable LatentMoE, la solution de formation de l'encodeur visuel MoonViT-V2 et les méthodes de formation et d'évaluation post-modèle. Parmi eux, le modèle adopte une conception MoE avec 896 experts en routage et 16 experts activés par chaque jeton, et couvre la formation et l'évaluation de plusieurs capacités telles que le raisonnement général, l'agent et l'agent de programmation.
En plus du modèle lui-même, Dark Side of the Moon a également annoncé l'open source des technologies d'infrastructure clés qui prennent en charge la formation Kimi K3. Parmi eux, MoonEP est un ensemble de bibliothèques de communication parallèle expertes hautes performances pour les modèles MoE à grande échelle ; FlashKDA est Kimi Delta Pour l'opérateur de calcul haute performance correspondant à Attention, les données officielles montrent que sa vitesse de pré-remplissage sur NVIDIA H20 est 1,72 à 2,22 fois supérieure à la ligne de base de l'attention linéaire flash ; AgentEnv est un système sandbox d'agent développé conjointement par Dark Side of the Moon et KVCache.ai, qui peut prendre en charge des fonctionnalités telles que des instantanés rapides, la récupération et Fork, et est utilisé dans des environnements de formation d'agent à grande échelle.
The Dark Side of the Moon a déclaré que cette ouverture vise à promouvoir le développement d’un écosystème de modèles pondérés ouverts. Il espère abaisser le seuil de déploiement et de développement de modèles en ouvrant des modèles, des méthodes de formation et des infrastructures sous-jacentes, et fournir davantage de ressources techniques réutilisables pour la communauté de l'IA et la recherche connexe.