Moonshot AI a lance Kimi K3 le 27 juillet, et le chiffre qui compte est 2,8 billions : le total des parametres d'une architecture a melange d'experts comptant 896 experts specialises, dont 16 s'activent par token pour 104 milliards de parametres actifs. La fenetre de contexte est d'un million de tokens, le modele est nativement multimodal, et les poids sont sur Hugging Face sous moonshotai/Kimi-K3 en MXFP4 4 bits, ce qui en fait le plus grand modele publie ouvertement a ce jour. Sur l'indice d'intelligence d'Artificial Analysis, il arrive troisieme, derriere Claude Fable 5 d'Anthropic et GPT-5.6 d'OpenAI.

Le prix raconte sa propre histoire. L'analyse de ChinAI qualifie la strategie de luxe abordable : egaler la performance des vaisseaux amiraux etrangers tout en ancrant le prix au plafond du marche interieur chinois. Le tarif mixte de K3 tourne autour de 2,30 $ par million de tokens, l'entree en cache coutant un dixieme du tarif hors cache, et son prix de sortie est 3,5 fois celui de son predecesseur K2.6. La concurrence domestique se tient loin en dessous : Qwen3.7 Max d'Alibaba a 1,40 $, GLM-5.2 de Zhipu a 0,90 $, DeepSeek V4 Pro a 0,18 $. Le pari, c'est que les laboratoires chinois de pointe peuvent cesser la course vers le bas, et la demande initiale l'a confirme de la facon la moins confortable possible : deux jours apres le lancement, Moonshot a suspendu les nouveaux abonnements faute de capacite de calcul et impose des limites d'usage.

Le reste de la semaine a ete de l'infrastructure. Le 29 juillet, Moonshot a publie MoonEP sous licence MIT, la bibliotheque de communication pour parallelisme d'experts qu'elle credite d'un gain d'efficacite d'echelle de 2,5x sur K3. Sa promesse centrale est un equilibre de charge exact, chaque rang recoit le meme nombre de tokens peu importe l'asymetrie du routage, ce qui elimine la synchronisation hote par couche qui etrangle l'entrainement des grands MoE ; FlashKDA et AgentEnv sont sortis en meme temps. Le 30 juillet, AWS a publie son guide officiel de deploiement, qui definit sans le dire ce que veut dire ouvert a cette echelle : la configuration de reference est une seule instance ml.p6-b300.48xlarge portant huit GPU NVIDIA B300 Blackwell Ultra, servis par vLLM en parallelisme tensoriel sur les huit.

Pour ceux qui construisent, la semaine se resume a trois faits. Le plus grand modele a poids ouverts de l'histoire existe et se telecharge aujourd'hui. Le faire tourner soi-meme commence a un rack des accelerateurs les plus recents que NVIDIA vende, donc ouvert et accessible ne sont pas le meme mot. Et le fabricant l'a tarife comme un vaisseau amiral, pas comme un produit d'appel, puis a manque de capacite quand meme, ce qui en dit plus long sur la demande pour les modeles ouverts de classe frontiere que n'importe quel tableau de benchmarks.