Moonshot AI 於 7 月 27 日發布了 Kimi K3,最重要的數字是 2.8 兆:這是一個混合專家架構的總參數量,共有 896 個專家,每個 token 啟用其中 16 個,即 1040 億活躍參數。上下文視窗為一百萬 token,模型原生多模態,權重以 4 位元 MXFP4 格式發布在 Hugging Face 的 moonshotai/Kimi-K3 之下,這使它成為迄今公開發布的最大模型。在 Artificial Analysis 的智慧指數上它排名第三,位於 Anthropic 的 Claude Fable 5 與 OpenAI 的 GPT-5.6 之後。

定價訴說著自己的故事。ChinAI 對這次發布的分析將其策略稱為可負擔的精品:對標海外旗艦的效能,同時把價格錨定在中國國內市場的天花板上。K3 的混合費率約合每百萬 token 2.30 美元,快取命中的輸入價格是未命中的十分之一,而它的輸出價格是前代 K2.6 的 3.5 倍。國內競爭對手遠低於此:阿里的 Qwen3.7 Max 為 1.40 美元,智譜的 GLM-5.2 為 0.90 美元,DeepSeek V4 Pro 為 0.18 美元。這個賭注是中國前沿實驗室可以不再向下競速,而早期需求以最不舒服的方式證實了它:發布兩天後,Moonshot 因運算容量不足暫停了新訂閱並實施了使用限制。

這一週其餘的部分屬於基礎設施。7 月 29 日,Moonshot 以 MIT 授權開源了 MoonEP,即它認為為 K3 帶來 2.5 倍擴展效率提升的專家平行通訊函式庫。其核心承諾是精確的負載平衡,無論路由多麼傾斜,每個 rank 收到的 token 數量完全相同,從而消除了拖慢大型 MoE 訓練的逐層主機同步;FlashKDA 與 AgentEnv 同期發布。7 月 30 日,AWS 發布了官方部署指南,它不動聲色地定義了這個規模上開放的含義:參考配置是單一 ml.p6-b300.48xlarge 執行個體,搭載八顆 NVIDIA B300 Blackwell Ultra GPU,由 vLLM 以八卡張量平行提供服務。

對建構者而言,這一週歸結為三個事實。史上最大的開放權重模型存在了,今天就能下載。自己執行它的起點是一整機架 NVIDIA 最新的加速器,所以開放與可及不是同一個詞。而製造商按旗艦而非引流品定價,卻仍然耗盡了容量,這比任何基準測試表格都更能說明前沿級開放模型的需求在哪裡。