Moonshot AI 于 7 月 27 日发布了 Kimi K3,最重要的数字是 2.8 万亿:这是一个混合专家架构的总参数量,共有 896 个专家,每个 token 激活其中 16 个,即 1040 亿活跃参数。上下文窗口为一百万 token,模型原生多模态,权重以 4 位 MXFP4 格式发布在 Hugging Face 的 moonshotai/Kimi-K3 下,这使它成为迄今公开发布的最大模型。在 Artificial Analysis 的智能指数上它排名第三,位于 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 之后。
定价讲述着自己的故事。ChinAI 对这次发布的分析将其策略称为可负担的奢侈品:对标海外旗舰的性能,同时把价格锚定在中国国内市场的天花板上。K3 的混合费率约合每百万 token 2.30 美元,缓存命中的输入价格是未命中的十分之一,而它的输出价格是前代 K2.6 的 3.5 倍。国内竞争对手远低于此:阿里的 Qwen3.7 Max 为 1.40 美元,智谱的 GLM-5.2 为 0.90 美元,DeepSeek V4 Pro 为 0.18 美元。这个赌注是中国前沿实验室可以不再向下竞速,而早期需求以最不舒服的方式证实了它:发布两天后,Moonshot 因计算容量不足暂停了新订阅并实施了使用限制。
这一周余下的部分属于基础设施。7 月 29 日,Moonshot 以 MIT 许可开源了 MoonEP,即它认为为 K3 带来 2.5 倍扩展效率提升的专家并行通信库。其核心承诺是精确的负载均衡,无论路由多么倾斜,每个 rank 收到的 token 数量完全相同,从而消除了拖慢大型 MoE 训练的逐层主机同步;FlashKDA 和 AgentEnv 同期发布。7 月 30 日,AWS 发布了官方部署指南,它不动声色地定义了这个规模上开放的含义:参考配置是单个 ml.p6-b300.48xlarge 实例,搭载八块 NVIDIA B300 Blackwell Ultra GPU,由 vLLM 以八卡张量并行提供服务。
对构建者而言,这一周归结为三个事实。史上最大的开放权重模型存在了,今天就能下载。自己运行它的起点是一整机架 NVIDIA 最新的加速器,所以开放和可及不是同一个词。而制造商按旗舰而非引流品定价,却仍然耗尽了容量,这比任何基准测试表格都更能说明前沿级开放模型的需求在哪里。
