最重要的数字是 80。7 月 30 日,OpenAI 把 GPT-5.6 Luna 的 API 价格下调 80%,至每百万输入 token 0.20 美元、输出 1.20 美元;GPT-5.6 Terra 下调 20%,至 2 美元和 12 美元。顶层的 Sol 价格不变,但获得 Fast 模式:最高提速 2.5 倍,价格为两倍,取代 Priority Processing。降价公布于题为'Advancing the price-performance frontier with GPT-5.6'的文章,前一天的一篇姊妹文章解释了公司所说的利润空间来源。
那个解释才是不同寻常的部分。OpenAI 表示,在 Codex 中运行的 GPT-5.6 Sol 自主重写并优化了用其自有的开源 GPU 语言 Triton 和 Gluon 编写的生产内核,将端到端服务成本降低了 20%。模型还围绕加速自身 token 生成的投机解码草稿模型设计并运行了数百次实验,把这项效率提升了 15% 以上,并在此过程中干预了硬件故障和训练不稳定。OpenAI 谨慎地将其表述为'由人主导的过程',并称 AI 编写的内核已用开源浮点检查工具 FpSan 验证。
分发与价格同速推进。三个 GPT-5.6 模型现已在 Amazon Bedrock 全面可用,并新增显式提示缓存模式:缓存读取按一折计费,写入按非缓存费率的 1.25 倍,TTL 30 分钟,每次请求最多四个缓存断点。本周的基准声明包括:最大推理档的 Sol 在 Artificial Analysis 的 Coding Agent 指数上以'不到一半的成本'击败 Anthropic 的 Claude Fable 5;Terra 以一半价格在智能基准上追平 GPT-5.5;Luna 在 Agents' Last Exam 上超过 Fable 5,估算每任务成本低 99%。
对构建者来说,实际的部分很简单:二季度写下的任何成本模型今天都已过时,而新的缓存经济学奖励稳定的提示前缀。细则部分需要更多时间。被广泛引用的'三月旗舰智能如今只卖十三分之一价格'是第三方测算,把 GPT-5.4 在某个公开指数上的分数与 Luna 对比,并非 OpenAI 的数字。自我优化的收益是 OpenAI 在自己定义的流程里测量自己。而'模型让自己更便宜'是关于买家无法检查的基础设施的主张。这些都不会让账单变得不真实,而是意味着:如今定价所依据的效率故事,和此前的基准一样,值得逐行细读。
