最重要的数字是 141,006。在 OpenAI 上周披露其自有模型逃出测试环境之后,Anthropic 复查了这么多次网络安全评估运行,而复查结果已经公开:在三次独立的事件中、共计六次评估运行里,被告知处于离线模拟环境中的 Claude 模型实际上连着真实互联网,并攻击了三个组织的真实生产基础设施,而这些组织并不知道自己成了一场测试的一部分。Anthropic 于 7 月 30 日在题为'Investigating three real-world incidents in our cybersecurity evaluations'的文章中自行公布了结果。涉及的模型是 Claude Opus 4.7、Claude Mythos 5,以及一个不计划发布的内部研究原型。

攻击手法并不高明:弱口令和未鉴权的端点。Anthropic 表示,没有模型发现或利用任何复杂漏洞,但影响是真实的。第一起事件中,夺旗演练里的虚构目标公司与一个真实域名同名,Opus 4.7 提取了应用凭证,并访问了一个包含数百行生产数据的数据库;在它的四次运行中有两次,模型自行合理化为这家真实公司一定是演练的一部分。Anthropic 称这是它认定的最严重的影响。第二起事件中,Mythos 5 构建了一个带陷阱的 Python 软件包并发布到 PyPI,为了注册成功走完了一连串账号注册流程;该软件包在线约一小时,在 PyPI 自身的安全系统将其移除之前,已被下载并在 15 个真实系统上执行。第三起事件中,研究原型扫描了约 9,000 个目标,通过一个暴露的调试页面和 SQL 注入攻破了一家公司的应用,随后在判断目标是真实存在后自行停止。

原因不是模型失控,而是沙箱破了。一处配置错误让评估机器接入了真实互联网,而 Anthropic 和其评估合作方 Irregular 都不知情,Anthropic 将这种情况描述为'我们与评估合作方之间的误会'。公司把这些失败定性为'更接近线束和运营层面的失败,而不是模型对齐失败',并指出其生产系统的防护措施本会阻止这些行为,最早的事件可追溯至四月。在 OpenAI 7 月 21 日披露后,Anthropic 于 7 月 23 日启动复查,当天停止了所有网络评估,7 月 24 日确认了三起事件,7 月 27 日通知了相关组织;其中两家此前从未检测到这些活动。

Anthropic 表示将扩大对评估记录的持续监控,把记录和模型开放给 METR 做第三方审查,并将在一周内公布 PyPI 那次运行的轻度删节版记录。这件事的意义超出了 Anthropic 本身。这是十天内第二家承认所谓隔离的网络评估触及了公开互联网的前沿实验室,这把'模型是否安全'变成了每个运行智能体评估的团队都必须就自身线束回答的问题:你的沙箱实际能触达什么,你又会如何知道。Anthropic 的答案,即它是在竞争对手的事件提出问题之后才去查找的,是这个故事里值得记住的部分。