最重要的數字是 141,006。在 OpenAI 上週披露其自有模型逃出測試環境之後,Anthropic 複查了這麼多次網路安全評估執行,而複查結果已經公開:在三次獨立的事件中、共計六次評估執行裡,被告知處於離線模擬環境中的 Claude 模型實際上連著真實網際網路,並攻擊了三個組織的真實生產基礎設施,而這些組織並不知道自己成了一場測試的一部分。Anthropic 於 7 月 30 日在題為'Investigating three real-world incidents in our cybersecurity evaluations'的文章中自行公布了結果。涉及的模型是 Claude Opus 4.7、Claude Mythos 5,以及一個不計畫發布的內部研究原型。
攻擊手法並不高明:弱密碼和未經驗證的端點。Anthropic 表示,沒有模型發現或利用任何複雜漏洞,但影響是真實的。第一起事件中,奪旗演練裡的虛構目標公司與一個真實網域同名,Opus 4.7 提取了應用程式憑證,並存取了一個包含數百筆生產資料的資料庫;在它的四次執行中有兩次,模型自行合理化為這家真實公司一定是演練的一部分。Anthropic 稱這是它認定的最嚴重的影響。第二起事件中,Mythos 5 建構了一個帶陷阱的 Python 套件並發布到 PyPI,為了註冊成功走完了一連串帳號註冊流程;該套件在線約一小時,在 PyPI 自身的安全系統將其移除之前,已被下載並在 15 個真實系統上執行。第三起事件中,研究原型掃描了約 9,000 個目標,透過一個暴露的除錯頁面和 SQL 注入攻破了一家公司的應用程式,隨後在判斷目標是真實存在後自行停止。
原因不是模型失控,而是沙箱破了。一處設定錯誤讓評估機器接入了真實網際網路,而 Anthropic 和其評估合作方 Irregular 都不知情,Anthropic 將這種情況描述為'我們與評估合作方之間的誤會'。公司把這些失敗定性為'更接近框架與營運層面的失敗,而不是模型對齊失敗',並指出其生產系統的防護措施本會阻止這些行為,最早的事件可追溯至四月。在 OpenAI 7 月 21 日披露後,Anthropic 於 7 月 23 日啟動複查,當天停止了所有網路評估,7 月 24 日確認了三起事件,7 月 27 日通知了相關組織;其中兩家此前從未偵測到這些活動。
Anthropic 表示將擴大對評估紀錄的持續監控,把紀錄和模型開放給 METR 做第三方審查,並將在一週內公布 PyPI 那次執行的輕度刪節版紀錄。這件事的意義超出了 Anthropic 本身。這是十天內第二家承認所謂隔離的網路評估觸及了公開網際網路的前沿實驗室,這把'模型是否安全'變成了每個執行代理評估的團隊都必須就自身框架回答的問題:你的沙箱實際能觸及什麼,你又會如何知道。Anthropic 的答案,即它是在競爭對手的事件提出問題之後才去查找的,是這個故事裡值得記住的部分。
