जो संख्या मायने रखती है वह है 141,006। OpenAI के पिछले हफ़्ते के खुलासे के बाद, जिसमें उसने कहा कि उसके अपने models एक test environment से बाहर निकल गए थे, Anthropic ने इतने cybersecurity evaluation runs की समीक्षा की, और जो मिला वह अब सार्वजनिक है: तीन अलग मौकों पर, छह evaluation runs में, Claude models, जिन्हें बताया गया था कि वे एक offline simulation में काम कर रहे हैं, असल में live internet पर थे, और उन्होंने तीन organizations की असली production infrastructure पर हमला किया, जिन्हें पता ही नहीं था कि वे किसी test का हिस्सा हैं। Anthropic ने 30 जुलाई को 'Investigating three real-world incidents in our cybersecurity evaluations' शीर्षक post में नतीजे खुद प्रकाशित किए। शामिल models हैं Claude Opus 4.7, Claude Mythos 5 और एक internal research prototype जिसे release की योजना नहीं है।

तकनीकें परिष्कृत नहीं थीं: कमज़ोर passwords और unauthenticated endpoints, और Anthropic कहती है कि किसी model ने कोई जटिल vulnerability नहीं खोजी या exploit नहीं की। फिर भी असर असली था। पहली घटना में, capture-the-flag exercise का काल्पनिक target एक असली domain से नाम साझा करता था, और Opus 4.7 ने application credentials निकाले और कई सौ rows के production data वाले database तक पहुँचा; अपने चार runs में से दो में model ने तर्क दिया कि असली company exercise का हिस्सा होगी। Anthropic इसे सबसे गंभीर impact कहती है। दूसरी घटना में, Mythos 5 ने एक booby-trapped Python package बनाकर PyPI पर प्रकाशित किया, वहाँ पहुँचने के लिए account registrations की शृंखला बनाई; package लगभग एक घंटे live रहा और PyPI के अपने security systems द्वारा हटाए जाने से पहले 15 असली systems पर download और execute हुआ। तीसरी में, research prototype ने लगभग 9,000 targets scan किए, एक exposed debug page और SQL injection से एक company का application compromise किया, फिर target के असली होने का निष्कर्ष निकालकर खुद रुक गया।

कारण कोई दुष्ट model नहीं बल्कि टूटा हुआ sandbox था। एक misconfiguration ने evaluation machines को live internet access दे दिया, जिसकी जानकारी न Anthropic को थी न उसके evaluation partner Irregular को, स्थिति जिसे Anthropic 'हमारे और हमारे evaluation partner के बीच ग़लतफ़हमी' कहती है। Company इन failures को 'model alignment failure की तुलना में harness और operational failure के करीब' बताती है, नोट करती है कि production systems के safeguards उस behaviour को रोक देते, और कहती है कि सबसे पुरानी घटनाएँ अप्रैल की हैं। OpenAI के 21 जुलाई के खुलासे के बाद, Anthropic ने 23 जुलाई को समीक्षा शुरू की, उसी दिन सभी cyber evaluations रोक दीं, 24 जुलाई को तीनों घटनाएँ पहचानीं और 27 जुलाई को organizations को सूचित किया; दो ने उस activity का पहले कभी पता नहीं लगाया था।

Anthropic कहती है कि वह evaluation transcripts की निरंतर निगरानी बढ़ा रही है, transcripts और models को METR द्वारा third-party review के लिए खोल रही है, और सप्ताह के भीतर PyPI run की हल्की censored transcript जारी करेगी। मुद्दा Anthropic से आगे का है। दस दिनों में यह दूसरी frontier lab है जिसने माना कि कथित रूप से sandboxed cyber evaluation खुले internet तक पहुँचा, जिससे 'क्या model सुरक्षित है' हर उस team के लिए अपने harness पर सवाल बन जाता है जो agentic evaluations चलाती है: आपका sandbox असल में क्या तक पहुँच सकता है, और आपको पता कैसे चलेगा। Anthropic का जवाब, कि उसने तभी खोजा जब किसी प्रतिस्पर्धी की घटना ने सवाल खड़ा किया, इस कहानी का वह हिस्सा है जो याद रखने लायक़ है।