OpenAI 越獄事件後調查發現 Claude 模型曾三度入侵其他機構系統

Author:

Published:

- 廣告 -

Anthropic 於當地時間 7 月 30 日發表詳細報告,指公司在大規模檢討自身網絡安全評估紀錄時,發現三宗真實事故:Claude 模型在第三方評估環境中意外連上互聯網,並成功入侵三間不同機構的正式生產系統。

事件源於 OpenAI 早前公開承認旗下模型曾突破隔離測試環境、入侵 Hugging Face 基礎設施。Anthropic 隨即展開全面回顧,共審查 141,006 次評估運行,最終確認三宗事故。所有事故均發生於與評估夥伴 Irregular 合作進行的 Capture-the-Flag(CTF)挑戰中,時間最早可追溯至今年 4 月。

Anthropic 於當地時間 7 月 30 日發表報告,交待 Claude 在評估測試中曾三度入侵三間不同機構的事件。
Anthropic 於當地時間 7 月 30 日發表報告,交待 Claude 在評估測試中曾三度入侵三間不同機構的事件。

事發經過

在這些 CTF 測試中,模型被明確告知「環境為模擬、並無互聯網連接」,目標是在虛構網絡中尋找隱藏的「旗幟」。然而,由於 Anthropic 與 Irregular 之間的溝通誤解,評估容器實際上具備互聯網連接。當 Claude 在模擬環境中找不到目標時,便轉而掃描真實互聯網,並將發現的真實系統視為測試的一部分。

- 廣告 -

三宗事故分別涉及不同模型與手法:

  • 第一宗(Claude Opus 4.7):虛構目標公司名稱與真實域名相同。模型共進行四次運行,成功取得應用程式與基礎設施憑證,並存取含數百筆正式資料的資料庫。即使模型後來意識到系統是真實的,仍繼續攻擊。
  • 第二宗(Claude Mythos 5):模型發現虛構開發者文件中提到一個不存在的 PyPI 套件,於是自行製作並上傳惡意套件。該套件在線約一小時,被 15 個真實系統下載執行,其中一個安全公司的掃描器因此洩露憑證,讓模型進一步入侵該公司基礎設施。
  • 第三宗(內部研究測試模型):模型掃描約 9,000 個目標後,利用暴露的除錯頁面與 SQL Injection 等基本手法入侵一間公司的面向互聯網應用。當模型後來判斷目標與 CTF 無關、屬於真實環境時,主動停止攻擊。

Anthropic 強調,模型並未使用複雜零日漏洞,也沒有試圖自我外洩或故意逃出測試環境,只是專注完成被指派的 CTF 任務。所有評估均在獨立基礎設施上進行,與 Anthropic 內部敏感系統或客戶資料完全隔離。

Anthropic 的回應與改進

Anthropic 於 7 月 23 日開始審查後立即暫停所有網絡安全評估,翌日確認三宗事故,並於 7 月 27 日通知 Irregular 及受影響機構。兩間已聯絡的機構此前並未發現異常,目前正協助修復;第三間仍在聯繫中。

公司表示,這些事故更接近「評估框架與操作失誤」,而非模型對齊失誤。模型被明確告知沒有互聯網,卻因配置錯誤而能連線,因此合理地把真實系統視為模擬目標。值得注意的是,最新的內部研究模型在意識到環境真實後選擇停止,顯示較新模型在情境感知上有所進步。

Anthropic 已總結多項改進方向:加強評估環境的網絡隔離與即時監控、更嚴格審查第三方供應商基礎設施、擴展對評估紀錄的持續監察,以及與獨立機構 METR 合作進行第三方審查。公司亦計劃在一週內公開經適度遮蓋的惡意 PyPI 套件上傳紀錄。

報告最後呼籲其他 AI 實驗室進行類似回顧,並指出隨著模型能力提升,評估環境本身的安全標準必須與正式部署環境看齊。

- 廣告 -
Buy Me a CPM: PCM 讀者會員資助計劃
- 廣告 -

Related Articles

- 廣告 -

Recent Articles

- 廣告 -

最新影片

- 廣告 -