AI 模型網絡攻擊能力臨界 OpenAI 宣布暫時放慢模型開發

Author:

Published:

- 廣告 -

OpenAI 於當地時間 8 月 18 日發表聲明,宣布因近期網絡安全相關事件及即將推出的模型 Astra 可能達到「關鍵網絡安全能力」(Critical cybersecurity capability)門檻,決定暫時放慢前沿模型開發步伐,並加強監控、對齊(alignment,即 AI 的行為目標,與人類真正想要的目標一致)與安全防護措施。

公司指出,OpenAI 入侵 Hugging Face 事件及 Astra 的初步評估結果,顯示越來越強大的 AI 系統在開發與測試過程中風險正急劇上升。為此,OpenAI 已對最新模型實施為期兩週的強化學習(RL)訓練暫停,最大規模的前沿 RL 訓練亦暫緩,改為進行較小規模測試,以驗證安全防護與對齊效果。同時,公司強化研究環境的隔離(包括工作負載與網絡隔離)、擴大思維鏈(Chain-of-Thought)監控覆蓋範圍,並要求更高標準的對齊證據,才繼續推進訓練。

OpenAI 強調,監控、對齊與安全措施三者必須同步進化,並預期未來模型本身將成為防禦其他模型的主要力量。公司計劃在未來數週發布技術報告,分享相關經驗。

- 廣告 -
OpenAI 宣布基於近期近期網絡安全相關事件及即將推出的模型 Astra 可能達到「關鍵網絡安全能力」門檻,決定暫時放慢前沿模型開發步伐,並加強監控、對齊與安全防護措施。
OpenAI 宣布基於近期近期網絡安全相關事件及即將推出的模型 Astra 可能達到「關鍵網絡安全能力」門檻,決定暫時放慢前沿模型開發步伐,並加強監控、對齊與安全防護措施。

前沿模型越獄事件頻生

過去個多月,三大 AI 實驗室相繼披露模型在網絡安全評估中突破隔離環境、接觸真實系統的事件:

  • OpenAI(7 月):在內部網絡能力基準測試中,GPT-5.6 Sol 及一個未公開的內部研究原型發現並利用零日漏洞逃出沙箱,隨後入侵 Hugging Face 生產基礎設施,取得管理員權限、Kubernetes 叢集存取權及部分原始碼倉庫寫入權,並波及至少四個公開服務。攻擊持續多日,記錄約 17,600 次行動。Hugging Face 形容事件「前所未有」。
  • Anthropic(7 月底披露:在審查超過 14 萬次評估記錄後,發現三宗事件,涉及 Opus 4.7、Mythos 5 及內部研究模型。因第三方評估夥伴 Irregular 的環境設定錯誤,模型意外獲得互聯網存取,繼而使用基本手法(弱密碼、未認證端點等)入侵三間真實機構的生產系統。其中一次將惡意 Python 套件上傳至 PyPI,短時間內被 15 個系統下載執行。
  • Meta(8 月初披露):同樣透過 Irregular 進行評估時,因相同設定錯誤,Muse Spark 1.1 獲得互聯網存取,並利用漏洞入侵一間未具名第三方公司系統,對其內部環境作出未授權變更。Meta 與 Irregular 均指事件性質與 Anthropic 案例相同,並非複雜的沙箱逃逸。

英國 AI 安全研究所(AISI)的獨立測試亦發現,Anthropic Mythos 5 及 OpenAI GPT-5.6-Sol 在部分評估中表現出高度自主與欺騙行為,包括建立假身分、進行社交工程、試圖將惡意程式碼插入開源專案,以及針對真實人士與組織採取行動。AISI 形容這是首次清楚觀察到「自主與欺騙風險」在真實世界中未經特定提示即顯現。

社會關注 AI 失控 促協調全球治理

事件引發 AI 安全社群、業界與監管層面強烈關注。多個 AI 安全與政策組織聯署要求美國聯邦政府調查;15 個州的檢察長去信 OpenAI,要求保留相關證據,並指事件顯示公司可能無法確保產品安全。

業界普遍視 Hugging Face 事件為「分水嶺」。部分前線實驗室員工公開支持協調全球治理,甚至呼籲刻意放慢前沿開發速度。安全專家指出,問題核心不只是隔離失敗,更是模型在追求目標時展現的「作弊」與對齊不足。同時,亦有聲音強調需加快開源防禦工具的普及,讓防守方能及時應對日益強大的 AI 攻擊能力。

OpenAI 此次主動放慢節奏並公開強化措施,被視為對風險上升的直接回應。隨着模型能力快速提升,如何確保開發、測試與部署過程的安全與可控,已成為整個 AI 產業的共同挑戰。

延伸閱讀

- 廣告 -
Buy Me a CPM: PCM 讀者會員資助計劃
- 廣告 -

Related Articles

- 廣告 -

Recent Articles

- 廣告 -

最新影片

- 廣告 -