次世代模型 Astra 網路能力逼近「Critical」級 OpenAI 暫限制開發與內部使用

Author:

Published:

- 廣告 -

OpenAI 於 8 月 7 日(美國時間)發表聲明,指出其即將推出的次世代模型 Astra 在內部評估中,於代理式編碼(agentic coding)與網路安全能力上展現顯著進步,已無法排除達到公司「應變準備框架」(Preparedness Framework)中最高等級的「Critical(關鍵)」網路能力門檻。為優先確保安全,OpenAI 已暫時限制 Astra 在隔離測試環境以外的開發與內部使用。

根據 OpenAI 的說明,應變準備框架於 2023 年 12 月首次公布,用於識別模型在包括網路安全等領域的能力進展,並規劃相應應對措施。該框架將「Critical」級網路能力定義為:模型可在無人類干預下,識別並開發多個加固現實關鍵系統的各嚴重程度零日漏洞(zero-day exploits),或僅根據高層次目標,自行設計並執行針對加固目標的端到端新型網路攻擊策略。

目前 OpenAI 現有最高級模型(包括 GPT-5.6-Sol)的網路能力僅被評估為「High」等級,但 Astra 的初步評估結果已接近或可能達到 Critical 水平。因此,OpenAI 決定暫停不符合強化安全控制的 Astra 相關內部活動,並大幅提升防護措施,包括:

- 廣告 -
  • 採用隔離測試環境
  • 限制網路與工具存取權限
  • 加強模型權重保護與加密
  • 強化監控與偵測能力
  • 使用沙盒執行環境

此外,OpenAI 已在所有 Astra 的代理式應用(包括訓練與評估)實施通用監控,持續檢視模型的思維鏈(Chain of Thought),一旦偵測到高風險行為即觸發安全審查與中斷機制。

OpenAI 強調,具備先進網路能力的模型「應協助防禦方比攻擊者更早發現並修復漏洞」,並表示將與政府機構及選定的 AI 安全組織合作,測試 Astra 的能力,同時為第三方測試夥伴提供更高風險評估所需的安全控制建議。公司亦澄清,Astra 並未參與 7 月發生的 Hugging Face 安全事件。

OpenAI 執行長 Sam Altman 隨後在 X 平台發文指出:「Astra 是一個強大的模型,我們正努力讓它能廣泛提供。我們不認為把強大模型只留給少數人是好策略。但考量其網路能力,我們需要多一點時間才能安全地做到這點,希望不會拖太久。」

此次聲明顯示,OpenAI 在追求更強大模型的同時,正依據自身準備框架,主動對潛在的關鍵風險採取預防性限制。Astra 的最終公開時程目前尚未公布,但公司表明將繼續推進安全部署,期望相關能力最終能優先服務於防禦用途。

- 廣告 -
Buy Me a CPM: PCM 讀者會員資助計劃
- 廣告 -

Related Articles

- 廣告 -

Recent Articles

- 廣告 -

最新影片

- 廣告 -