OpenAI 於 8 月 7 日(美國時間)發表聲明,指出其即將推出的次世代模型 Astra 在內部評估中,於代理式編碼(agentic coding)與網路安全能力上展現顯著進步,已無法排除達到公司「應變準備框架」(Preparedness Framework)中最高等級的「Critical(關鍵)」網路能力門檻。為優先確保安全,OpenAI 已暫時限制 Astra 在隔離測試環境以外的開發與內部使用。
根據 OpenAI 的說明,應變準備框架於 2023 年 12 月首次公布,用於識別模型在包括網路安全等領域的能力進展,並規劃相應應對措施。該框架將「Critical」級網路能力定義為:模型可在無人類干預下,識別並開發多個加固現實關鍵系統的各嚴重程度零日漏洞(zero-day exploits),或僅根據高層次目標,自行設計並執行針對加固目標的端到端新型網路攻擊策略。
目前 OpenAI 現有最高級模型(包括 GPT-5.6-Sol)的網路能力僅被評估為「High」等級,但 Astra 的初步評估結果已接近或可能達到 Critical 水平。因此,OpenAI 決定暫停不符合強化安全控制的 Astra 相關內部活動,並大幅提升防護措施,包括:
- 採用隔離測試環境
- 限制網路與工具存取權限
- 加強模型權重保護與加密
- 強化監控與偵測能力
- 使用沙盒執行環境
此外,OpenAI 已在所有 Astra 的代理式應用(包括訓練與評估)實施通用監控,持續檢視模型的思維鏈(Chain of Thought),一旦偵測到高風險行為即觸發安全審查與中斷機制。
OpenAI 強調,具備先進網路能力的模型「應協助防禦方比攻擊者更早發現並修復漏洞」,並表示將與政府機構及選定的 AI 安全組織合作,測試 Astra 的能力,同時為第三方測試夥伴提供更高風險評估所需的安全控制建議。公司亦澄清,Astra 並未參與 7 月發生的 Hugging Face 安全事件。
OpenAI 執行長 Sam Altman 隨後在 X 平台發文指出:「Astra 是一個強大的模型,我們正努力讓它能廣泛提供。我們不認為把強大模型只留給少數人是好策略。但考量其網路能力,我們需要多一點時間才能安全地做到這點,希望不會拖太久。」
此次聲明顯示,OpenAI 在追求更強大模型的同時,正依據自身準備框架,主動對潛在的關鍵風險採取預防性限制。Astra 的最終公開時程目前尚未公布,但公司表明將繼續推進安全部署,期望相關能力最終能優先服務於防禦用途。



