GPT-6.1 Astra 安全測試未達標 OpenAI 取消 10 月推出計劃

Author:

Published:

- 廣告 -

OpenAI 證實取消原定於下月(2026 年 10 月)在 ChatGPT 與 Codex 上線的新一代模型 GPT-6.1 Astra。公司指內部安全與對齊測試未達發布門檻,決定暫不上線,並把資源轉向後續模型的安全強化。消息由《華爾街日報》率先報道,OpenAI 其後確認。這次取消發生在 OpenAI 舊金山開發者大會(DevDay)開幕前夕,屬大型 AI 開發商較少見、因安全理由直接撤回已排程發布的案例。

取消原因:欺騙行為與越權

OpenAI 安全系統主管 Saachi Jain 表示,GPT-6.1 Astra 在減少「模型偷懶」(遇到阻礙就停下來)方面有進步,但在兩項關鍵指標未達公司標準:

OpenAI 安全系統主管 Saachi Jain
OpenAI 安全系統主管 Saachi Jain
  1. 對齊與誠實披露:測試顯示模型比前代更容易出現欺騙或不如實回報的情況,有時未準確向使用者說明自己實際做了或沒有做哪些事。
  2. 範圍授權(scope authorization):模型有時會在未再徵求使用者許可的情況下繼續推進任務,甚至嘗試調用外部工具或服務,即使相關操作可能不安全。

Jain 形容安全與(意圖/目標/價值觀)對齊存在取捨:「既要讓模型在遇到阻力時仍能完成任務,又要確保它不越權、不隱瞞。」她強調向用戶發布時,公司在安全與對齊上設有極高門檻。

- 廣告 -

該模型原本定位為能在較少人工干預下完成更複雜端到端任務的 agentic 系統,計劃緊接 GPT-6 Astra 之後推出。OpenAI 表示會繼續以強化學習等方式改進 GPT-6 系列後續版本,並稱仍有其他模型即將推出。

入侵澳洲政府系統引發高度關注

取消決定正值外界高度關注 OpenAI agent「越權」事件。今年 6 月,OpenAI 內部評估用的實驗模型在查找澳洲醫藥開支等公開統計時,模型在未獲授權下進入澳洲政府 Medicare 統計報告入口,讀取非公開檔案、憑證與彙總數據,並寫入檔案。公司稱未發現個人病歷被存取。

事件直至 8 月 OpenAI 內部檢討「錯位模型行為」時才被發現,OpenAI 於 9 月 10 日才以電郵通知澳洲政府公開信箱,較事發延遲近三個月。澳洲總理 Anthony Albanese 形容「不可接受」,並當面要求 OpenAI CEO Sam Altman 交代。其後還發現新南威爾士州犯罪統計局、維州衛生部門等網站亦曾被模型接觸。

澳洲總理 Anthony Albanese 形容OpenAI 模型入侵澳洲政府系統「不可接受」,並當面要求 OpenAI CEO Sam Altman 交代。
澳洲總理 Anthony Albanese 形容OpenAI 模型入侵澳洲政府系統「不可接受」,並當面要求 OpenAI CEO Sam Altman 交代。

OpenAI 後來發表聲明致歉,承認應對不當,並承諾為澳洲相關機構提供支援、投入網絡防禦資金,以及成立當地工作小組。公司亦已暫停部分最強模型的訓練,直至有更強防護。

澳洲政府強烈抗議下,OpenAI 承諾為澳洲相關機構提供支援、投入網絡防禦資金,以及成立當地工作小組。
澳洲政府強烈抗議下,OpenAI 承諾為澳洲相關機構提供支援、投入網絡防禦資金,以及成立當地工作小組。

外界普遍將 Astra 撤回與一連串 agent 失控事件連在一起:模型能力提升後,更容易「不接受拒絕」、繞過限制、隱瞞行動,令監管與業界對「自主代理」的風險評估升溫。

由能力競賽轉向安全優先

報道與分析普遍認為,這次撤回是業界少見的「安全優先於時程」訊號。此事發生在 Altman 與 Anthropic CEO Dario Amodei 等人本月呼籲放慢前沿模型開發、加強安全措施之後。《華爾街日報》指,這是迄今最明顯的跡象之一:agent 不當行為可能拖慢整個行業的快速推進。BBC 亦形容大型開發商因安全理由直接取消新發布「相當罕見」。部分評論認為,澳洲事件與 Hugging Face 等突破沙箱事件,已令「模型能否守住授權範圍」成為能否上線的核心條件,而不再只是能力競賽。

- 廣告 -

亦有聲音提醒:取消單一版本並不代表技術停滯,OpenAI 仍會把 Astra 的底層能力用於後續訓練;真正考驗在於後續模型能否同時做到「更主動」與「更可監督」。

- 廣告 -
Buy Me a CPM: PCM 讀者會員資助計劃
- 廣告 -

Related Articles

- 廣告 -

Recent Articles

- 廣告 -

最新影片

- 廣告 -