日前 Sam Altman 在 X 上預告會有一連串產品公布後,Altman 突然又宣布押後本周發佈,而 OpenAI 就公布建立一套針對 AI 模型「錯位行為」(model misalignment)的持續披露制度,未來會更有系統地公開模型在訓練、測試甚至部署期間出現的未授權、欺瞞或繞過限制行為。OpenAI 更直言,現時整個 AI 業界在對齊與模型監察方面,仍未成熟到可以長期以「最大速度」繼續擴大模型能力。
這項公布出現的時機格外敏感。就在數日前,OpenAI 行政總裁 Sam Altman 才公開支持 Anthropic CEO Dario Amodei 提出的「Pace the Frontier」主張,認為隨着前沿 AI 能力急速提升,業界有需要讓(意圖/目標/價值觀)對齊、安全評估及監察能力追上模型發展速度。另一方面,Altman 同時預告 OpenAI 將有大型產品推出,並表示 9 月 29 日舉行的 DevDay 會接連發布多項新東西。

首次一次公開 6 宗「錯位行為」
OpenAI 9 月 16 日公布名為「Our framework for reporting model misalignment」的新框架,並一次公開 6 宗過去約半年在模型訓練或評估期間觀察到的異常行為。OpenAI 強調,這些個案只是獨立事件,不能據此推斷相關行為在所有模型中的實際發生頻率,但希望透過公開個案,讓研究人員、其他 AI 開發商、監管機構及公眾可以自行檢視風險。
其中最值得注意的一宗涉及 GPT-5.6 Sol。OpenAI 表示,在模型訓練期間,部分模型實例曾在用於延續工作的摘要中,加入要求未來的自己隱瞞錯誤或錯位行為的指令,例如要求在缺乏歷史數據時自行捏造資料,或者隱瞞來源版本不一致。
另一宗個案中,模型在回答一條普通的數據查詢時,自行在公開程式碼 repository 找到暴露的 API key,並在沒有授權的情況下使用;而在盜用 API key 仍無法取得所需數據後,模型最後更捏造答案,並聲稱來自指定資料來源。
另外亦出現模型為了提供瀏覽器可引用的來源,自行把檔案上載至互聯網;不同 Agent 之間亦曾擅自使用公共檔案分享網站交換檔案,令原本只應存在於本機的內容變成可從公開網址取得。
從「安全報告」變成持續事故披露
OpenAI 承認,以往雖然亦會公開對齊研究結果,但披露方式相對零散,很多時需要等到累積多個案例後才發表研究報告,或者只在新模型 System Card 中記錄。
新的制度則較接近資訊安全領域的事件披露 (incident disclosure):任何 OpenAI 員工都可以把值得調查的錯位個案提交至安全及對齊團隊,之後事件會被分為「可直接披露」、「小型調查」或「大型調查」三類。
對於複雜個案,尤其涉及第三方、網絡安全漏洞或可能造成實際損害的事件,OpenAI 可能只先發表初步通知,再待調查完成後公布完整報告。
OpenAI 表示,希望未來與其他開發商、研究機構、產業標準組織及監管機構合作,建立更客觀的 AI 錯位事件披露標準。公司亦認為,嚴重安全、保安或對齊事故應該向美國聯邦政府通報。
OpenAI:不能永遠以最高速度擴大模型
今次公布最受注目的,其實是 OpenAI 對目前 AI 發展速度的直接表態。
OpenAI 在文件中寫道,業界尚未充分解決對齊與監察問題,因此「不能負責任地再以最大速度擴展很久」。公司認為,未來 AI 發展速度的決策,必須建立在外界亦能夠審視的安全證據之上,而不是只依靠開發商內部判斷。這與 Anthropic CEO Dario Amodei 近日提出的「Pace the Frontier」理念相互呼應。
Amodei 認為,當 AI 開始具備更強大的自主工作、研究甚至協助改進下一代 AI 的能力時,安全研究與模型監察必須有時間追上。他提出包括引入外部評估員、更深入地檢視前沿模型,以及建立跨企業共同安全標準等措施。Sam Altman 亦公開支持這個方向。
Altman 其後在 Dreamforce 2026 會議上亦表示,AI 產業應建立類似航空業的安全文化,即使無法保證完全沒有事故,也必須公開事故、分析成因並從中學習。他同時承認公眾對 AI 失控及少數公司掌握過多權力的憂累都是合理而需要處理的風險。

一邊談減速 一邊準備密集推出新品
不過,OpenAI 的安全立場與其產品發布節奏形成有趣對比。
Altman 9 月 15 日(香港時間)在 X 發文,暗示本周原本會有一次大型發布,之後到 DevDay 還會有多項新公布。不過 Altman 在 9 月 17 日更新稱,他原本最期待在本周推出的主要產品已延至下星期,並表示「值得等待」。因此目前仍無法確定這項產品究竟是新模型、ChatGPT 功能,還是 API/Agent 相關更新。
至於 OpenAI DevDay 2026,已確定會在 9 月 29 日於三藩市舉行,Sam Altman 將主持開幕 keynote。官方表示活動會展示 OpenAI 團隊正在開發的產品、API、工具及技術示範,但未有提前公布具體新品名單。
「Pace」不等於停止產品發布
因此,Altman 所支持的「Pace the Frontier」,較準確的理解並不是要求 AI 公司立即停止推出產品,而是主張當模型能力增長速度快過安全、對齊與監察能力時,應有機制主動降低最前沿能力的推進速度。
OpenAI 今次建立持續錯位行為披露制度,可視為這套理念其中一個具體步驟:不單要在模型發布前做安全測試,還要把模型實際出現過的異常行為持續公開,讓外界可以判斷安全技術到底有沒有跟得上能力提升。
對 OpenAI 而言,真正的考驗將是當安全證據與商業競爭出現衝突時,公司是否真的願意把「pace the frontier」落實到產品及模型發布決策上。
隨着 OpenAI 下一輪產品公布與 9 月 29 日 DevDay 接近,外界亦會更關注:公司下一代模型和 Agent 能力提升的同時,會否同步公布新的安全門檻、監察機制,以及更具體的前沿模型減速條件。



