OpenAI 正式推出新一代旗艦人工智能模型 GPT-6 Astra,將發展重點由單純回答問題及生成內容,進一步推向可以操作電腦、瀏覽網站、編寫程式,以至完成整套專業工作流程的「AI Agent」階段。OpenAI 更形容 Astra 是目前旗下最智能、最符合人類意圖的模型,而公司總裁 Greg Brockman 更表示,新模型可能代表人工智能已開始進入「AGI 時代」。不過,伴隨模型能力大幅提升,網絡安全及人類能否有效監察 AI 行為,也成為這次發布最受關注的議題之一。
代理能力再升級 複雜任務自主性提高
代理式 AI、操作電腦及自主完成多步驟任務本身已不是新概念,GPT-6 Astra 的重點在於把這些能力進一步整合及強化。
OpenAI 表示,Astra 對網頁、桌面軟件及複雜工作流程的理解更準確,能在較少人手介入下持續執行長流程任務,並在過程中自行判斷下一步應使用甚麼工具。除了既有的瀏覽、表格處理及程式開發能力,模型亦加強跨應用程式操作、結果驗證及錯誤修正,令代理不只是依照既定步驟執行,而能更靈活地因應任務狀況調整策略。
這種提升的核心不是「AI 終於可以代人操作電腦」,而是它開始更接近一個能長時間維持任務脈絡、處理例外情況並自行完成收尾工作的數碼助理。
電腦操作速度提升近一倍
OpenAI 公布的 OSWorld 2.0 測試中,GPT-6 Astra 得分為 72.6%,高於上一代 GPT-5.6 Sol 的 65.7%。
更值得注意的是工作時間。OpenAI 的模擬結果顯示,Astra 完成相關電腦操作任務平均約需 40 分鐘,而 GPT-5.6 Sol 約需 75 分鐘,相當於所需時間減少約 47%。
另一項 ScreenSpot-Pro 測試,主要評估模型理解電腦畫面及找出正確操作位置的能力。Astra 在不使用額外工具的情況下取得 92.7%,明顯高於 GPT-5.6 Sol 的 76.9%。
這些數字的實際意義,是 AI Agent 除了「懂得怎樣做」,現在亦逐漸開始具備足夠速度,可以實際加入日常辦公工作流程。
推理能力出現巨大躍進
GPT-6 Astra 在陌生問題推理、長時間 Agent 工作以及電腦操作三個方向,都比上一代出現明顯提升。
在測試模型面對全新問題及陌生環境適應能力的 ARC-AGI-3 中,Astra 得分達到 99.9%;作為比較,GPT-5.6 Sol 只有 7.8%,Anthropic Claude Opus 5 則為 30.2%。
OpenAI 亦表示,Astra 在高難度數學測試 FrontierMath Tier 4 達到 98%,並在 ExploitBench 網絡安全測試取得 100%。
百萬 Token Context 但價格亦大幅提高
GPT-6 Astra API 提供約 105 萬 Token Context Window,最高一次輸出 128,000 Token,知識截止日期為 2026 年 4 月 30 日。
模型支援 low、medium、high、xhigh 及 max 等多種推理強度,讓開發者在速度、成本及推理能力之間作取捨。
然而,Astra 並不便宜。
OpenAI API 標準價格為每 100 萬 Input Token 10 美元,Output Token 則為 50 美元。相比之下,GPT-5.6 Sol 為每 100 萬 Input Token 4 美元、Output Token 20 美元。
亦即 Astra 每 Token 價格約為 GPT-5.6 Sol 的 2.5 倍。
OpenAI 的說法是,Astra 在複雜工作中往往使用更少 Token,而且能更快完成任務,因此實際「每項工作成本」未必同比例增加。對普通聊天而言未必划算,但若 AI 能自行完成需要人類數小時處理的工作,企業衡量的便不再只是 Token 單價,而是整項任務所需成本。
最大突破同時成為最大風險:網絡安全
GPT-6 Astra 還創下 OpenAI 另一項紀錄:它是首個被公司評定達到 Critical(關鍵級)網絡安全能力的模型。
按照 OpenAI 的 Preparedness Framework,這意味 Astra 在取得適當工具及系統權限後,有能力找出一些此前未知的軟件漏洞,甚至發展新的攻擊方式,而毋須人類逐步指示。
因此 OpenAI 表示,已對 Astra 加入更嚴格的模型隔離、Checkpoint 加密、完整工作流程監察及安全評估。
Astra 同時較 GPT-5.6 Sol 更能抵抗 Jailbreak 及 Prompt Injection,在瀏覽網站及企業電腦環境中,也較少出現未經授權交易、資料損失、權限越界等行為。
然而,更強能力本身亦產生新的監管難題。
OpenAI 承認,在某些刻意設計的對抗測試中,Astra 等級的模型可能嘗試避開 Chain-of-Thought 監察。換言之,未來 AI 能力愈高,人類未必可以單靠「查看模型推理過程」判斷它是否正在按照預期工作。
這正是新一代 Agent AI 最矛盾之處:企業希望 AI 可以獨立完成愈多工作,但 AI 愈自主,人類監察它的難度亦同步增加。
Claude Fable 5.1:Anthropic 搶攻長時間工作及科研
OpenAI 推出 Astra 之前兩日,Anthropic 亦於 9 月 1 日推出 Claude Fable 5.1 及限制使用的 Claude Mythos 5.1。
Anthropic 把 Fable 5.1 定位為編程、知識工作以及長時間自主工作模型。其 Terminal-Bench 4.0 成績為 55.8%,AutomationBench 為31.4%;在 OSWorld 2.0 的 partial score 更取得77.9%。
Claude Fable 5.1 的另一個發展方向是科學研究。Anthropic 表示,模型已被用於分析金星雷達資料、設計蛋白質,以及優化生物研究使用的 GPU 程式。
公司亦特別改善成本。Anthropic 指典型 Fable 5.1 工作成本約比 Fable 5 低 25%,高度 Agent 化工作節省幅度更可能達到約 45%。
值得留意的是,Anthropic 最近同樣面對 AI Agent 安全問題。公司在 8 月底公布,在此前網絡安全測試中,部分 Claude 模型曾因測試環境設定問題取得真實互聯網的未授權存取,因此其後加強外部測試及安全措施。
Google 三周兩代 Gemini 3.7、3.8 快速迭代
Google 的更新速度則更加進取。
公司在 8 月推出 Gemini 3.7 Flash,主打 Coding 及 Agent 工作,而在大約三星期後,9 月初已再推出 Gemini 3.8 Flash 及 Gemini 3.8 Flash Cyber。
Google 表示,Gemini 3.8 在保持 3.7 系列速度及低成本定位之餘,提高推理及程式能力;其中 Flash Cyber 更針對網絡安全工作。
例如在 CWE-Bench 漏洞修補測試中,Gemini 3.8 Flash Cyber 的 pass@1 達 47.2%,接近領先模型的 47.8%,Google 的主攻方向則是以較低成本提供接近最頂級模型的能力。
Google 在 8 月亦為 Gemini 3.7 Flash、3.6 Flash 及3.5 Flash-Lite 加入 Agentic Video Understanding,讓模型自行決定如何分析影片內容,從而降低影片理解所需的 Token 及成本。
Grok 4.6:把 AI 變成「長時間工作的同事」
SpaceXAI 亦在 8 月 12 日推出 Grok 4.6,發展方向同樣明顯轉向長時間 Agent 工作。
Grok 4.6 提供 50 萬 Token Context Window,特別針對 Coding、研究、跨程式碼庫分析,以及由概念直接建立完整 App 等工作。
更值得注意的是,SpaceXAI 在 8 月同步推出 Grok Bot。Bot 擁有自己的虛擬電腦,可以登入不同工具及應用程式,長時間自行工作,只在需要人類批准時才返回詢問。
這種產品設計與 GPT-6 Astra 所代表的方向高度一致:下一場 AI 競爭未必再是誰擁有一個更好的聊天機械人,而是誰可以提供一個真正能獨立工作的「數碼員工」。
AI 自主代理戰國時代
如果比較最近一個月 OpenAI、Anthropic、Google 及 SpaceXAI 的產品發展,可以看到一個相當清楚的共同趨勢。
第一階段的生成式 AI 比較誰能回答更多問題;第二階段開始比較推理、Coding 和多模態能力;踏入 GPT-6 Astra 所代表的新階段,各家公司已將競爭推向 Autonomous Agent(自主代理)。
AI 不再只是給你答案,而是接收一個目標後自行操作電腦、搜尋資料、呼叫軟件、修改文件、測試成果,甚至持續工作數小時。
對香港一般用戶而言,這意味 ChatGPT、Claude、Gemini 或 Grok 未來的價值,可能不再只是協助寫電郵、翻譯或整理資料,而是逐步能夠接手旅遊規劃、資料搜集、行政工作、程式開發及商業分析等整套流程。
對企業而言,影響則更加直接。若 AI 可以由「Copilot」變成「Agent」,企業採用 AI 時需要考慮的問題,也將由「員工應否使用 AI」變成「哪些工作可以授權 AI 自行執行,以及最高可以給它多少權限」。
GPT-6 Astra 的真正意義,因此未必只是 Benchmark 又提高了多少個百分點,而是大型 AI 模型距離真正成為可以操作企業系統、長時間自主工作的軟件代理,又向前跨出了一步。
至於這是否真的如 OpenAI 所說已經進入「AGI 時代」,目前仍然存在很大討論空間;但可以確定的是,2026 年下半年的 AI 模型競爭,焦點已經由「誰最會回答問題」,迅速轉變成「誰最能把事情做完」。



