Google 突發布 Gemini 3.8 Flash!編程、Agent 測試力壓 Opus 5

Author:

Published:

- 廣告 -

Google 今日突發宣佈推出最新一代輕量級 AI 模型 Gemini 3.8 Flash,以及專為網絡安全打造的 Gemini 3.8 Flash Cyber。這已經是 Google 在短短六星期內第三次更新 Flash 系列產品線。今次更新最令業界震驚的是,作為一個定位於高速度、低成本的「輕量級」模型,Gemini 3.8 Flash 在多項長程編程(Long-horizon Coding)與自主 Agent 測試中,表現竟超越或逼近頂級旗艦模型 Anthropic Claude Opus 5,再度刷亮「最強性價比」招牌。

編程與 Agent 基準測試:輕量級逆襲旗艦

根據 Google 官方及第三方機構 Artificial Analysis 的評測數據,Gemini 3.8 Flash 在長程軟體工程測試 DeepSWE v1.1 中取得了 73.7% 的高分,與 Opus 5 的 74.0% 僅差 0.3 個百分點;而在 Terminal-Bench 2.1 命令列 Agent 實測中,Gemini 3.8 Flash 更以 89.4% 的成績正式反超 Opus 5(89.1%)。此外,在 Vals Finance Agent v2 金融分析及 Harvey 法律 Agent 測試中,3.8 Flash 亦以明顯優勢領先。


不過,在 Terminal-Bench 4.0 等極高難度的綜合泛用 Agent 任務及 OSWorld 電腦操作上,Opus 5 依然保持領先。總括而言,Gemini 3.8 Flash 已成功在軟體開發、金融法律諮詢等實用領域達到頂級旗艦標準。

- 廣告 -

價格維持「平民價」 支援動態思考調校


在價格方面,Google 宣佈 Gemini 3.8 Flash 繼續維持 3.7 Flash 的超低 API 訂價,每 100 萬 Input Token 為 $0.75 美元,Output Token 為 $3.75 美元(推廣優惠至 2026 年 12 月 31 日),成本僅為 Opus 5 的七分之一左右。

今次 3.8 Flash 亦加入了全新的「思考力度調校」(Effort Levels)功能。開發者可以根據任務需求調整模型調用工具與推理的深度。雖然更高的思考深度會消耗更多 Token(使單次任務費用上升),但彈性的設定讓企業能精準掌控成本與輸出的品質平衡。

同場加映:Gemini 3.8 Flash Cyber 網絡安全專用版


除了標準版外,Google 亦同步發表了 Gemini 3.8 Flash Cyber。該版本在相同的基礎模型下進行安全微調,放寬了部分安全限制,專為資安防護與漏洞修復而設。官方測試顯示,在 CWE-Bench 自動漏洞修復測試中,Flash Cyber 的成功率達 47.2%,超越 GPT-5.6 Sol,將大幅降低企業進行滲透測試與自動化修補漏洞的門檻。

這款遊戲使用 Gemini 3.8 Flash 引擎,透過 Google Antigravity 中的循環指令,並根據簡單的提示創建而成。遊戲融合了謎題、環境敘事和 Nano Banana 生成的紋理,打造出一個沉浸式的 3D 關卡,玩家將扮演一位探索城堡的巫師。

這部影片詳細拆解了 Gemini 3.8 Flash 在各項基準測試中對決 Claude Opus 5 的表現,並分析了其極具競爭力的 API 價格與速度優勢,非常適合想迅速了解今次更新重點的讀者。

- 廣告 -

目前 Gemini 3.8 Flash 已於 Google AI Studio、Vertex AI 及 Antigravity 平台全面開放試用,預計將對現有 AI 部署市場帶來衝擊。

- 廣告 -
Buy Me a CPM: PCM 讀者會員資助計劃
- 廣告 -

Related Articles

- 廣告 -

Recent Articles

- 廣告 -

最新影片

- 廣告 -