阿里巴巴今日(8 月 3 日)正式宣布推出 Qwen 3.8-Max,這是千問(Qwen)系列迄今規模最大、能力最強的旗艦模型。模型總參數達 2.4T,支援最高 100 萬 Token 上下文窗口,並原生支援視覺智能。目前全球開發者可透過阿里雲國際百煉平台(Alibaba Cloud Model Studio / QwenCloud)的 API 調用,模型權重預計下週公開。用戶亦可在阿里巴巴最新的一站式 AI 辦公智能體平台「千問辦公」(Qwen Work)上直接體驗。
核心規格與創新架構
Qwen 3.8-Max 基於 Qwen 3.5,採用稀疏混合專家(Sparse MoE)架構,並結合混合注意力機制。雖然總參數高達 2.4T,但實際推理時僅啟動約 95B 參數,成功在超大規模與高效推理之間取得平衡,相比同等規模的密集模型大幅降低計算成本與延遲。
在第三方權威排行榜中,模型表現亮眼:
- Text Arena 排名第 5(約 1,496 分)
- Vision Arena 排名第 2(約 1,305 分,僅次於 Claude Fable 5)
- Frontend Code Arena 排名第 4(1,668 分)



自主編程與長週期任務能力
Qwen 3.8-Max 特別強調自主編程與長週期執行能力,能較長時間獨立運行而毋須人工干預。內部測試中,模型自主完成一個為期 16 天的真實軟件工程項目:從零開始建立自進化智能體框架「oh-my-cli」,整合用戶反饋、社區最佳實踐與自測數據,透過持續的程式碼生成、測試、預覽與日誌分析進行迭代,最終完全開源於 GitHub。
此外,模型在高度專業領域亦展現創新潛力,例如能重現已發表研究實驗並設計出優於原始論文的新方法;在 WWW2025 多模態對話意圖識別挑戰賽中表現優於人類參賽者。它專為複雜真實工作情境設計,涵蓋應用設計、法律文件審查、體育數據分析、金融研究、餐飲概念開發、康復進度可視化及建築 3D 建模等。
視覺智能與多模態智能體能力
作為多模態基座模型,Qwen 3.8-Max 能將靜態輸入轉換為動態可交互的知識結構,可無縫處理過百頁文件、整部電視劇集或長達 100 小時的直播內容,轉化為可搜尋且可交互的知識庫。
它擅長基於即時視覺反饋進行持續執行與創作,包括將原始個人素材剪輯成專業 Vlog、根據文字提示生成沉浸式教育動畫、從單一 UI 截圖重建完整前端網頁項目、將 2D 平面圖轉換為詳細 3D 室內效果圖,以及根據自然語言直接打造交互式遊戲。團隊為此推出了長週期應用重構基準測試 RecreationBench,在完全黑箱(無法上網、無法查看原始程式碼)情況下,模型僅透過與實際應用程式的互動與視覺反饋,便能自主從零重構應用,展現尖端的混合型智能體能力。
與近期旗艦模型的比較
近期旗艦模型競爭激烈:Moonshot 的 Kimi K3(約 2.8T 參數、104B 激活參數,7 月 16 日推出,權重已開源)在編碼與長上下文表現突出;Anthropic 的 Claude Opus 5(7 月 24 日)與 Claude Fable 5 持續佔據 Text Arena 與多項排行榜前列;OpenAI 的 GPT-5.6 系列(Sol / Terra / Luna)則在 7 月初開始廣泛推出。
Qwen 3.8-Max 在 Text Arena 進入前五、Vision Arena 緊貼 Fable 5 取得第二,Frontend Code 則在 Claude Opus 5 系列及 Kimi K3 之後排名第四。其優勢在於稀疏 MoE 帶來的推理效率(僅激活 95B 參數),以及即將開源權重的策略(與 Kimi K3 類似),同時定價相對具競爭力(輸入約 US$2/百萬 Token、輸出 US$6)。
Qwen 3.8-Max 進一步強化了阿里巴巴在超大規模多模態與自主智能體領域的佈局,尤其適合需要長週期自主執行、視覺反饋閉環與專業工作流的應用場景。模型權重下週公開後,預期將吸引更多開發者與企業進行部署與微調。



