大模型 2026年8月4日 約 18 分鐘 Qwen3.8-Max 開源爭議

阿里 Qwen3.8-Max 正式發布
2.4 萬億參數衝進 Arena 前五

8/3 GA · 950 億啟用 · 千問辦公 · Kimi K3 / DeepSeek V4 對比 · 「開源」標籤爭議

阿里巴巴 Qwen3.8-Max 大模型發布概念圖

:阿里巴巴;什麼時候:2026 年 8 月 3 日;做了什麼:正式發布旗艦大模型千問 Qwen3.8-Max,並同步上線 Agent 產品「千問辦公」。規模:總參數 2.4 萬億、啟用 950 億、1M token 上下文。結論:Arena 文本競技場前 8 名中唯一非 Anthropic 模型,但跑分均為阿里自測、權重尚未開源——本文嚴格依據公開材料梳理時間線、核心數據、橫向對比、爭議點、落地步驟與 FAQ,並說明在遠端 Mac 上驗收 OpenClaw / Qoder 等 Agent 鏈路的現實路徑。

01

選型前的痛點:為什麼「全球前五」仍要讀懂細節

  1. 01

    「開源」標籤早於權重:qwen.ai 已標註 Open-Source,但 Hugging Face / ModelScope 尚無倉庫與授權條款,只有「下週」承諾

  2. 02

    跑分均為 vendor-run:PaperBench、QwenSWEBench、RecreationBench 等多為阿里自建基準,Arena 排名標註「Preliminary/初步」

  3. 03

    啟用參數披露滯後:7 月預覽版未公布啟用量,GA 才補充 950 億,透明度曾被獨立評測機構批評

  4. 04

    完整版本地部署不現實:2.4T 總參數即使用 MoE 也需多節點資料中心;個人更現實路徑是 API 或等待 Qwen3.8-27B

  5. 05

    Agent 驗收需要圖形環境:對接 OpenClaw、Claude Code、Qoder CLI 時,macOS 權限彈窗與瀏覽器 OAuth 在純 SSH 下難以完成

02

時間線:從預覽版到 GA,兩週節奏很快

日期事件
7 月 16 日月之暗面發布 Kimi K3(2.8T,896 專家啟用 16 個),主打獨立評測與透明技術報告
7 月 19 日Qwen3.8-Max 預覽版開放,定價為正式價 10%,未公布啟用參數與跑分,ToS 禁止自動化生產呼叫
7 月 27 日Kimi K3 按承諾開源權重,上線 Hugging Face,同步開源 MoonEP 等基礎設施
7 月 31 日DeepSeek V4-Flash 正式版發布,參數不變但 9 項智慧代理/程式碼基準超 V4-Pro
8 月 3 日Qwen3.8-Max GA,發布完整跑分表;「千問辦公」上線;阿里港股漲約 7%、美股漲約 4.5%
預計 8 月 10 日前後Qwen3.8-Max 與 Qwen3.8-27B 權重計劃登陸 Hugging Face / ModelScope(截至發稿未上線)
03

核心數據一覽

項目Qwen3.8-Max
發布日期2026 年 8 月 3 日(GA)
總參數 / 啟用參數2.4 萬億 / 950 億
架構基於 Qwen3.5 的稀疏 MoE + 混合注意力
上下文視窗100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬)
輸入模態文本 / 圖像 / 影片
API 定價輸入 $2/M、輸出 $6/M(隱式快取 $0.25,顯式快取寫入 $2.5、讀取 $0.17)
國內定價輸入 12 元/M、輸出 36 元/M,快取命中低至 1.5 元
Arena 文本(8/1 快照)第 5 名,1496 分(Preliminary);前 8 中唯一非 Anthropic
Arena 視覺第 2 名,僅次於 Claude Fable 5
PaperBench(阿里自測)93.0(較上代 +28.2)
SWE-bench Pro(阿里自測)67.7(落後 Fable 5 的 80.0)
權重開源承諾「下週」,截至發稿未上線

可引用數據:2.4T/950B · $2/$6 per M · Arena Text #5 (Preliminary) · API 相容 OpenAI + Anthropic 協定。

04

架構拆解:大容量、低啟用的效率路線

Qwen3.8-Max 延續 Qwen3.5 稀疏 MoE 路線:總參數 2.4 萬億,每 token 僅啟用 950 億——推理成本追蹤啟用量而非總量,因此 API 定價明顯低於 Claude Opus 5($5/$25)與 Fable 5($10/$50)。

reasoning_effort 三檔(low / medium / xhigh,預設 xhigh)透過 enable_thinking 或 Anthropic 相容介面的 reasoning.effort 調節速度與深度,是 Agent 模型的標配成本撥盤。

長程自主任務是本次核心賣點:16 天無人工介入編碼、500+ 步晶片設計優化、自建 RecreationBench(黑盒還原真實應用)。案例部分過程可在 GitHub qwen-code-dev-bot/oh-my-cli 查閱,但評測集為阿里自建,非第三方審計。

生態卡位:同步接入「千問辦公」,API 相容 OpenAI 與 Anthropic 協定,可直接對接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈。

05

橫向對比:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4

模型總/啟用參數上下文定價(入/出 per M)權重開源獨立評測
Qwen3.8-Max2.4T / 950B1M$2 / $6未開源(承諾中)暫無
Kimi K32.8T / ~500B~1.05M$3 / $15已開源(7/27)AA Index ≈57.11
DeepSeek V4-Pro1.6T / 490B1M未完整公開已開源SWE-bench Verified 80.6%
DeepSeek V4-Flash同 V4-Pro1M未完整公開已開源9 項基準超 V4-Pro
Claude Fable 5未公開1M$10 / $50閉源Arena Text #1

唯一可比的獨立盲測(269 個檔案的真實架構任務):Kimi K3 得 83 分,Qwen3.8-Max 預覽版 80 分——同檔位、互有勝負,而非全面碾壓。

06

爭議點:「開源」標籤掛得比權重早

  1. 01

    官網已標 Open-Source,但 Hugging Face / ModelScope 無倉庫、授權條款或確切日期

  2. 02

    所有跑分來自阿里自建框架;Artificial Analysis、Arena 官方團隊尚未對 GA 版獨立復現

  3. 03

    對比表腳註稱「Fable 5 結果可能涉及 fallback」,但未公開自家測試方法論到可復現程度

  4. 04

    預覽版 ToS 禁止自動化生產呼叫,且無 model card 與安全評估,多家機構建議勿直接遷移生產

注意:這不代表性能不行——獨立盲測顯示與 Kimi K3 同檔。但「穩壓 GPT-5.6 Sol」等結論目前主要是阿里一面之詞,需等權重落地與第三方復現。

07

落地步驟:從 API 驗收到 Agent 聯調(5 步)

  1. 01

    在 QwenCloud / Model Studio 開通 API,用 OpenAI 或 Anthropic 相容端點驗證基礎對話與 reasoning.effort 三檔

  2. 02

    對照 SWE-bench Pro、Arena 初步排名,確認你的場景落在強項(長程 Agent、多模態)還是弱項(HLE 43.6)

  3. 03

    在 OpenClaw / Qoder 設定中切換 base URL 與 API Key,用小流量探針任務對比 Kimi K3 / DeepSeek 延遲與成本

  4. 04

    關注 Hugging Face 上 Qwen3.8-27B 開源進度——若需本地私有化,27B 比完整 2.4T 現實得多

  5. 05

    真實 macOS 圖形環境完成 OAuth、瀏覽器 DevTools 與系統權限驗收(見下文 VNCMac 場景)

json
{
  "model": "qwen3.8-max",
  "reasoning": { "effort": "xhigh" },
  "enable_thinking": true,
  "max_tokens": 8192
}
08

行業背景:參數競賽與架構效率的轉向

  • 2026 是萬億參數「擴產年」,但 DeepSeek V4-Flash 證明不靠堆參數也能大幅提升 Agent 能力
  • 阿里罕見回歸開源:首次承諾開源 Max 級權重,與 Kimi K3、DeepSeek 構成國產頭部集體開放格局
  • 消費端落地:Qwen 經壓縮後成為 Apple Intelligence 中國版本地引擎,覆蓋數億 iPhone
  • 監管對照:同日白宮召集 OpenAI、Anthropic 等商討 Agent 網路安全測試框架,中美 AI 敘事形成有趣切面
09

常見問題(FAQ)

API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 協定。權重尚未開源,預計 8 月 10 日前後公布 Hugging Face / ModelScope 倉庫與授權條款。

尚無權威統一評測。唯一獨立盲測中 Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分,屬同檔位。K3 已開源並有第三方數據;Qwen API 更便宜、多模態更全面。可參考站內 Kimi K3 全面開源

MoE 實際啟用 950 億,API 成本接近千億級模型。完整版本地部署需資料中心級硬體;更現實的選擇是 API 或等待 Qwen3.8-27B。

可作參考但非定論。資料來自阿里自建框架,Arena 標註「初步」。建議等待第三方復現或在自己業務場景做 A/B 測試。

國內 Apple Intelligence 生成式 AI 基於經壓縮的 Qwen 模型本地執行;開發者可透過更便宜的旗艦 API 接入 OpenClaw 等 Agent 工具鏈。

結語

Qwen3.8-Max 把國產大模型推上 Arena 文本前五,並以 $2/$6 的 API 定價和 OpenClaw 相容協定降低了 Agent 遷移門檻——但權重尚未落地、跑分尚未經第三方復現,「開源」標籤目前描述的是意圖而非已交付產物。若你主力機是 Windows/Linux,卻要在真實 macOS 圖形環境裡對接千問辦公、跑 OpenClaw 多模型路由,或並行做 iOS 建置與 Agent 基準對照,自購 Mac 成本高、純 SSH 又點不了 OAuth 與系統彈窗。

租用 VNCMac 遠端 Mac 可按小時開通 VNC 桌面,在隔離節點上驗收 Qwen3.8-Max API 與 Agent 工作流。查看 Mac Mini M4 套餐;更多背景可參考 Kimi K3 全面開源GPT-5.6 發布解析

資料來源:阿里雲官方部落格、Arena.ai、Apidog、TechNode、Apple Intelligence 中國版相關報導等。發布前請以官方最新公告為準。