8/3 GA · 950 億啟用 · 千問辦公 · Kimi K3 / DeepSeek V4 對比 · 「開源」標籤爭議
誰:阿里巴巴;什麼時候:2026 年 8 月 3 日;做了什麼:正式發布旗艦大模型千問 Qwen3.8-Max,並同步上線 Agent 產品「千問辦公」。規模:總參數 2.4 萬億、啟用 950 億、1M token 上下文。結論:Arena 文本競技場前 8 名中唯一非 Anthropic 模型,但跑分均為阿里自測、權重尚未開源——本文嚴格依據公開材料梳理時間線、核心數據、橫向對比、爭議點、落地步驟與 FAQ,並說明在遠端 Mac 上驗收 OpenClaw / Qoder 等 Agent 鏈路的現實路徑。
「開源」標籤早於權重:qwen.ai 已標註 Open-Source,但 Hugging Face / ModelScope 尚無倉庫與授權條款,只有「下週」承諾
跑分均為 vendor-run:PaperBench、QwenSWEBench、RecreationBench 等多為阿里自建基準,Arena 排名標註「Preliminary/初步」
啟用參數披露滯後:7 月預覽版未公布啟用量,GA 才補充 950 億,透明度曾被獨立評測機構批評
完整版本地部署不現實:2.4T 總參數即使用 MoE 也需多節點資料中心;個人更現實路徑是 API 或等待 Qwen3.8-27B
Agent 驗收需要圖形環境:對接 OpenClaw、Claude Code、Qoder CLI 時,macOS 權限彈窗與瀏覽器 OAuth 在純 SSH 下難以完成
| 日期 | 事件 |
|---|---|
| 7 月 16 日 | 月之暗面發布 Kimi K3(2.8T,896 專家啟用 16 個),主打獨立評測與透明技術報告 |
| 7 月 19 日 | Qwen3.8-Max 預覽版開放,定價為正式價 10%,未公布啟用參數與跑分,ToS 禁止自動化生產呼叫 |
| 7 月 27 日 | Kimi K3 按承諾開源權重,上線 Hugging Face,同步開源 MoonEP 等基礎設施 |
| 7 月 31 日 | DeepSeek V4-Flash 正式版發布,參數不變但 9 項智慧代理/程式碼基準超 V4-Pro |
| 8 月 3 日 | Qwen3.8-Max GA,發布完整跑分表;「千問辦公」上線;阿里港股漲約 7%、美股漲約 4.5% |
| 預計 8 月 10 日前後 | Qwen3.8-Max 與 Qwen3.8-27B 權重計劃登陸 Hugging Face / ModelScope(截至發稿未上線) |
| 項目 | Qwen3.8-Max |
|---|---|
| 發布日期 | 2026 年 8 月 3 日(GA) |
| 總參數 / 啟用參數 | 2.4 萬億 / 950 億 |
| 架構 | 基於 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文視窗 | 100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬) |
| 輸入模態 | 文本 / 圖像 / 影片 |
| API 定價 | 輸入 $2/M、輸出 $6/M(隱式快取 $0.25,顯式快取寫入 $2.5、讀取 $0.17) |
| 國內定價 | 輸入 12 元/M、輸出 36 元/M,快取命中低至 1.5 元 |
| Arena 文本(8/1 快照) | 第 5 名,1496 分(Preliminary);前 8 中唯一非 Anthropic |
| Arena 視覺 | 第 2 名,僅次於 Claude Fable 5 |
| PaperBench(阿里自測) | 93.0(較上代 +28.2) |
| SWE-bench Pro(阿里自測) | 67.7(落後 Fable 5 的 80.0) |
| 權重開源 | 承諾「下週」,截至發稿未上線 |
可引用數據:2.4T/950B · $2/$6 per M · Arena Text #5 (Preliminary) · API 相容 OpenAI + Anthropic 協定。
Qwen3.8-Max 延續 Qwen3.5 稀疏 MoE 路線:總參數 2.4 萬億,每 token 僅啟用 950 億——推理成本追蹤啟用量而非總量,因此 API 定價明顯低於 Claude Opus 5($5/$25)與 Fable 5($10/$50)。
reasoning_effort 三檔(low / medium / xhigh,預設 xhigh)透過 enable_thinking 或 Anthropic 相容介面的 reasoning.effort 調節速度與深度,是 Agent 模型的標配成本撥盤。
長程自主任務是本次核心賣點:16 天無人工介入編碼、500+ 步晶片設計優化、自建 RecreationBench(黑盒還原真實應用)。案例部分過程可在 GitHub qwen-code-dev-bot/oh-my-cli 查閱,但評測集為阿里自建,非第三方審計。
生態卡位:同步接入「千問辦公」,API 相容 OpenAI 與 Anthropic 協定,可直接對接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈。
| 模型 | 總/啟用參數 | 上下文 | 定價(入/出 per M) | 權重開源 | 獨立評測 |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950B | 1M | $2 / $6 | 未開源(承諾中) | 暫無 |
| Kimi K3 | 2.8T / ~500B | ~1.05M | $3 / $15 | 已開源(7/27) | AA Index ≈57.11 |
| DeepSeek V4-Pro | 1.6T / 490B | 1M | 未完整公開 | 已開源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | 同 V4-Pro | 1M | 未完整公開 | 已開源 | 9 項基準超 V4-Pro |
| Claude Fable 5 | 未公開 | 1M | $10 / $50 | 閉源 | Arena Text #1 |
唯一可比的獨立盲測(269 個檔案的真實架構任務):Kimi K3 得 83 分,Qwen3.8-Max 預覽版 80 分——同檔位、互有勝負,而非全面碾壓。
官網已標 Open-Source,但 Hugging Face / ModelScope 無倉庫、授權條款或確切日期
所有跑分來自阿里自建框架;Artificial Analysis、Arena 官方團隊尚未對 GA 版獨立復現
對比表腳註稱「Fable 5 結果可能涉及 fallback」,但未公開自家測試方法論到可復現程度
預覽版 ToS 禁止自動化生產呼叫,且無 model card 與安全評估,多家機構建議勿直接遷移生產
注意:這不代表性能不行——獨立盲測顯示與 Kimi K3 同檔。但「穩壓 GPT-5.6 Sol」等結論目前主要是阿里一面之詞,需等權重落地與第三方復現。
在 QwenCloud / Model Studio 開通 API,用 OpenAI 或 Anthropic 相容端點驗證基礎對話與 reasoning.effort 三檔
對照 SWE-bench Pro、Arena 初步排名,確認你的場景落在強項(長程 Agent、多模態)還是弱項(HLE 43.6)
在 OpenClaw / Qoder 設定中切換 base URL 與 API Key,用小流量探針任務對比 Kimi K3 / DeepSeek 延遲與成本
關注 Hugging Face 上 Qwen3.8-27B 開源進度——若需本地私有化,27B 比完整 2.4T 現實得多
在真實 macOS 圖形環境完成 OAuth、瀏覽器 DevTools 與系統權限驗收(見下文 VNCMac 場景)
{
"model": "qwen3.8-max",
"reasoning": { "effort": "xhigh" },
"enable_thinking": true,
"max_tokens": 8192
}
API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 協定。權重尚未開源,預計 8 月 10 日前後公布 Hugging Face / ModelScope 倉庫與授權條款。
尚無權威統一評測。唯一獨立盲測中 Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分,屬同檔位。K3 已開源並有第三方數據;Qwen API 更便宜、多模態更全面。可參考站內 Kimi K3 全面開源。
MoE 實際啟用 950 億,API 成本接近千億級模型。完整版本地部署需資料中心級硬體;更現實的選擇是 API 或等待 Qwen3.8-27B。
可作參考但非定論。資料來自阿里自建框架,Arena 標註「初步」。建議等待第三方復現或在自己業務場景做 A/B 測試。
國內 Apple Intelligence 生成式 AI 基於經壓縮的 Qwen 模型本地執行;開發者可透過更便宜的旗艦 API 接入 OpenClaw 等 Agent 工具鏈。
Qwen3.8-Max 把國產大模型推上 Arena 文本前五,並以 $2/$6 的 API 定價和 OpenClaw 相容協定降低了 Agent 遷移門檻——但權重尚未落地、跑分尚未經第三方復現,「開源」標籤目前描述的是意圖而非已交付產物。若你主力機是 Windows/Linux,卻要在真實 macOS 圖形環境裡對接千問辦公、跑 OpenClaw 多模型路由,或並行做 iOS 建置與 Agent 基準對照,自購 Mac 成本高、純 SSH 又點不了 OAuth 與系統彈窗。
租用 VNCMac 遠端 Mac 可按小時開通 VNC 桌面,在隔離節點上驗收 Qwen3.8-Max API 與 Agent 工作流。查看 Mac Mini M4 套餐;更多背景可參考 Kimi K3 全面開源與 GPT-5.6 發布解析。
資料來源:阿里雲官方部落格、Arena.ai、Apidog、TechNode、Apple Intelligence 中國版相關報導等。發布前請以官方最新公告為準。