大模型 2026年8月4日 约 18 分钟 Qwen3.8-Max 开源争议

阿里 Qwen3.8-Max 正式发布
2.4 万亿参数冲进 Arena 前五

8/3 GA · 950 亿激活 · 千问办公 · Kimi K3 / DeepSeek V4 对比 · 「开源」标签争议

阿里巴巴 Qwen3.8-Max 大模型发布概念图

:阿里巴巴;什么时候:2026 年 8 月 3 日;做了什么:正式发布旗舰大模型千问 Qwen3.8-Max,并同步上线 Agent 产品「千问办公」。规模:总参数 2.4 万亿、激活 950 亿、1M token 上下文。结论:Arena 文本竞技场前 8 名中唯一非 Anthropic 模型,但跑分均为阿里自测、权重尚未开源——本文严格依据公开材料梳理时间线、核心数据、横向对比、争议点、落地步骤与 FAQ,并说明在远程 Mac 上验收 OpenClaw / Qoder 等 Agent 链路的现实路径。

01

选型前的痛点:为什么「全球前五」仍要读懂细节

  1. 01

    「开源」标签早于权重:qwen.ai 已标注 Open-Source,但 Hugging Face / ModelScope 尚无仓库与许可证,只有「下周」承诺

  2. 02

    跑分均为_vendor-run:PaperBench、QwenSWEBench、RecreationBench 等多为阿里自建基准,Arena 排名标注「Preliminary/初步」

  3. 03

    激活参数披露滞后:7 月预览版未公布激活量,GA 才补充 950 亿,透明度曾被独立评测机构批评

  4. 04

    完整版本地部署不现实:2.4T 总参数即使用 MoE 也需多节点数据中心;个人更现实路径是 API 或等待 Qwen3.8-27B

  5. 05

    Agent 验收需要图形环境:对接 OpenClaw、Claude Code、Qoder CLI 时,macOS 权限弹窗与浏览器 OAuth 在纯 SSH 下难以完成

02

时间线:从预览版到 GA,两周节奏很快

日期事件
7 月 16 日月之暗面发布 Kimi K3(2.8T,896 专家激活 16 个),主打独立评测与透明技术报告
7 月 19 日Qwen3.8-Max 预览版开放,定价为正式价 10%,未公布激活参数与跑分,ToS 禁止自动化生产调用
7 月 27 日Kimi K3 按承诺开源权重,上线 Hugging Face,同步开源 MoonEP 等基础设施
7 月 31 日DeepSeek V4-Flash 正式版发布,参数不变但 9 项智能体/代码基准超 V4-Pro
8 月 3 日Qwen3.8-Max GA,发布完整跑分表;「千问办公」上线;阿里港股涨约 7%、美股涨约 4.5%
预计 8 月 10 日前后Qwen3.8-Max 与 Qwen3.8-27B 权重计划登陆 Hugging Face / ModelScope(截至发稿未上线)
03

核心数据一览

项目Qwen3.8-Max
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价输入 $2/M、输出 $6/M(隐式缓存 $0.25,显式缓存写入 $2.5、读取 $0.17)
国内定价输入 12 元/M、输出 36 元/M,缓存命中低至 1.5 元
Arena 文本(8/1 快照)第 5 名,1496 分(Preliminary);前 8 中唯一非 Anthropic
Arena 视觉第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代 +28.2)
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
权重开源承诺「下周」,截至发稿未上线

可引用数据:2.4T/950B · $2/$6 per M · Arena Text #5 (Preliminary) · API 兼容 OpenAI + Anthropic 协议。

04

架构拆解:大容量、低激活的效率路线

Qwen3.8-Max 延续 Qwen3.5 稀疏 MoE 路线:总参数 2.4 万亿,每 token 仅激活 950 亿——推理成本跟踪激活量而非总量,因此 API 定价明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)。

reasoning_effort 三档(low / medium / xhigh,默认 xhigh)通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 调节速度与深度,是 Agent 模型的标配成本拨盘。

长程自主任务是本次核心卖点:16 天无人工介入编码、500+ 步芯片设计优化、自建 RecreationBench(黑盒还原真实应用)。案例部分过程可在 GitHub qwen-code-dev-bot/oh-my-cli 查阅,但评测集为阿里自建,非第三方审计。

生态卡位:同步接入「千问办公」,API 兼容 OpenAI 与 Anthropic 协议,可直接对接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。

05

横向对比:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4

模型总/激活参数上下文定价(入/出 per M)权重开源独立评测
Qwen3.8-Max2.4T / 950B1M$2 / $6未开源(承诺中)暂无
Kimi K32.8T / ~500B~1.05M$3 / $15已开源(7/27)AA Index ≈57.11
DeepSeek V4-Pro1.6T / 490B1M未完整公开已开源SWE-bench Verified 80.6%
DeepSeek V4-Flash同 V4-Pro1M未完整公开已开源9 项基准超 V4-Pro
Claude Fable 5未公开1M$10 / $50闭源Arena Text #1

唯一可比的独立盲测(269 个文件的真实架构任务):Kimi K3 得 83 分,Qwen3.8-Max 预览版 80 分——同档位、互有胜负,而非全面碾压。

06

争议点:「开源」标签挂得比权重早

  1. 01

    官网已标 Open-Source,但 Hugging Face / ModelScope 无仓库、许可证或确切日期

  2. 02

    所有跑分来自阿里自建框架;Artificial Analysis、Arena 官方团队尚未对 GA 版独立复现

  3. 03

    对比表脚注称「Fable 5 结果可能涉及 fallback」,但未公开自家测试方法论到可复现程度

  4. 04

    预览版 ToS 禁止自动化生产调用,且无 model card 与安全评估,多家机构建议勿直接迁移生产

注意:这不代表性能不行——独立盲测显示与 Kimi K3 同档。但「稳压 GPT-5.6 Sol」等结论目前主要是阿里一面之词,需等权重落地与第三方复现。

07

落地步骤:从 API 验收到 Agent 联调(5 步)

  1. 01

    在 QwenCloud / Model Studio 开通 API,用 OpenAI 或 Anthropic 兼容端点验证基础对话与 reasoning.effort 三档

  2. 02

    对照 SWE-bench Pro、Arena 初步排名,确认你的场景落在强项(长程 Agent、多模态)还是弱项(HLE 43.6)

  3. 03

    在 OpenClaw / Qoder 配置中切换 base URL 与 API Key,用小流量探针任务对比 Kimi K3 / DeepSeek 延迟与成本

  4. 04

    关注 Hugging Face 上 Qwen3.8-27B 开源进度——若需本地私有化,27B 比完整 2.4T 现实得多

  5. 05

    真实 macOS 图形环境完成 OAuth、浏览器 DevTools 与系统权限验收(见下文 VNCMac 场景)

json
{
  "model": "qwen3.8-max",
  "reasoning": { "effort": "xhigh" },
  "enable_thinking": true,
  "max_tokens": 8192
}
08

行业背景:参数竞赛与架构效率的转向

  • 2026 是万亿参数「扩产年」,但 DeepSeek V4-Flash 证明不靠堆参数也能大幅提升 Agent 能力
  • 阿里罕见回归开源:首次承诺开源 Max 级权重,与 Kimi K3、DeepSeek 构成国产头部集体开放格局
  • 消费端落地:Qwen 经压缩后成为 Apple Intelligence 中国版本地引擎,覆盖数亿 iPhone
  • 监管对照:同日白宫召集 OpenAI、Anthropic 等商讨 Agent 网络安全测试框架,中美 AI 叙事形成有趣切面
09

常见问题(FAQ)

API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 协议。权重尚未开源,预计 8 月 10 日前后公布 Hugging Face / ModelScope 仓库与许可证。

尚无权威统一评测。唯一独立盲测中 Kimi K3 83 分、Qwen3.8-Max 预览版 80 分,属同档位。K3 已开源并有第三方数据;Qwen API 更便宜、多模态更全面。可参考站内 Kimi K3 全面开源

MoE 实际激活 950 亿,API 成本接近千亿级模型。完整版本地部署需数据中心级硬件;更现实的选择是 API 或等待 Qwen3.8-27B。

可作参考但非定论。数据来自阿里自建框架,Arena 标注「初步」。建议等待第三方复现或在自己业务场景做 A/B 测试。

国内 Apple Intelligence 生成式 AI 基于经压缩的 Qwen 模型本地运行;开发者可通过更便宜的旗舰 API 接入 OpenClaw 等 Agent 工具链。

结语

Qwen3.8-Max 把国产大模型推上 Arena 文本前五,并以 $2/$6 的 API 定价和 OpenClaw 兼容协议降低了 Agent 迁移门槛——但权重尚未落地、跑分尚未经第三方复现,「开源」标签目前描述的是意图而非已交付产物。若你主力机在 Windows/Linux,却要在真实 macOS 图形环境里对接千问办公、跑 OpenClaw 多模型路由,或并行做 iOS 构建与 Agent 基准对照,自购 Mac 成本高、纯 SSH 又点不了 OAuth 与系统弹窗。

租用 VNCMac 远程 Mac 可按小时开通 VNC 桌面,在隔离节点上验收 Qwen3.8-Max API 与 Agent 工作流。查看 Mac Mini M4 套餐;更多背景可参考 Kimi K3 全面开源GPT-5.6 降价解读

数据来源:阿里云官方博客、Arena.ai、Apidog、TechNode、Apple Intelligence 中国版相关报道等。发布前请以官方最新公告为准。