8/3 GA · 950 亿激活 · 千问办公 · Kimi K3 / DeepSeek V4 对比 · 「开源」标签争议
谁:阿里巴巴;什么时候:2026 年 8 月 3 日;做了什么:正式发布旗舰大模型千问 Qwen3.8-Max,并同步上线 Agent 产品「千问办公」。规模:总参数 2.4 万亿、激活 950 亿、1M token 上下文。结论:Arena 文本竞技场前 8 名中唯一非 Anthropic 模型,但跑分均为阿里自测、权重尚未开源——本文严格依据公开材料梳理时间线、核心数据、横向对比、争议点、落地步骤与 FAQ,并说明在远程 Mac 上验收 OpenClaw / Qoder 等 Agent 链路的现实路径。
「开源」标签早于权重:qwen.ai 已标注 Open-Source,但 Hugging Face / ModelScope 尚无仓库与许可证,只有「下周」承诺
跑分均为_vendor-run:PaperBench、QwenSWEBench、RecreationBench 等多为阿里自建基准,Arena 排名标注「Preliminary/初步」
激活参数披露滞后:7 月预览版未公布激活量,GA 才补充 950 亿,透明度曾被独立评测机构批评
完整版本地部署不现实:2.4T 总参数即使用 MoE 也需多节点数据中心;个人更现实路径是 API 或等待 Qwen3.8-27B
Agent 验收需要图形环境:对接 OpenClaw、Claude Code、Qoder CLI 时,macOS 权限弹窗与浏览器 OAuth 在纯 SSH 下难以完成
| 日期 | 事件 |
|---|---|
| 7 月 16 日 | 月之暗面发布 Kimi K3(2.8T,896 专家激活 16 个),主打独立评测与透明技术报告 |
| 7 月 19 日 | Qwen3.8-Max 预览版开放,定价为正式价 10%,未公布激活参数与跑分,ToS 禁止自动化生产调用 |
| 7 月 27 日 | Kimi K3 按承诺开源权重,上线 Hugging Face,同步开源 MoonEP 等基础设施 |
| 7 月 31 日 | DeepSeek V4-Flash 正式版发布,参数不变但 9 项智能体/代码基准超 V4-Pro |
| 8 月 3 日 | Qwen3.8-Max GA,发布完整跑分表;「千问办公」上线;阿里港股涨约 7%、美股涨约 4.5% |
| 预计 8 月 10 日前后 | Qwen3.8-Max 与 Qwen3.8-27B 权重计划登陆 Hugging Face / ModelScope(截至发稿未上线) |
| 项目 | Qwen3.8-Max |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价 | 输入 $2/M、输出 $6/M(隐式缓存 $0.25,显式缓存写入 $2.5、读取 $0.17) |
| 国内定价 | 输入 12 元/M、输出 36 元/M,缓存命中低至 1.5 元 |
| Arena 文本(8/1 快照) | 第 5 名,1496 分(Preliminary);前 8 中唯一非 Anthropic |
| Arena 视觉 | 第 2 名,仅次于 Claude Fable 5 |
| PaperBench(阿里自测) | 93.0(较上代 +28.2) |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0) |
| 权重开源 | 承诺「下周」,截至发稿未上线 |
可引用数据:2.4T/950B · $2/$6 per M · Arena Text #5 (Preliminary) · API 兼容 OpenAI + Anthropic 协议。
Qwen3.8-Max 延续 Qwen3.5 稀疏 MoE 路线:总参数 2.4 万亿,每 token 仅激活 950 亿——推理成本跟踪激活量而非总量,因此 API 定价明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)。
reasoning_effort 三档(low / medium / xhigh,默认 xhigh)通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 调节速度与深度,是 Agent 模型的标配成本拨盘。
长程自主任务是本次核心卖点:16 天无人工介入编码、500+ 步芯片设计优化、自建 RecreationBench(黑盒还原真实应用)。案例部分过程可在 GitHub qwen-code-dev-bot/oh-my-cli 查阅,但评测集为阿里自建,非第三方审计。
生态卡位:同步接入「千问办公」,API 兼容 OpenAI 与 Anthropic 协议,可直接对接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。
| 模型 | 总/激活参数 | 上下文 | 定价(入/出 per M) | 权重开源 | 独立评测 |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950B | 1M | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 2.8T / ~500B | ~1.05M | $3 / $15 | 已开源(7/27) | AA Index ≈57.11 |
| DeepSeek V4-Pro | 1.6T / 490B | 1M | 未完整公开 | 已开源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | 同 V4-Pro | 1M | 未完整公开 | 已开源 | 9 项基准超 V4-Pro |
| Claude Fable 5 | 未公开 | 1M | $10 / $50 | 闭源 | Arena Text #1 |
唯一可比的独立盲测(269 个文件的真实架构任务):Kimi K3 得 83 分,Qwen3.8-Max 预览版 80 分——同档位、互有胜负,而非全面碾压。
官网已标 Open-Source,但 Hugging Face / ModelScope 无仓库、许可证或确切日期
所有跑分来自阿里自建框架;Artificial Analysis、Arena 官方团队尚未对 GA 版独立复现
对比表脚注称「Fable 5 结果可能涉及 fallback」,但未公开自家测试方法论到可复现程度
预览版 ToS 禁止自动化生产调用,且无 model card 与安全评估,多家机构建议勿直接迁移生产
注意:这不代表性能不行——独立盲测显示与 Kimi K3 同档。但「稳压 GPT-5.6 Sol」等结论目前主要是阿里一面之词,需等权重落地与第三方复现。
在 QwenCloud / Model Studio 开通 API,用 OpenAI 或 Anthropic 兼容端点验证基础对话与 reasoning.effort 三档
对照 SWE-bench Pro、Arena 初步排名,确认你的场景落在强项(长程 Agent、多模态)还是弱项(HLE 43.6)
在 OpenClaw / Qoder 配置中切换 base URL 与 API Key,用小流量探针任务对比 Kimi K3 / DeepSeek 延迟与成本
关注 Hugging Face 上 Qwen3.8-27B 开源进度——若需本地私有化,27B 比完整 2.4T 现实得多
在真实 macOS 图形环境完成 OAuth、浏览器 DevTools 与系统权限验收(见下文 VNCMac 场景)
{
"model": "qwen3.8-max",
"reasoning": { "effort": "xhigh" },
"enable_thinking": true,
"max_tokens": 8192
}
API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 协议。权重尚未开源,预计 8 月 10 日前后公布 Hugging Face / ModelScope 仓库与许可证。
尚无权威统一评测。唯一独立盲测中 Kimi K3 83 分、Qwen3.8-Max 预览版 80 分,属同档位。K3 已开源并有第三方数据;Qwen API 更便宜、多模态更全面。可参考站内 Kimi K3 全面开源。
MoE 实际激活 950 亿,API 成本接近千亿级模型。完整版本地部署需数据中心级硬件;更现实的选择是 API 或等待 Qwen3.8-27B。
可作参考但非定论。数据来自阿里自建框架,Arena 标注「初步」。建议等待第三方复现或在自己业务场景做 A/B 测试。
国内 Apple Intelligence 生成式 AI 基于经压缩的 Qwen 模型本地运行;开发者可通过更便宜的旗舰 API 接入 OpenClaw 等 Agent 工具链。
Qwen3.8-Max 把国产大模型推上 Arena 文本前五,并以 $2/$6 的 API 定价和 OpenClaw 兼容协议降低了 Agent 迁移门槛——但权重尚未落地、跑分尚未经第三方复现,「开源」标签目前描述的是意图而非已交付产物。若你主力机在 Windows/Linux,却要在真实 macOS 图形环境里对接千问办公、跑 OpenClaw 多模型路由,或并行做 iOS 构建与 Agent 基准对照,自购 Mac 成本高、纯 SSH 又点不了 OAuth 与系统弹窗。
租用 VNCMac 远程 Mac 可按小时开通 VNC 桌面,在隔离节点上验收 Qwen3.8-Max API 与 Agent 工作流。查看 Mac Mini M4 套餐;更多背景可参考 Kimi K3 全面开源与 GPT-5.6 降价解读。
数据来源:阿里云官方博客、Arena.ai、Apidog、TechNode、Apple Intelligence 中国版相关报道等。发布前请以官方最新公告为准。