开源大模型 2026年8月5日 约 20 分钟 DeepSeek V4 Harness

DeepSeek V4 Flash 正式版上线
跑分逼近 Opus 4.8,价格却只要几十分之一

2026年7月31日 · V4-Flash-0731 官方版 · 同架构重训 · Harness 即将发布 · Pro 仍无确切日期

DeepSeek V4 Flash 0731 正式版开源大模型评测概念图

摘要:7月31日,DeepSeek 将 V4-Flash 升级为官方版:参数规模不变,仅重跑后训练,Agent 跑分反超更大的 V4-Pro 预览版,定价约为 Claude Opus 4.8 的几十分之一。旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 仍处于「即将发布」状态。本文严格依据公开资料,覆盖时间线、定价对照、架构拆解、中国开源六方混战、跑分争议、「斩杀线」价格战与开发者落地步骤。

01

选型前的四个痛点

  1. 01

    旧 API 已停用:7月24日起 deepseek-chat / deepseek-reasoner 下线,生产若未迁移将直接中断

  2. 02

    「官方版」≠ 新模型:0731 构建与 4 月预览同架构,性能跃升来自后训练——用错预期会导致选型失误

  3. 03

    Agent 跑分高度依赖 Harness:Terminal Bench 2.0 等数字基于未公开框架测得,不宜直接横向套用到 Claude Code / Cursor

  4. 04

    Pro 与 Harness 仍缺席:仅 Flash 官方版且限 API,App/网页未同步;网传 8月10–20日 GA 未经官方证实

02

时间线:从 4 月预览到 7 月「官方版」

日期事件
2026年4月24日V4 预览版发布并开源:V4-Pro(1.6T/49B 激活)与 V4-Flash(284B/13B 激活),均 1M 上下文,MIT
2026年7月24日旧接口 deepseek-chatdeepseek-reasoner 停用,流量切换 V4 系列命名
2026年7月27日月之暗面 Kimi K3(2.8T)权重上线 Hugging Face,形成直接竞争压力
2026年7月31日V4-Flash-0731 正式版 API 公测,权重同步 HF;changelog 首次点名 Harness「即将随 V4 正式版发布」;仅 API,App/网页未更新
截至 2026年8月5日V4-Pro 官方版仍「尽快发布」;媒体援引未署名源称 8月10–20日窗口——未经 DeepSeek 证实
03

核心数据一览(厂商自报定价)

模型状态总/激活参数上下文输入 $/M(未命中/命中)输出 $/M协议
V4-Flash-0731官方正式版284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro预览版(官方版未发)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源 7/272.8T / ~104B(社区估)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2开源 2026年6月~744B / ~40B1M本文未独立核实MIT
Qwen3.8-MaxAPI GA 8/2,权重待放2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承诺开源

DeepSeek 已预告高峰时段(北京时间 9–12、14–18 点)2 倍加价,截至发稿未公布生效日。数据截至 2026年8月5日。

04

深度拆解:性能是怎么「变出来」的

架构未变,后训练重写天花板

V4-Flash-0731 与 4 月预览版参数规模与结构完全相同,官方明确性能提升「完全来自重新进行的后训练」。284B/13B 的 Flash 在多项 Agent 基准上反超 1.6T/49B 的 V4-Pro 预览——印证 2026 下半年竞争焦点正从「堆参数」转向「后训练质量」。

CSA + HCA、mHC、Muon 优化器

技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》披露三项架构改动(预览版已具备,正式版沿用):

  • 混合注意力(DSA):压缩稀疏注意力 CSA + 高度压缩注意力 HCA,降低长上下文计算与显存
  • mHC:流形约束超连接,改进残差结构
  • Muon 优化器:替换传统优化器,提升收敛与稳定性

官方指标(待独立复现):百万 token 下 V4-Pro 单 token FLOPs 为 V3.2 的 27%,KV Cache 为 10%

Harness:自研 Agent 框架首次点名

7月31日 changelog 首次出现 DeepSeek Harness——对标 Claude Code 的文件读写、工具调用与端到端工程任务框架。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)均在 Harness 极简模式(尚未公开)下测得;官方亦提示:「跑分对 harness 选择非常敏感」。

05

横向对比:中国开源「六边形混战」

模型实验室总参数AA Intelligence Index单任务成本(AA)
V4-Flash-0731DeepSeek284B50$0.03
Kimi K3月之暗面2.8T57$0.86
GLM-5.2智谱~744B比 Flash 高约 1 分未核实
GPT-5.6 SolOpenAI未公开高 9+ 分$1.86
Claude Fable 5Anthropic未公开高 9+ 分$3.15

反差清晰:AA 独立指数上 Flash 并非最高,却将单任务成本压到 Kimi K3 的约 1/29、Fable 5 的约 1/105。DeepSeek 打的是「够用智能 + 极致价格」——亦解释预览版曾连续七周登顶 OpenRouter 调用量。

场景选型决策矩阵

场景推荐倾向理由
批量 Agent / 高频 APIV4-Flash-0731成本极低,0731 Agent 跑分已超 Pro 预览
追求 AA 指数上限Kimi K3 / 闭源旗舰独立指数更高,但单价显著上升
长上下文 + 自托管权重V4-Flash MIT 权重1M 上下文 + 开放许可
等 Harness 全量能力观望 Pro 官方版框架未公开,生产 Agent 编排仍依赖第三方工具
06

争议点:跑分好看,不代表没有水分

  1. 01

    Harness 依赖:Terminal Bench 2.0 82.7 分(vs Pro 预览 67.9)基于未公开 Harness 极简模式 + max/top_p=0.95/temp=1.0,应视为「厂商自报 + 特定框架」

  2. 02

    可用性反馈:海外社区报输入缓存命中率偏低、安全分类器偶发超时——与「跑分暴涨」叙事存在反差

  3. 03

    Pro/Harness 日期:媒体 8月10–20日窗口为未署名传言;以官方「尽快发布」为准

  4. 04

    融资传闻:报道称约 74 亿美元融资、487 亿美元估值等,尚无监管文件或官方确认,仅作背景

07

行业背景:「梁白开」与「斩杀线」

Pro 版未兑现「7 月中旬全量」预期时,社区戏称创始人「梁白开」;Flash 0731 超预期后昵称又变回「梁圣」——情绪反转本身即是观察国内 AI 社区的风向标。

更实质的是「斩杀线」说法:够用性能 + 极端低价构成门槛,友商若既不能明显超越又不能更便宜,便难保存在感。同期 GPT-5.6 Luna 等密集调价,亦被解读为对这一压力的回应。7月31日当天英伟达、博通、AMD 股价未显著波动——市场已习惯「DeepSeek 式效率突破」,与 2025 年初 R1 引发芯片股大跌形成对比。

开发者五步落地清单

  1. 01

    核对生产环境 model 名:使用 deepseek-v4-flash,停用旧别名

  2. 02

    区分厂商自报 Agent 跑分与 AA 独立指数,勿混用决策

  3. 03

    批量任务尽量避开预告的高峰 2× 时段(生效日待官宣)

  4. 04

    在 OpenClaw / Claude Code 等第三方 Harness 中独立验收 Agent 任务,勿只看官方 TB2.0

  5. 05

    关注 Harness 与 Pro 官方版 changelog,权重与 API 行为可能再次分叉

可引用关键数字

  • Flash 0731:284B / 13B 激活,输入低至 $0.0028/M(缓存命中)
  • 相对 Opus 4.8:据 21 世纪经济报道,未命中输入约 1/36、命中约 1/179、输出约 1/89(厂商标价,非审计)
  • Terminal Bench 2.0:82.7(Harness 极简模式,厂商自报)
08

常见问题(FAQ)

原生 1M 上下文,长上下文 FLOPs/KV 大幅低于 V3.2;Agent 专项优化并适配 Claude Code、OpenCode 等。

大规模低成本与 Agent 流水线优先 0731 Flash;复杂推理且预算充足可暂用 Pro 预览,等官方版再评估。

截至 2026年8月5日不能。仅 Flash 0731 官方版且限 API;Pro 与 Harness「尽快发布」,网传日期未证实。

SWE-bench Verified 等第三方基准较可信;Agent 类跑分依赖未公开 Harness,建议等 Claude Code/Cursor 等独立复现。

OpenAI/Anthropic 格式接入无需改代码;须将已停用旧 model 名切换为 deepseek-v4-flash 或 deepseek-v4-pro。

结语

V4-Flash-0731 把「同架构、重后训练、极致低价」推到极致,但若你要在真实工程里验收 OpenClaw 多模型路由、对照 Harness 与 Claude Code 的 Agent 差异,或批量改 API 后图形化测通,Windows/Linux 主力机往往缺 macOS 图形会话,自购 Mac 又重。租用 VNCMac 远程 Mac 可按小时开通 VNC,在隔离节点对接 DeepSeek V4 API、跑 Agent 长任务并做迁移验收,项目结束即停租。查看 Mac 套餐 与帮助页 SSH-VNC 说明即可开始;亦可参阅站内 V4 满血版 GAKimi K3 开源 相关文章。

数据来源:DeepSeek API 文档与 changelog、技术报告、Artificial Analysis(经媒体转引)、21 世纪经济报道等。定价与上线状态请发布前再次核实,截至 2026年8月5日。