不换底座,DeepSeek 把 Flash 练成了 Agent
2026 年 7 月 31 日,DeepSeek 将 V4‑Flash 官方版 API 推入 public beta。0731 与 Preview 的架构和规模相同,仅重新后训练;此次只更新 Flash API,V4‑Pro API 与 App/Web 模型没有同步更新。
这次发布的意义,不是 DeepSeek 又做出一个更大的基座模型,而是同一套 284B 总参数、13B 激活参数的 Flash 底座,通过重新后训练、Responses API 与 Codex 适配,进入了前沿 Agent 的竞争区间。
两年的效率路线,收口到 Agent 执行层
V2 用 DeepSeekMoE 与 MLA,把模型总容量和每个 token 实际计算量分开;随后上线的上下文缓存,又把重复前缀成本直接压进 API 价格。V3 扩到 671B 总参数、37B 激活,但仍把训练效率、吞吐和低价放在同一张产品表里。
R1 证明大规模强化学习能够塑造推理行为;V3.1 把 thinking/non‑thinking 合入同一模型;V3.2 再把思考嵌入工具调用,并用可验证交互任务训练 Agent。竞争单位由一次回答的正确率,扩展到模型能否在长链路中规划、调用工具、检查结果并继续执行。
2026 年 4 月的 V4 Preview 把 Pro 与 Flash 分层。Flash 为 284B 总参数、13B 激活,支持 1M 上下文,针对 Claude Code、OpenClaw、OpenCode 等工具优化。0731 三个月后不改架构、不扩参数,只重新训练“怎么做事”,并优先补齐 Responses API 与 Codex 入口。
DeepSeek 的路线可以概括为:MoE 压低每 token 计算量,长上下文技术压低记忆成本,可验证后训练塑造工具行为,API 与 Harness 把能力接入工作流。
它重新画的是价格—能力曲线
V4‑Flash 支持 1M 上下文、384K 最大输出和 2500 并发;当前官方价格为未命中输入 $0.14、输出 $0.28/百万 tokens。GPT‑5.6 Luna 的输入与输出价格为 $1 和 $6,Kimi K3 为 $3 和 $15,Gemini 3.6 Flash 为 $1.5 和 $7.5。
价格可以直接比较,Agent benchmark 却不能简单横排。DeepSeek 官方披露 V4‑Flash‑0731 在 Terminal‑Bench 2.1 得到 82.7、DeepSWE 54.4、Toolathlon verified 70.3、Agent Last Exam 25.2;但公开 Code Agent 测试使用尚未发布的 DeepSeek Harness,DSBench‑FullStack 与 DSBench‑Hard 又是内部测试集。
82.7 是一个强烈信号,不是最终裁决。Flash 是否真正改变 Agent 成本,需要在同一任务、同一 Harness 和同一预算下比较一次成功率、重试次数、完成时间与总 token。
发布后的声音,已经从兴奋走向复测
最早的讨论首先惊讶于“同一底座、只靠后训练”。开发者 Haoyi 认为新成绩给 GLM‑5.2 带来压力;LocalLLaMA 社区很快提醒,Preview 使用 Terminal‑Bench 2.0,0731 使用 2.1,不能把 56.9 到 82.7 直接当成严格提升 25.8 分。
日本开发者 Voluntas 把 0731 用于自有 OSS 的代码审查,主观感受是速度没有明显变化,但模型更愿意把任务做完。这与“后训练改善执行行为”的解释一致,却仍是单用户、单项目的即时观察。
另一位开发者 IFITALEX 使用相同规划文档和参考图,让 Gemini 3.6 Flash 与 V4‑Flash 生成 Three.js 的 Raptor 3D 模型,主观判断是 Gemini 的成品略好、速度更快。这条对比不能裁决通用 Agent 强弱,但说明 Coding/Terminal 成绩不会自动迁移到视觉理解与 3D 生成。
LocalLLaMA 还出现了对生成长度、cache write 与真实成本的质疑;SillyTavern 社区则提醒,代码 benchmark 与角色扮演、长文本风格质量的相关性有限。Artificial Analysis 当前公开模型页仍显示 4 月版数据,因此当天流传的榜单截图还不足以成为 0731 的独立定论。
发布后的早期共识不是“Flash 已经夺冠”,而是“它值得立即进入真实工作流复测”。
竞争焦点落到每一美元能完成多少任务
两条线在这里汇合:DeepSeek 两年里持续压缩激活参数、长上下文计算和无效推理 token;0731 又证明,同一底座经过定向后训练与接口适配,可以快速改变 Agent 行为。
Harness 也由此成为模型能力的一部分。Responses API、Codex 适配、工具调用协议与推理预算会直接改变最终成绩,只比较裸模型会越来越失真。
Agent 市场最终比较的,不是每百万 token 有多便宜,而是每一美元能完成多少可验证任务。 Flash 不必在每项能力上夺冠;只要能以更低成本完成足够多任务,就可能成为默认执行层,把更昂贵的旗舰模型留给规划、复核和极难任务。
V4‑Flash‑0731 尚未通过公开同框测试证明自己是最强 Agent,也没有在本次公告中同步发布新的 0731 开放权重。它真正压低的是前沿 Agent 的使用门槛。后续最值得观察的是公开环境中的任务成功率、工具调用错误率、总 token、缓存命中率、时延和全链路成本。
证据边界
- 0731 的后训练数据、算法、rollout 数量、训练算力与成本未披露。
- 官方成绩使用尚未公开的 Harness,并包含内部测试集。
- Responses API 为部分兼容,不完整支持有状态会话、MCP、computer use、文件和图像输入。
- V4 Preview 权重为 MIT 开放;0731 公告明确的是 API 更新,不能声称 0731 新权重已经开放。
- 上述开发者评价均为发布后早期样本,不代表大规模独立评测。
主要来源
- DeepSeek 官方更新日志:V4‑Flash‑0731
- DeepSeek V4‑Flash 官方模型页
- DeepSeek V4 Preview 发布说明
- DeepSeek API 价格
- DeepSeek Responses API 指南
- DeepSeek Codex 集成指南
- DeepSeek‑V2 论文
- DeepSeek‑V3 论文
- DeepSeek‑R1 论文
- DeepSeek‑V3.2 论文
- GPT‑5.6 Luna 官方模型页
- Kimi K3 官方仓库
- Gemini 3.6 Flash 官方模型页
- Haoyi:对同参数后训练提升的评价
- Voluntas:自有 OSS 代码审查的早期试用
- IFITALEX:与 Gemini 3.6 Flash 的 Three.js 快速对比
- LocalLLaMA:0731 成绩与评测口径讨论
- LocalLLaMA:第三方榜单截图、token 与缓存成本讨论
- SillyTavernAI:代码成绩能否迁移到非代码体验
- Artificial Analysis:当前公开的 DeepSeek V4 Flash 模型页