🖼️ 图文卡片 🏠 返回首页
精选主题 · 2026-07-31

不换底座,DeepSeek 把 Flash 练成了 Agent

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

2026 年 7 月 31 日,DeepSeek 将 V4‑Flash 官方版 API 推入 public beta。0731 与 Preview 的架构和规模相同,仅重新后训练;此次只更新 Flash API,V4‑Pro API 与 App/Web 模型没有同步更新。

这次发布的意义,不是 DeepSeek 又做出一个更大的基座模型,而是同一套 284B 总参数、13B 激活参数的 Flash 底座,通过重新后训练、Responses API 与 Codex 适配,进入了前沿 Agent 的竞争区间。

两年的效率路线,收口到 Agent 执行层

V2 用 DeepSeekMoE 与 MLA,把模型总容量和每个 token 实际计算量分开;随后上线的上下文缓存,又把重复前缀成本直接压进 API 价格。V3 扩到 671B 总参数、37B 激活,但仍把训练效率、吞吐和低价放在同一张产品表里。

R1 证明大规模强化学习能够塑造推理行为;V3.1 把 thinking/non‑thinking 合入同一模型;V3.2 再把思考嵌入工具调用,并用可验证交互任务训练 Agent。竞争单位由一次回答的正确率,扩展到模型能否在长链路中规划、调用工具、检查结果并继续执行。

2026 年 4 月的 V4 Preview 把 Pro 与 Flash 分层。Flash 为 284B 总参数、13B 激活,支持 1M 上下文,针对 Claude Code、OpenClaw、OpenCode 等工具优化。0731 三个月后不改架构、不扩参数,只重新训练“怎么做事”,并优先补齐 Responses API 与 Codex 入口。

DeepSeek 的路线可以概括为:MoE 压低每 token 计算量,长上下文技术压低记忆成本,可验证后训练塑造工具行为,API 与 Harness 把能力接入工作流。

它重新画的是价格—能力曲线

V4‑Flash 支持 1M 上下文、384K 最大输出和 2500 并发;当前官方价格为未命中输入 $0.14、输出 $0.28/百万 tokens。GPT‑5.6 Luna 的输入与输出价格为 $1 和 $6,Kimi K3 为 $3 和 $15,Gemini 3.6 Flash 为 $1.5 和 $7.5。

价格可以直接比较,Agent benchmark 却不能简单横排。DeepSeek 官方披露 V4‑Flash‑0731 在 Terminal‑Bench 2.1 得到 82.7、DeepSWE 54.4、Toolathlon verified 70.3、Agent Last Exam 25.2;但公开 Code Agent 测试使用尚未发布的 DeepSeek Harness,DSBench‑FullStack 与 DSBench‑Hard 又是内部测试集。

82.7 是一个强烈信号,不是最终裁决。Flash 是否真正改变 Agent 成本,需要在同一任务、同一 Harness 和同一预算下比较一次成功率、重试次数、完成时间与总 token。

发布后的声音,已经从兴奋走向复测

最早的讨论首先惊讶于“同一底座、只靠后训练”。开发者 Haoyi 认为新成绩给 GLM‑5.2 带来压力;LocalLLaMA 社区很快提醒,Preview 使用 Terminal‑Bench 2.0,0731 使用 2.1,不能把 56.9 到 82.7 直接当成严格提升 25.8 分。

日本开发者 Voluntas 把 0731 用于自有 OSS 的代码审查,主观感受是速度没有明显变化,但模型更愿意把任务做完。这与“后训练改善执行行为”的解释一致,却仍是单用户、单项目的即时观察。

另一位开发者 IFITALEX 使用相同规划文档和参考图,让 Gemini 3.6 Flash 与 V4‑Flash 生成 Three.js 的 Raptor 3D 模型,主观判断是 Gemini 的成品略好、速度更快。这条对比不能裁决通用 Agent 强弱,但说明 Coding/Terminal 成绩不会自动迁移到视觉理解与 3D 生成。

LocalLLaMA 还出现了对生成长度、cache write 与真实成本的质疑;SillyTavern 社区则提醒,代码 benchmark 与角色扮演、长文本风格质量的相关性有限。Artificial Analysis 当前公开模型页仍显示 4 月版数据,因此当天流传的榜单截图还不足以成为 0731 的独立定论。

发布后的早期共识不是“Flash 已经夺冠”,而是“它值得立即进入真实工作流复测”。

竞争焦点落到每一美元能完成多少任务

两条线在这里汇合:DeepSeek 两年里持续压缩激活参数、长上下文计算和无效推理 token;0731 又证明,同一底座经过定向后训练与接口适配,可以快速改变 Agent 行为。

Harness 也由此成为模型能力的一部分。Responses API、Codex 适配、工具调用协议与推理预算会直接改变最终成绩,只比较裸模型会越来越失真。

Agent 市场最终比较的,不是每百万 token 有多便宜,而是每一美元能完成多少可验证任务。 Flash 不必在每项能力上夺冠;只要能以更低成本完成足够多任务,就可能成为默认执行层,把更昂贵的旗舰模型留给规划、复核和极难任务。

V4‑Flash‑0731 尚未通过公开同框测试证明自己是最强 Agent,也没有在本次公告中同步发布新的 0731 开放权重。它真正压低的是前沿 Agent 的使用门槛。后续最值得观察的是公开环境中的任务成功率、工具调用错误率、总 token、缓存命中率、时延和全链路成本。

证据边界

主要来源

图文卡片 ⬇️ 一键下载图文卡片