🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-09-01

DeepSeek 开源 V4-Flash-Vision-Exp:开放的是行动入口,不是可靠性证明

正在发生的事很多,这件帮你看过了

研究时间:2026 年 9 月 1 日|主题:开放权重多模态 Agent|依据:官方模型卡、配置、参考实现、论文及同期模型公开材料

事件全貌

2026 年 8 月 31 日,DeepSeek 发布 V4 家族首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。它以 V4-Flash-0731 为语言与 Agent 底座,加入视觉编码器和视觉—语言对齐模块并持续训练;模型权重、Tokenizer、OpenAI 风格消息编码及最小 PyTorch 推理实现均以 MIT License 开放。

模型可接收网页截图、软件界面、图表和多图交错输入,并在读图后继续推理和调用工具。Terminal Bench 2.1 从 V4-Flash-0731 的 82.7 升至 83.9,DeepSWE 从 54.4 升至 59.3,Toolathlon-Verified 从 70.3 升至 75.9;多模态 Agent 评测 ApexBench Pass@1 为 36.5,Agents' Last Exam 为 27.3。

更重要的变化发生在工程层:过去只能通过远程服务验证的视觉能力,如今成为可下载、检查、改写和私有部署的模型资产。权重约 167.8GB,分为 48 个 safetensors 分片;参考实现公开了 Vision Encoder、Aligner、DFlash、MoE、Hyper-Connections 和 DSpark 的组合路径,并以统一编码支持多图、推理和工具消息。

DeepSeek-VL、VL2、Janus 和 OCR 系列早已证明它能处理视觉信息。这次真正新增的,是把视觉观察接入 V4 的长上下文、推理预算和工具协议。它证明了视觉 Agent 的可构建性,但尚未证明生产可靠性。

从视觉理解到环境状态

真实世界视觉奠定感知层

2024 年 3 月发布的 DeepSeek-VL,从一开始便把网页截图、PDF、OCR、图表和高分辨率细节纳入“真实世界视觉—语言理解”。其混合视觉编码器支持最高 1024×1024 图像,并在预训练中刻意保护语言能力。

这为界面 Agent 准备了感知基础:按钮文字、表格单位、局部布局和页面状态都比普通物体识别更重要。不过,此时的模型仍是“看完再回答”,尚未进入观察、计划、行动、读取新状态和纠错的闭环。

MoE、动态分块与视觉路线分叉

2024 年末的 DeepSeek-VL2 将语言侧换成 DeepSeekMoE,引入 Multi-head Latent Attention,并用动态分块适应不同分辨率和长宽比。VL2-Tiny、Small 和主模型每 Token 激活参数分别为 1.0B、2.8B 和 4.5B,体现了 DeepSeek 一贯的取舍:以稀疏激活和输入压缩控制视觉推理成本。

同期 Janus 将视觉理解与图像生成的编码路径分开,再共享统一 Transformer,以缓解语义抽象与像素细节之间的冲突;Janus-Pro 随后扩充数据和规模。V4-Flash-Vision-Exp 继承的是“理解并行动”路线,而非图像生成路线:它要把图像压缩成可靠的环境状态,再交给擅长长程推理和工具调用的 V4。

长上下文成为 Agent 的记忆骨架

DeepSeek-V3.2-Exp 先以 Sparse Attention 降低长上下文成本;2026 年 4 月的 V4 又交错使用 Compressed Sparse Attention 和 Heavily Compressed Attention,并加入 Manifold-Constrained Hyper-Connections 与 Muon 优化器。

V4-Flash 拥有 284B 总参数、每 Token 激活 13B;V4-Pro 为 1.6T 总参数、激活 49B。两者使用超过 32T Token 预训练,原生目标为 100 万 Token 上下文。官方估算,在 100 万 Token 下,V4-Flash 单 Token 推理 FLOPs 约为 V3.2 的 10%,KV Cache 约为其 7%。这不是具体硬件上的吞吐承诺,却解释了为何 DeepSeek 先解决长上下文,再接入视觉。

长任务需要保存终端输出、文件差异、网页状态、截图、工具结果和失败轨迹。视觉会进一步放大状态体积;没有稀疏注意力和 KV 压缩,模型即使能读懂一张截图,也难以经济地连续观察几十轮。

Agent Harness 与推理路径先行

2026 年 6 月公开的 DSpark 是附加在同一检查点上的推测解码模块,并非新底模。7 月 31 日发布的 V4-Flash-0731 则显著强化 Agent 后训练:Terminal Bench 2.1 从 61.8 升至 82.7,DeepSWE 从 7.3 升至 54.4,Toolathlon-Verified 从 49.7 升至 70.3。如此大的变化更可能来自训练分布、推理预算、工具协议和 Agent Harness 的共同作用,而非参数规模。

这些成绩使用 DeepSeek Harness 的 minimal mode、reasoning_effort=max 和特定采样参数。Agent 能力并不只存在于权重中:工具消息格式、错误返回方式、失败轨迹、上下文管理和思考预算都会改变通过率。DeepSeek 先准备长任务架构、推理协议与工具循环,最后才增加视觉观察通道。

视觉进入同一条行动链

V4-Flash-Vision-Exp 的视觉编码器为 32 层、1024 维、16 个注意力头和 14×14 patch;图像经 3 倍下采样,单图视觉 Token 上限为 384。语言主干仍为 43 层、256 个路由专家、每 Token 选择 6 个专家,最大位置长度为 1,048,576。

384 个视觉 Token 优先保护长任务的上下文预算和吞吐,却可能损失小字号、密集表格及长页面细节。配置还将最大宽高比限制为 8,因此超长网页截图仍需分块、缩放或局部截取。

OpenAI 风格 content block 可在文本间插入图片并保持多图顺序,同一编码器支持多轮对话、thinking mode 和 tool calls。一次完整循环可以是:读取截图、推理下一步、调用浏览器或桌面工具、接收新截图并继续行动。图片不再只是问答输入,而成为环境状态。

开放的不只是权重

DeepSeek 此次开放了三类关键资产。

第一是输入协议。独立的 encoding/ 负责把 OpenAI 风格消息、多图内容、思考模式和工具调用编码成 Prompt;TXT 简写与 JSON 输入可生成相同 Token 序列并有测试覆盖。开发者因而可以替换推理引擎,而不必重新猜测聊天模板。

第二是可读执行路径。inference/ 明确定位为 readable reference implementation,展示视觉编码、Aligner、DFlash、MoE、Hyper-Connections 和 DSpark 如何拼合,并提供权重转换及 torchrun 示例。它方便验证和移植,但不是高并发生产服务框架。

第三是完整检查点。约 167.8GB 的权重分为 48 个分片,索引包含约 7.26 万个张量条目。官方示例将检查点转成四路张量并行格式,但这不代表四张任意 GPU 即可部署;运行时、激活、视觉编码器和 KV Cache 都会占用显存,卡型、精度、上下文长度及并发也会改变门槛。

因此,“可本地部署”需要拆成两层:法律和工程资产上已经可以本地运行;经济与运维上仍是数据中心级模型。官方尚未公布具体 GPU 上的显存占用、首 Token 延迟、视觉预填充速度和并发吞吐。

榜单提升真实,但不能读得太满

评测Vision-ExpV4-Flash-0731变化
Terminal Bench 2.183.982.7+1.2
NL2Repo57.754.2+3.5
Cybergym75.376.7-1.4
DeepSWE59.354.4+4.9
Toolathlon-Verified75.970.3+5.6
DSBench-Hard63.659.6+4.0
AutomationBench Public25.725.1+0.6
ApexBench Pass@136.526.2*+10.3
Agents' Last Exam27.325.2*+2.1
Chartography64.3
ZeroBench Pass@535.0

\* V4-Flash-0731 在这两项评测中忽略了多模态元素。

视觉持续训练后,七项文本 Agent 指标中六项上升,仅 Cybergym 下降 1.4 分。这至少表明视觉模块没有明显破坏原有代码与工具能力,持续训练也可能改善了部分任务。

但 ApexBench 的 +10.3 不能解释成视觉质量净增 10.3 分,因为旧模型直接忽略图片,更像能力开关对照组。Chartography 和 ZeroBench 没有旧模型结果,也无法证明演进幅度。

与 Opus-4.8 的同表结果呈交错领先:Vision-Exp 在 Terminal Bench 2.1 为 83.9,对方为 85.0;Toolathlon-Verified 为 75.9 对 76.2;DeepSWE 为 59.3 对 58.0。DeepSeek 在 Agents' Last Exam 和 ZeroBench 略高,在 ApexBench 与 Chartography 略低。开放与闭源模型已不再是单向领先关系,但不同 Harness、服务版本、延迟、Token 消耗和重试策略使几分之差不足以证明稳定排名。

四条开放路线争夺不同生态位

模型多模态形成方式语言主干上下文信息许可核心取舍
DeepSeek-V4-Flash-Vision-Exp在成熟 V4-Flash 上追加视觉并持续训练284B 总参数、13B 激活配置上限 1,048,576MIT保护长程 Agent 能力,执行路径透明
Qwen3.5-397B-A17B视觉—语言 Token 早期融合397B、17B 激活本地默认 262,144;托管版默认 1MApache 2.0原生多模态,尺寸谱系完整
Kimi K2.5约 15T 混合视觉文本 Token 持续预训练1T、32B 激活;MoonViT 400M评测常用 256KModified MIT视觉编程与 Agent Swarm
GLM-5.3-Flash新 Base 上进行 30T 多模态预训练320B、18B 激活评测使用 300K、400K 至 1MMIT原生多模态与能力/价格比

DeepSeek 最像一台可拆解的视觉 Agent 发动机:VL 系列积累屏幕与文档视觉,V4 负责百万上下文和稀疏 MoE,0731 强化工具使用,DSpark 改善生成路径,Vision-Exp 再将它们接合。优势是接口和执行链透明;短板是视觉后接入可能限制深层跨模态共适应,而且目前只有数据中心级尺寸。

Qwen3.5 把多模态做成覆盖多种尺寸的基础能力。开发者可以先在 4B 或 9B 上验证流程,再迁移至大型 MoE,这会显著扩大社区应用面。代价是本地默认上下文仅 262K,扩至约 1.01M 需要调整 RoPE;Search Agent 还依赖上下文折叠及工具历史删减,百万上下文实际是模型、引擎和上下文管理的共同产物。

Kimi K2.5 将视觉用于 Visual Coding 和 Agent Swarm,使主 Agent 能动态创建多个专业子 Agent 并行工作。它突出大模型、大上下文和多 Agent 调度,但部署更重,Modified MIT 需要额外许可审查,部分基准也使用专门的上下文丢弃策略。

GLM-5.3-Flash 是最直接的竞争者:320B 总参数、18B 激活、MIT License,同样支持 reasoning_effort,并混合稀疏注意力和线性注意力。两者的核心分野不是激活参数差异,而是 DeepSeek 的“后接视觉、保护成熟 Agent”与 GLM 的“从新 Base 原生训练多模态”。前者便于复用既有服务栈,后者理论上有更充分的跨模态共适应空间。

历史选择塑造了今天的位置

DeepSeek 的当前位置来自三个长期决定:早期便把网页、PDF、OCR 和图表纳入真实世界视觉;持续用 MoE、MLA、稀疏注意力、CSA/HCA、FP4 专家权重和异构 KV Cache 压缩长状态成本;把输入编码和可读推理代码也视为开放资产。

这些选择让企业可以把屏幕数据留在内网,让研究者替换图像处理或推理后端,也让安全团队检查工具消息。但优势正在转化为约束:后接视觉可能限制跨模态上限;384 个视觉 Token 可能损失密集细节;284B 级主干挡住了多数单机开发者;稀疏、压缩和模块化还增加了内核、缓存、量化及视觉预处理的组合复杂度。

官方把当前代码称为“最小推理实现”十分准确。V4 的混合注意力已改变传统 PagedAttention 的部分假设,视觉又增加预填充和缓存路径。要形成稳定服务,vLLM、SGLang 或企业自研引擎仍需完成内核适配、并发调度和故障恢复。

门槛已从“会不会看”转向“看错后会发生什么”

API 有字段类型、权限和错误码,截图只有像素。视觉 Agent 必须自行判断按钮、金额、弹窗和页面状态,也把原由软件接口承担的确定性重新变成概率推断。

这会产生四类关键故障:其一是感知错误,小字、小数点和页面状态可能被误读,局部放大与二次截图因而是必要机制;其二是状态漂移,页面可能在观察与行动之间因网络、动画或异步加载而改变,需要时间戳、页面标识和动作回执;其三是动作不可逆,误点付款、删除或发布会直接改变真实系统;其四是权限外溢,本地权重保护隐私的同时,也更容易接入高权限内网工具。

ClawBench 披露的 153 个真实网页任务中,最佳成功率仅 33.3%,44.4% 的任务没有任何模型完成。这说明视觉基准接近闭源前沿,不等于真实网页操作已经可靠。Anthropic 披露的无防护模型越权事件也提示:模型对齐和基础设施隔离属于同一条事故链,“实验模型”本身不是安全边界。

因此,首批合理场景应是只读界面审计、动作受白名单约束且全程可回放的内部流程,以及最终提交由人确认的半自动操作。评估不能只看任务通过率,还应记录误点击率、越权尝试率、人工接管率、每成功任务成本和失败恢复能力。

三种未来剧本

最可能:成为研究底座

社区会先推进推理引擎适配、量化、视觉 Token 策略复测和 Agent Harness 集成。企业可能用它测试内网页面、工业软件、图表分析和代码界面,但部署仍集中于拥有多卡服务器和工程团队的机构。

关键信号包括:vLLM 或 SGLang 出现稳定 recipe;ApexBench、Chartography 和长程 GUI 任务得到独立复现;更小的蒸馏或量化版本出现;DeepSeek 公布真实硬件上的视觉预填充及并发数据。

最危险:榜单接近前沿,行动可靠性停在三分之一

如果团队把模型卡分数直接当作生产授权依据,一次小字误读、状态过期或重试失控就可能使长任务失败。本地部署还可能绕过 API 侧的过滤、速率限制和审计,直接把实验权重接入浏览器、终端及内网系统。

危险信号不是榜单下跌,而是工具调用没有幂等设计、最终操作缺少二次确认、截图与动作无法回放,以及模型更新后的成功率波动无人监测。

最乐观:屏幕成为开放 Agent 的通用兼容层

旧 ERP、远程桌面、科研仪器、工业控制台和封闭 SaaS 往往没有稳定 API。若开放模型能在本地读取界面并通过受控工具执行动作,屏幕便可能成为跨软件兼容层,使感知、推理、行动和审计都留在组织内部。

这一前景不依赖榜单再多几分,而依赖更小模型、可复现的视觉细节能力、标准化动作安全层、可校验观察、显式事务和完整审计轨迹。屏幕可以成为通用接口,前提是工程系统接住像素带来的不确定性。

结论:开源的是行动入口,不是可靠性证明

V4-Flash-Vision-Exp 将 DeepSeek 两年多的路线汇合:VL 系列提供真实世界视觉,V4 提供长上下文与稀疏计算,0731 提供 Agent 后训练,DeepSpec/DSpark 提供推理路径,独立 encoding 则把图片、推理和工具调用放入同一种消息协议。

它不是参数最大的原生多模态模型,不是尺寸最完整的本地模型,也不是成熟的桌面 Agent 产品;它是一套开放、可拆解、能把视觉观察继续送入工具链的旗舰级 Agent 底座。

8 月 31 日真正打开的是一个新的行动入口:开放模型操作无 API 软件时,不再必然依赖外部 OCR、DOM 解析或封闭视觉服务,感知、推理和工具协议可以进入同一开放检查点。这会加速本地 GUI Agent、内网自动化和视觉编程研究。

但核心成绩主要来自发布方,模型发布不足一天,独立复现、实际显存、吞吐、长任务错误累积和安全隔离仍无完整答案。当前证据足以说明它“能研究、能运行、能继续开发”,不足以说明它可以无人监督地交付真实行动。

信息来源

1. DeepSeek,DeepSeek-V4-Flash-Vision-Exp 模型卡,2026-08-31,访问于 2026-09-01:<https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp> 2. DeepSeek,V4-Flash-Vision-Exp 配置文件,访问于 2026-09-01:<https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp/blob/main/config.json> 3. DeepSeek,V4-Flash-Vision-Exp 最小推理说明,访问于 2026-09-01:<https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp/blob/main/inference/README.md> 4. DeepSeek,V4 文本与视觉消息编码说明,访问于 2026-09-01:<https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp/blob/main/encoding/README.md> 5. DeepSeek-AI,DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence,arXiv:2606.19348,2026:<https://arxiv.org/abs/2606.19348> 6. DeepSeek,DeepSeek-V4-Flash-0731 模型卡,2026-07-31:<https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731> 7. DeepSeek,DeepSpec:DFlash、DSpark 与推测解码训练评测代码,访问于 2026-09-01:<https://github.com/deepseek-ai/DeepSpec> 8. Haoyu Lu 等,DeepSeek-VL: Towards Real-World Vision-Language Understanding,arXiv:2403.05525,2024:<https://arxiv.org/abs/2403.05525> 9. Zhiyu Wu 等,DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding,arXiv:2412.10302,2024:<https://arxiv.org/abs/2412.10302> 10. Chengyue Wu 等,Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation,arXiv:2410.13848,2024:<https://arxiv.org/abs/2410.13848> 11. Qwen Team,Qwen3.5-397B-A17B 官方模型卡,2026:<https://huggingface.co/Qwen/Qwen3.5-397B-A17B> 12. Moonshot AI,Kimi K2.5 官方模型卡,2026:<https://huggingface.co/moonshotai/Kimi-K2.5> 13. Z.ai,GLM-5.3-Flash 官方模型卡,2026:<https://huggingface.co/zai-org/GLM-5.3-Flash> 14. ClawBench 项目,面向真实网页环境的 Agent 评测,2026:<https://github.com/openclaw/clawbench> 15. Anthropic,Improving our alignment and security efforts,2026:<https://www.anthropic.com/news/improving-alignment-security-efforts>

图文卡片 ⬇️ 一键下载图文卡片