微软 MDASH 把漏洞研究从「最强模型竞赛」改写为可验证、可路由的系统工程
2026-08-03
一、触发新闻与一句话定义
微软在 2026 年 7 月 27 日把自研网络安全模型 MAI-Cyber-1-Flash 接入 MDASH,并宣布这套组合在 CyberGym 上取得 95.95% 的漏洞复现成功率,同时把运行成本降至此前最佳配置的一半。 这条消息在 8 月 2 日进入今日日报;按照微软披露的路由方式,MAI-Cyber-1-Flash 承担最多九成任务,最难的一成交给 GPT-5.4,MDASH 外围的百余个专用智能体负责扫描、辩论、去重、证明与修复。
一句话定义:MDASH 不是一个“会找漏洞的模型”,而是一条把不同模型、传统程序分析、安全专家知识和可执行验证组织起来,将候选问题变成可复现证据的多智能体漏洞研究流水线。
真正值得研究的不是 95.95% 这个数字有多高,而是数字内部发生了什么。微软的模型卡写得很清楚:MAI-Cyber-1-Flash 是一个稀疏 MoE 模型,总参数 137B、每次激活 5B、上下文长度 256K;但它单独使用轻量终端框架测试 ExploitGym 时,内核、用户态和浏览器三类得分全是 0。把它放回 MDASH、替换其中 80% 的既有模型调用后,CyberGym 却从 88.4% 上升到 95.95%。微软 MAI-Cyber-1-Flash 模型卡
一个模型单独不会做的事,一套系统做到了。
这正是今天的触发点。
二、纵向分析:从诞生到当下
1. 2024:模型开始离开聊天框,漏洞描述成了第一根拐杖
大模型进入漏洞研究,并不是从“自主发现零日漏洞”起步的。早期实验更像给一个聪明但没有现场经验的新人配上终端,再把答案的半边递到它手里。
2024 年 4 月,伊利诺伊大学团队发布研究:给 GPT-4 智能体 CVE 描述和工具后,它能在 15 个真实 one-day 漏洞中以 pass@5 复现 87%;拿掉 CVE 描述,成功率降到 7%。整个智能体只有 91 行代码。这个结果第一次把两件事同时摆上桌面:模型已经能把自然语言漏洞描述翻译成工具操作,但它还不擅长在没有线索时决定“该去哪里看”。LLM Agents can Autonomously Exploit One-day Vulnerabilities
两个月后,同一研究线提出 HPTSA:一个规划智能体负责探索,再派出多个任务专用智能体并行尝试。相对单智能体,成绩最多提高 4.5 倍。它给后来者留下了一个朴素经验——网络安全任务的难点不只在推理深度,也在搜索宽度;一个上下文里同时探索许多假设,会让模型过早押注,分工可以把被忽略的路径重新捞回来。Teams of LLM Agents can Exploit Zero-Day Vulnerabilities
同年,Google Project Zero 的 Project Naptime 演进为 Big Sleep。2024 年 10 月,Big Sleep 在 SQLite 开发分支找到一个可利用的栈缓冲区下溢,开发者收到报告当天修复。Google 将其称为首个公开的、由 AI 智能体在广泛使用的真实软件中发现未知可利用内存安全问题的案例。Big Sleep 的路线不是抛弃模糊测试,而是让模型在传统工具难以覆盖的语义路径上提出假设,再回到真实执行环境验证。Google Project Zero:From Naptime to Big Sleep
到这里,赛道的三个基本零件已经出现:模型负责提出语义假设,智能体负责调用编译器、调试器和测试工具,执行环境负责判真。MDASH 后来的 Prepare、Scan、Validate、Prove,并非凭空出现;它把这些零件推向了企业级规模。
2. 2024—2025:比赛把“发现、证明、修复”连成了同一条链
DARPA 的 AI Cyber Challenge(AIxCC)改变了问题设置。比赛不奖励一段听起来合理的漏洞解释,而是要求自动化网络推理系统在真实开源项目上发现漏洞、生成证明、给出补丁,并接受机器判分。
这套约束很残酷,也很健康。安全团队最缺的从来不是“可疑代码提示”,而是能被复现、能交给组件负责人、能进入发布节奏的发现。候选结果如果没有触发输入,就只是往人工队列里再塞一张工单;补丁如果没有回归验证,还可能把一个安全问题换成另一个稳定性问题。
2025 年 8 月,Taesoo Kim 领导的 Team Atlanta 赢得 AIxCC。决赛覆盖 5,400 万行代码、63 个挑战;全部队伍合计发现 54 个合成漏洞并修复 43 个,还发现 18 个非合成真实漏洞、提交 11 个相应补丁。DARPA 对冠军的评价不是某个单项最耀眼,而是发现、证明、补丁配对和提交质量的综合表现最好。DARPA:AI Cyber Challenge results
这段历史解释了 MDASH 为什么不像一个通用聊天智能体。Team Atlanta 在两年比赛中仅一个 OpenAI 模型就消耗了超过 1000 亿 Token。Kim 后来回忆,这场高成本实验让团队看清了两个问题:所有任务都调用最强模型,成本无法扩展;把所有漏洞类型和工作要求塞进一个提示词,模型会承受过高的“认知负载”,反而找不到深层问题。微软对 Taesoo Kim 的访谈
比赛结束后,Kim 和多名 Team Atlanta 成员整体加入微软。这个迁移比一次普通招聘更关键:研究团队带着完整失败记录进入了一家同时拥有 Windows 私有代码、GitHub 代码生态、MSRC 历史案例和大规模安全运营数据的公司。AIxCC 提供了方法,微软提供了难度、数据与生产出口。
MDASH 的历史锁定就发生在这里。它从一开始追求的不是“让一个模型成为安全专家”,而是“让系统稳定复用许多专家的工作方式”。
3. 2025:CyberGym 把演示视频变成可重复比较
真实漏洞研究很难比较。各家公司扫描的代码不同、漏洞类型不同,公开披露还受修复周期限制。一个系统声称发现了十个零日,可能是因为它更强,也可能是因为目标更大、判定更松或尝试次数更多。
CyberGym 在 2025 年提供了一把相对统一的尺。它收录 188 个开源项目中的 1,507 个真实历史漏洞,代码来自补丁前版本。Level 1 给智能体高层漏洞描述和未修复代码,要求生成能工作的 PoC;只有当输入在补丁前版本触发、补丁后版本不再触发,才算成功。初版论文中,四种智能体框架和九种模型的最佳组合 OpenHands + Claude 3.7 Sonnet 只有 11.9%。CyberGym 论文
这项基准完成了两次降噪。
第一次,它把“说对了”改成“跑出来了”。第二次,它把漏洞发现生命周期切成一个明确环节:已知漏洞复现。它不等于盲扫零日,也不等于把崩溃升级成任意代码执行,更不检验生成补丁是否正确。边界收窄后,各家才有可能对同一任务比较。
但 CyberGym 也暴露了描述依赖。官网后续实验显示,不提供漏洞文字描述时,只有 3.5% 的实例可复现;PoC 超过 100 字节的任务成功率约 10%,而这类任务占基准的 65.7%。模型擅长顺着线索深入,却仍容易在搜索空间和长输入构造上失速。CyberGym 官方项目页
这个弱点后来直接进入 MDASH 的设计:先用历史提交、索引和威胁模型缩小攻击面,再让不同审计智能体从明确漏洞类别出发,而不是让一个智能体在数百万行代码里漫游。
4. 2025—2026:赛道从“发现一个”转向“处理一批”
Big Sleep 证明了智能体能找到真实未知漏洞,AIxCC 证明了自动发现与修复可以被统一判分,CyberGym 则让复现能力有了公开坐标。随后,问题突然从能力稀缺转成了处理能力过剩。
OpenAI 在 2025 年 10 月公布 Aardvark,2026 年 3 月更名为 Codex Security。它以持续接入代码仓库为产品形态:建立威胁模型、扫描提交、在隔离环境中验证,再附上 Codex 生成的补丁供人工审查。OpenAI 报告其在“黄金仓库”中识别出 92% 的已知与合成漏洞,并在开源项目中获得十个 CVE;但这组内部口径不能直接与 CyberGym 横比。OpenAI:Introducing Aardvark
Anthropic 在 2026 年 4 月展示 Claude Mythos Preview。它采用相对简单的框架:多个 Claude Code 实例按文件并行寻找漏洞,最后再由一个模型复核报告。模型可以在隔离容器中读代码、运行项目、调试并生成 PoC。到 5 月,Project Glasswing 披露扫描 1000 多个开源项目,模型提出 23,019 个发现,其中 1,752 个高危或严重候选经六家外部安全机构审查,90.6% 被确认是真阳性;真正的瓶颈已经落到人工复现、协调披露和补丁。Anthropic:Assessing Claude Mythos Preview Project Glasswing 更新
开源维护者开始感受到另一面。Anthropic 记录,一些维护者因披露队列过长,主动要求降低提交速度;一个高危或严重漏洞平均要两周才能修复。AI 把发现成本压低后,验证、去重、归属、修复与发布没有自动变便宜。
这恰好是 MDASH 选择“辩论—去重—证明”而非“多开几个扫描智能体”的原因。吞吐不是单位时间产出多少候选,而是单位时间产出多少能被开发团队接受的证据。
5. 2026 年 5 月:MDASH 首次公开,系统先于自研模型成立
2026 年 5 月 12 日,微软正式公布 MDASH。此时 MAI-Cyber-1-Flash 尚未发布,系统使用可获得的通用模型,已经在 CyberGym 取得 88.45%。微软同时披露,MDASH 帮助团队在 Windows 网络与认证栈中找到 16 个进入当月 Patch Tuesday 的 CVE,其中四个是严重远程代码执行漏洞;私有测试驱动 StorageDrive 中人为植入的 21 个漏洞全部找到,该次运行没有误报;回放五年 MSRC 历史案例时,clfs.sys 的 28 个漏洞召回率为 96%,tcpip.sys 的 7 个漏洞召回率为 100%。微软安全博客:Defense at AI speed
数字很强,但更有价值的是架构公开。MDASH 把流程拆成五段:
- Prepare:接入源码,建立语言感知索引,从历史提交画出攻击面和威胁模型。
- Scan:不同审计智能体检查候选路径,输出带假设和证据的发现。
- Validate:另一组“辩手”分别从攻击者和开发者角度争论可达性、可利用性与严重度。
- Dedupe:按语义和补丁关系合并重复发现。
- Prove:生成并运行触发输入,用 ASan 等确定性工具证明漏洞在真实程序中存在。
百余个智能体不是百余个自由聊天的副本。每个角色有自己的漏洞类型、提示规则、工具和停止条件。通用智能体仍能找到超过一半的问题,但多是较浅漏洞;专用智能体负责追踪跨文件对象生命周期、协议状态机等容易被通用扫描漏掉的路径。微软还允许安全专家用插件注入模型训练语料里没有的领域知识,例如 CLFS 磁盘容器布局、内存状态机、Windows 内核调用约定和 IRP 规则。
这套组合在 CVE-2026-33824 上体现得很具体。漏洞是一处跨六个源文件的别名生命周期错误;任何单文件分析都看不到完整的 double-free 链。专用审计智能体把错误位置与同一代码库中的正确处理方式对照,辩论阶段要求它经得住反方质疑,最后 Prove 阶段用两个 UDP 包完成触发。它不是模型“灵光一现”,而是搜索、类比、反驳和执行共同收敛。
6. 2026 年 7 月:小模型加入,路由取代了全量升级
7 月 27 日,微软发布 MAI-Cyber-1-Flash,并把它放入已经成熟的 MDASH。模型采用稀疏 MoE 架构,总参数 137B、激活参数 5B,是 MAI-Code-1-Flash 的网络安全微调版本。它不提供独立 API,只通过 Azure AI Foundry 私有预览在 MDASH 内向经过审批的客户开放。MAI-Cyber-1-Flash 模型卡
微软给它的任务不是接管整条链,而是处理高频、可标准化的大头。官方博客称它最多承接 90% 的任务,GPT-5.4 处理最难的 10%;模型卡使用更严格的改造口径:以 MAI-Cyber-1-Flash 替换现有 MDASH 中 80% 的模型后,CyberGym 从 88.4% 提升到 95.95%。相比原先由 GPT-5.4、GPT-5.4 mini 和 GPT-5.3 Codex 组成的最佳配置,成本下降 50%。Microsoft AI:Introducing MAI-Cyber-1-Flash inside MDASH
这里有一个容易被标题遮住的反差。模型卡的单模型外部评测中,MAI-Cyber-1-Flash 在 ExploitGym 的 Kernel、Userspace、Browser 三项均为 0。CyberGym 测“根据描述复现已知漏洞”,ExploitGym 测“把已经会触发的漏洞输入升级成获得未授权代码执行的完整利用”,后者明显更难。95.95% 没有证明 5B 激活参数的小模型突然具备全栈攻击能力;它证明一个受限模型可以在合适的任务切片上工作,由框架提供索引、角色、工具、验证和困难任务升级。
同一天,微软宣布更大的 Project Perception,并计划 8 月 3 日进入公开预览。MDASH 成为 Perception 的软件漏洞信号源,外围再由红队智能体找攻击路径、蓝队智能体调查风险、绿队智能体执行加固。至此,MDASH 从代码扫描产品变成微软“感知—推理—行动”安全栈中的一个高置信度部件。微软官方博客:Rethinking security for the age of AI
两年时间里,技术主线走完了一次倒置:2024 年大家追问“模型能否找到漏洞”,2026 年微软开始追问“哪些步骤根本不该用最贵的模型”。
三、横向分析:竞争图谱
当前赛道已经不是简单的三家模型排行榜。更准确的切法,是看一套系统把注意力放在漏洞生命周期的哪一段,以及它把能力锁在模型、框架、数据还是企业流程里。
| 路线 | 主要对象 | 典型工作方式 | 公开优势 | 公开短板或边界 |
|---|---|---|---|---|
| 微软 MDASH | 大型私有代码与企业 DevSecOps | 百余个专用智能体、多模型路由、辩论、去重、领域插件、动态证明 | CyberGym 95.95%;可接 Patch Tuesday 和 Project Perception | 新成绩尚待公开榜单复核;仅私有预览;系统细节和成本口径有限 |
| Anthropic Mythos / Glasswing | 大规模开源和关键基础设施 | 强通用模型,多实例按文件并行,末端模型复核,外部人工分诊 | 已披露大规模真实发现与外部验证率;完整利用能力强 | 发现速度超过人工披露与修复能力;高能力模型严格限用 |
| OpenAI Codex Security | 持续变化的软件仓库 | 威胁建模、提交扫描、沙箱验证、Codex 补丁、GitHub 工作流 | 更靠近日常开发者体验,检测与修复连接紧 | 公开结果多为内部“黄金仓库”口径,跨系统比较有限 |
| Google Big Sleep / OSS-Fuzz | 开源软件和变种分析 | Gemini 推理结合模糊测试、威胁情报与真实执行 | 最早公开找到真实未知可利用内存漏洞;能与现有 fuzz 基础设施结合 | 企业产品形态、吞吐和统一公开基准披露较少 |
1. Anthropic:把模型能力推到前面,随后撞上人类队列
Anthropic 的路线与 MDASH 形成最鲜明对照。Mythos Preview 的公开方法并不复杂:隔离容器、Claude Code、按文件并行实例、一个末端复核智能体。复杂性更多装在模型本身,而不是百余个固定角色里。
这条路线的上限很高。Anthropic 披露,Mythos Preview 在 Firefox 147 JavaScript 引擎漏洞上,数百次尝试中生成 181 个工作利用,并有另外 29 次取得寄存器控制;Opus 4.6 在相同类型实验中只有两次成功。它还自主发现并利用 FreeBSD 中一个存在 17 年的远程代码执行漏洞。强模型能跨过“发现—触发—利用”之间的鸿沟,而 MAI-Cyber-1-Flash 单独在 ExploitGym 上还跨不过去。
但 Mythos 的生产瓶颈也最早显形。Glasswing 的漏斗从 23,019 个模型发现,收缩到 1,752 个外部机构复核候选,再到协调披露和实际补丁。维护者并不缺下一张报告,他们缺时间确认报告是否重复、严重度是否正确、哪个版本受影响、如何在不破坏兼容性的情况下修补。
用户视角里,真正有分量的反馈不是“模型很聪明”,而是 Cloudflare 等合作方报告漏洞发现速度提高十倍以上,同时开源维护者要求 Anthropic 放慢披露。前者说明强模型扩大了覆盖面,后者说明未经系统消化的覆盖面会转化为组织债务。
MDASH 的选择更保守:把开发者的反驳提前模拟成辩论智能体,把重复报告提前合并,把可执行证明放在工单之前。Anthropic 把模型能力推到最前沿,微软则试图把能力变成开发组织可吞咽的形状。
2. OpenAI:从提交进入,产品入口比角色数量更重要
Codex Security 的前身 Aardvark 以代码仓库的日常变化为中心。它先建立整个仓库的威胁模型,再检查提交与历史,验证候选漏洞,最后生成供人审查的补丁。目标用户不是专门运行一次大规模攻防研究的实验室,而是每天合并代码的开发团队。
它的优势是入口自然。GitHub 提交、代码注释、沙箱复现和一键补丁都在工程师已有流程旁边。用户不必理解系统究竟用了多少个智能体,只需要判断证据和补丁是否可信。OpenAI 披露的合作方反馈也集中在“复杂条件下的问题深度”,而不是某个公开榜单名次。
短板同样来自证据口径。92% 是 OpenAI “黄金仓库”里的已知与合成漏洞识别率,和 CyberGym 的 1,507 个统一实例不是一把尺;产品对威胁建模、提交历史和 GitHub 集成的依赖,也让它更适合持续开发,而不是扫描无源码二进制或高度特化的 Windows 内核组件。
MDASH 与 Codex Security 都在做多阶段验证,但产品哲学不同:OpenAI 把安全研究嵌入开发者界面,微软把安全专家的组织结构编码进框架。前者争夺“开发时刻”,后者争夺“企业安全系统的判定权”。
3. Google:模型与传统模糊测试不是替代关系
Big Sleep 的历史更早,也更克制。Google 的公开叙事始终把模型放在 Project Zero、OSS-Fuzz 和威胁情报旁边。2025 年,Big Sleep 根据 Google Threat Intelligence 的线索发现 SQLite 漏洞 CVE-2025-6965;Google称它在漏洞被用于现实攻击前完成阻断。OSS-Fuzz 的另一条路线则让 LLM 生成模糊测试目标,并在 2024 年向开源维护者报告 26 个新漏洞,其中包括 OpenSSL 的 CVE-2024-9143。Google:A summer of security Google Security Blog:Leveling Up Fuzzing
Google 路线提醒行业,传统程序分析和模糊测试不会因为智能体出现而失效。它们便宜、确定、能长时间稳定运行;模型更适合生成测试入口、理解代码语义、选择变种和解释异常。Kim 在微软访谈中也承认,控制流图、数据流和 CodeQL 等传统分析更快、更便宜,MDASH 应该把结果作为数据库和工具交给智能体,而不是让模型逐 Token 重建一遍。
Big Sleep 的公开用户口碑有限,因为它主要是 Google 内部研究能力,不是通用企业产品。它的价值更像一条反证:如果一套方案把“Agentic”理解成所有环节都交给模型,它很可能比混合系统更贵,也更不稳定。
4. MDASH:优势不在某一项最强,而在把异构能力固定下来
MDASH 的生态位落在四条路线的中间:没有 Mythos 那样公开展示极强的完整利用能力,没有 Codex Security 那样直接围绕普通开发者入口,也没有 Big Sleep 那样长期扎根开放模糊测试生态。它的优势来自微软独有的生产条件。
第一,私有代码制造了训练污染较低、经济价值很高的练兵场。Windows、Hyper-V、Azure 和驱动生态不在公共训练语料中,模型必须面对真实陌生代码。
第二,MSRC 历史案例、补丁与 Patch Tuesday 提供了稀缺反馈。团队能知道一个发现最终是否被接受、是否能复现、如何修复、上线后是否有效。这些反馈可以继续生成专用智能体与插件。
第三,微软同时控制模型、云、代码平台和安全产品。MAI-Cyber-1-Flash 可以在 MDASH 内负责低成本吞吐,GPT-5.4 接管难题,Project Perception 消化高置信度发现,Defender Portal 承接客户动作。横向看,这不是单点产品能力,而是一条垂直整合链。
代价也来自同一处。客户会被绑定在微软的模型路由、Azure Foundry、Defender 与私有插件体系中;外部研究者无法独立复现 Windows 私有集结果。更直接的证据缺口是,截至 2026 年 8 月 3 日,CyberGym 公共页面仍展示微软 5 月的 MDASH 88.4% 条目,尚未列出 95.95% 新成绩。新成绩来自微软博客与模型卡,公开提交的尝试次数、完整日志和成本分母暂缺。CyberGym 公共榜单
所以 95.95% 应被当作一个强烈但尚未完全外部复核的系统信号,而不是行业已经盖章的终局纪录。
四、横纵交汇洞察
1. 微软真正商品化的,是安全研究的组织结构
把纵轴和横轴叠在一起,MDASH 最重要的历史遗产不是 Team Atlanta 赢过比赛,而是团队在超过 1000 亿 Token 的消耗中学会了哪些工作不能继续靠“再调用一次最强模型”解决。
百余个智能体看起来像规模竞赛,实际对应的是百余种被固定下来的注意力:一种盯对象生命周期,一种盯协议状态,一种扮演不愿接受漏洞报告的开发者,一种负责生成可触发输入。插件则把 Windows 文件系统、内核约定和组织经验变成机器可调用的外部记忆。
过去,顶尖安全研究员的价值很大一部分存在于默会知识里:他知道哪类代码值得看,哪种崩溃是噪声,开发者会怎样反驳,怎样构造最短证据。MDASH 尝试把这些判断拆成角色、工具、停止条件和验收标准。模型可以更换,组织结构留下。
这解释了为何 5B 激活参数模型能让系统总成绩上升,同时单独做 ExploitGym 又是零分。它不需要成为完整研究员,只需在职责边界内成为高吞吐部件。铁路的效率不取决于每节车厢都会驾驶火车,而取决于轨道、调度、信号和转运是否协调。
2. “小模型赢了”是误读,“昂贵判断被稀疏调用”才是变化
微软的成本下降并非单纯来自参数更少。真正改变成本曲线的是任务路由:高频扫描、初步辩论和标准化工作交给 MAI-Cyber-1-Flash,跨文件、长链路和高不确定任务升级给 GPT-5.4;传统程序分析处理适合确定性计算的部分;领域插件提供不必由模型重新推导的知识。
这条逻辑会从安全扩散到投研、法务、运维和科研智能体。系统不应问“哪个模型综合分最高”,而应问:哪一步有便宜且可靠的判定器,哪一步可以由专用小模型覆盖,哪一步的不确定性和损失足以支付前沿模型费用。
模型路由只有在任务可观察时才有效。MDASH 能做,是因为 PoC 是否在补丁前触发、补丁后消失,可以执行验证;候选是否重复,可以按补丁和语义聚类;插件能否构造日志文件,可以直接运行。没有这些判定器,“把难题升级给大模型”就会退化成另一个模型猜测模型的黑箱。
因此,MDASH 给企业智能体最可迁移的启示不是“多智能体”,而是先建设验收环境,再谈自动分工。
3. 95.95% 同时是成绩,也是边界提示
CyberGym Level 1 给出漏洞描述和未修复代码,测的是复现目标漏洞。它比 CTF 更接近真实代码,又比盲扫零日、完整利用和正确修复更窄。微软 5 月披露的 16 个 Windows CVE 给了前向生产证据,7 月的 95.95% 给了标准化复现证据,两者结合比任何单一数字更可信。
但还缺三块拼图。
一是公开榜单复核。95.95% 尚未出现在 CyberGym 公共条目中,pass@几、总调用量、失败实例分布需要更完整披露。
二是端到端修复质量。CyberGym 不检验补丁是否完整,也不检验补丁引入的回归。微软正把完整利用生成视为下一步,因为只有真正形成攻击效果,才能用同一利用去验证补丁。
三是现实吞吐。单次评测成本下降 50% 不等于安全团队总成本下降 50%。如果扫描量扩大十倍,或发现队列让人工分诊翻倍,总成本仍会上升。Anthropic 的披露拥堵已经提前展示了这个悖论。
我的判断是,下一阶段的榜单不会只比“找到多少”,而会同时追踪四个数:经执行确认的真阳性率、去重后的有效发现数、从发现到可合并补丁的时间、每个最终修复的全链路成本。
4. 双用途风险会让“能力”和“产品”越来越分离
MDASH、Mythos 和 Big Sleep 都能生成触发输入,边界再向前一步就是完整利用。防守方需要这种能力判断严重度,攻击者也可以用它降低武器化成本。于是行业出现一个看似矛盾的产品形态:模型能力越来越强,独立模型访问反而越来越少。
MAI-Cyber-1-Flash 只允许在 MDASH 中使用,运行环境无公网,客户需要审批;Mythos Preview 没有普遍开放,而是通过 Glasswing 和验证计划交付;Big Sleep 保持在 Google 的研究与安全体系内。各家出售的不是裸能力,而是带身份、沙箱、审计、权限和披露流程的受控工作流。
这会加深头部公司的优势。安全数据无法简单下载,私有代码不能公开,真实漏洞又受披露窗口限制。谁拥有更多代码、历史补丁、执行环境和客户反馈,谁就能把“发现—修复—结果”连成训练回路。微软把它称为 model、data、harness 三者共优化;其中最难复制的不是 5B 激活参数,而是数十年 MSRC 记录和进入 Patch Tuesday 的反馈路径。
5. 三个未来剧本
最可能的剧本:漏洞研究成为分层流水线。 专用小模型和传统分析负责大范围覆盖,前沿模型只处理模糊描述、跨文件状态和复杂利用,确定性工具负责判真,人类负责高风险修复与披露。MDASH 会从私有预览进入更多企业,但以微软安全栈的一部分出售,而不是开放一个 MAI-Cyber API。衡量竞争力的核心从模型榜单转向每个有效修复的成本和周期。
最危险的剧本:发现速度越过修复速度。 Mythos 已经让维护者请求减慢披露;若更多公司同时扫描同一批基础软件,重复报告、抢先披露和补丁拥堵会耗尽维护者。攻击者可能获得相近模型,却不需要验证补丁、协调厂商和等待发布,防守方所谓的数据优势反而被流程负担抵消。届时,最薄弱环节不是模型安全,而是开源维护和软件更新机制。
最乐观的剧本:可执行证明成为软件发布的常规单元测试。 每个高风险提交都自动经过威胁建模、专用扫描、对抗辩论、PoC 与补丁回归;系统保存的不只是“发现了什么”,还保存触发输入和修复后的不可达证据。漏洞研究不再是发布后的突击审计,而成为持续集成的一部分。若微软能把 MDASH 的插件与证明协议开放为行业接口,而不是只留在 Defender 内部,这条路线可能跨越单一厂商生态。
回到开头的反差:一个在 ExploitGym 单独得零分的小模型,放进 MDASH 后把 CyberGym 推到 95.95%。这不是模型能力失去价值,而是模型终于被放回了工作现场。
安全研究从来不是一个人看懂所有代码。它是一群人分工、争论、复现、否定,再留下开发者无法忽视的证据。微软做的,是把这套社会协作压进软件系统。
五、信息来源
1. Microsoft AI — Introducing MAI-Cyber-1-Flash inside MDASH(访问时间:2026-08-03) 2. Microsoft — MAI-Cyber-1-Flash Model Card(访问时间:2026-08-03) 3. Microsoft Security Blog — Defense at AI speed: Microsoft’s new multi-model agentic security system tops leading industry benchmark(访问时间:2026-08-03) 4. Microsoft Official Blog — Rethinking security for the age of AI(访问时间:2026-08-03) 5. Microsoft Command Line — From research to reality: An interview with Microsoft VP of Security Research Taesoo Kim(访问时间:2026-08-03) 6. DARPA — AI Cyber Challenge marks pivotal inflection point for cyber defense(访问时间:2026-08-03) 7. CyberGym — Evaluating AI Agents’ Real-World Cybersecurity Capabilities at Scale(访问时间:2026-08-03) 8. arXiv — CyberGym: Evaluating AI Agents’ Cybersecurity Capabilities with Real-World Vulnerabilities at Scale(访问时间:2026-08-03) 9. arXiv — LLM Agents can Autonomously Exploit One-day Vulnerabilities(访问时间:2026-08-03) 10. arXiv — Teams of LLM Agents can Exploit Zero-Day Vulnerabilities(访问时间:2026-08-03) 11. Google Project Zero — From Naptime to Big Sleep: Using Large Language Models To Catch Vulnerabilities In Real-World Code(访问时间:2026-08-03) 12. Google — A summer of security: empowering cyber defenders with AI(访问时间:2026-08-03) 13. Google Security Blog — Leveling Up Fuzzing: Finding more vulnerabilities with AI(访问时间:2026-08-03) 14. OpenAI — Introducing Aardvark: OpenAI’s agentic security researcher(访问时间:2026-08-03) 15. Anthropic — Assessing Claude Mythos Preview’s cybersecurity capabilities(访问时间:2026-08-03) 16. Anthropic — Project Glasswing: An initial update(访问时间:2026-08-03)