前沿科技日报 · 2026-06-03
Anthropic Project Glasswing扩展至200家机构覆盖关键基础设施,特朗普AI行政令经产业压缩后以自愿框架签署,微软Build 2026同步发布首款自研推理模型MAI-Thinking-1与量子芯片Majorana 2
2026-06-03 前沿科技洞见 · 日报
📊 今日关键数据
- 30 亿笔:支付宝已完成的 AI 智能体支付笔数,成为全球首个大规模商用的 AI 原生支付基础设施(来源:虎嗅-前沿科技)
- 10,000+:Anthropic Project Glasswing 合作机构迄今发现的高危或严重级别安全漏洞数量(来源:Anthropic 新闻)
- 20 秒:微软 Majorana 2 量子比特寿命,对比上代 Majorana 1 的不足 12 毫秒,提升约 1667 倍(来源:华尔街见闻)
- 2029 年:微软将实现可扩展商用量子计算机的目标年,比原计划提前一半(来源:The Verge)
- 3倍:OSCAR 系统在 100k 上下文、batch-size-1 条件下的 decode 加速倍数(来源:PaperWeekly-公众号)
- 5 亿美元以上:HPE Q1 的 AI 订单积压,其中 64% 来自企业和主权客户(来源:Tech in Asia)
🔍 今日值得深读
Anthropic Project Glasswing 扩展至200家机构,关键基础设施网络漏洞扫描进入规模化阶段
Anthropic 宣布将 Project Glasswing 合作机构从约 50 家扩展至 200 家以上,新增约 150 家来自 15 个以上国家的组织,覆盖此前未纳入的电力、水务、医疗、通信和硬件等行业。所有新合作机构需通过 Anthropic 的安全审查才能获得 Claude Mythos Preview 的访问权限。根据 Anthropic 披露,迄今 Glasswing 合作方已发现超过 10,000 个高危或严重级别安全漏洞。
Anthropic 在公告中明确警告:未来 6 至 12 个月内,预计多家 AI 公司将拥有与 Mythos 同级别的模型,且可能在没有防滥用措施的情况下直接发布。这意味着网络攻击的频率和形式将变得更加不可预测,而 Glasswing 的扩展正是为了在这一窗口期内帮助防御方提前适应。Anthropic 对自身角色的定位有两个层面:一是安全地向软件行业广泛提供更强模型和工具;二是逐步将支持重心从发现漏洞转向披露、修复和部署补丁软件。
- 关键事实:Glasswing 合作机构超过 200 家,覆盖 15+ 国家,已发现 10,000+ 高危/严重安全漏洞;对于大多数合作方,Anthropic 估计一次重大攻击可影响超过 1 亿人
- 为什么值得深读:Anthropic 自主判断 6-12 个月内同级模型将被其他公司发布,这一时间窗口预判本身是重要情报;AI 主导的漏洞扫描从少数精英合作方走向跨国关键基础设施,规范将发生根本性变化
- 后续看点:DARPA 对 Mythos 项目的持续审查结论何时公开;新批次合作机构中电力和水务基础设施的发现率是否高于第一批软件企业
来源:Anthropic 新闻
百川智能发布 AI 家庭医生"百小医",AI 医疗从模型展示转向医疗供给重构
百川智能发布 AI 家庭医生产品"百小医",同步与北京儿童医院、肿瘤医院开展专科合作。百川的核心切入点不是给通用模型加医疗知识库,而是在模型侧直接强化问诊能力:基础模型 M4 增加了问诊、循证、专病和多模态能力,内部测评发现问诊准确度每提升 2%、诊疗结果准确度提升 1%。百小医的目标场景是院前、院后和家庭管理——这恰好是中国医疗供给中长期缺位的三个环节。
此次发布的特殊之处在于,百川将产品发布放在了一场医学、公共卫生、医保、卫健和临床多方参与的公开讨论中,而非单纯的 AI 产品发布会。多位院士和三甲医院院长公开表态合作意愿,标志着医疗圈对 AI 的态度从一年前的警惕转向了实质合作。极客公园报道揭示,真正有价值的 AI 医疗路线是让模型在信息不完整时继续追问,而不是直接给出答案或建议就医——前者才是真正增加医疗供给。
- 关键事实:百川与北京儿童医院合作儿科 AI 家庭医生、与肿瘤医院合作陪伴型 AI;中国科协名誉主席韩启德院士等顶级医学界人士公开参与讨论
- 为什么值得深读:AI 医疗的竞争壁垒正从"模型能否回答"转向"模型是否在追问不足时主动问完",这是产品设计哲学的根本差异,对医疗 AI 的工程路径有直接影响
- 后续看点:百川 M4 模型的问诊准确度在三甲医院真实临床数据上的表现如何;医保能否认可 AI 家庭医生的服务价值,这将决定商业模式能否成立
来源:极客公园
AI 原生支付快速扩张:支付宝完成 30 亿笔 AI 代理支付,幻觉欺诈与责任归属成新挑战
支付宝已完成 30 亿笔 AI 智能体支付,成为全球首个大规模商用的 AI 原生支付基础设施。京东、支付宝、微信等平台正密集布局 AI 代理支付,AI 模型可以在用户授权下自动完成推荐、比价、下单和支付全流程。然而,一系列新型风险随之暴露:AI 幻觉可能导致误支付(如 AI 推荐保险后自动生成个人收款码);现行协议规定"AI 协助完成的操作视为用户本人直接操作",但这一规则在 AI 判断失误时的责任归属尚无清晰机制。
问题的核心在于,当 AI 直接"摸钱包"时,传统支付安全的验证逻辑(人工确认每笔交易)在自动化链路中被绕过了。用户的选择权也受到限制:AI 自主决策的商品选择和供应商匹配,可能让用户在不完全知情的情况下完成消费。当前各平台的 AI 代理支付协议均将支付授权范围的判断权留给 AI,监管框架尚未跟进。
- 关键事实:支付宝完成 30 亿笔 AI 代理支付;AI 钱包协议规定 AI 协助操作等同于用户直接操作,但无对应的差错赔偿机制
- 为什么值得深读:AI 代理支付的普及速度已超过金融消费者保护规则的更新速度,支付宝 30 亿笔这一量级已形成事实标准,监管和技术行业标准的缺失期可能产生大规模纠纷
- 后续看点:中国人民银行和银保监会是否会出台 AI 代理支付的专项监管细则;各平台是否会公开 AI 幻觉导致误支付的投诉数据
来源:虎嗅-前沿科技
🔥 今日聚合动态
微软 Build 2026:自研推理模型、量子芯片与 AI 智能体搜索层同步发布
微软年度开发者大会 Build 2026 于美东时间 6 月 2 日开幕,在一场演讲中同时宣布了多项独立重量级发布:首款从零自研推理模型 MAI-Thinking-1、第二代拓扑量子比特芯片 Majorana 2、面向 AI 智能体的搜索基础设施 Web IQ、OpenClaw 风格的个人智能体 Scout,以及开发者权限控制标准 Agent Control Specification。多源报道从各自角度呈现了不同层面的技术细节。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 自研推理模型 | The Verge | MAI-Thinking-1 是微软首款高级推理模型,"从干净数据从零训练,未蒸馏第三方模型" |
| 量子芯片时间表 | The Verge | Majorana 2 量子比特寿命超 20 秒(上代不足 12ms),2029 年商用量子计算目标提前一半 |
| AI 智能体搜索 | 华尔街见闻 | Web IQ 定位为 AI Agent 的网络智能层,不再仅服务人类搜索用户,而是直接为智能体提供实时可信结构化信息 |
| 个人智能体 | TechCrunch | Scout 受 OpenClaw 启发,集成在 Microsoft 365,支持自主多步骤任务和长链路规划 |
| 权限控制标准 | TechCrunch | Agent Control Specification 是开源标准,让开发者、合规和安全团队用可移植策略文件定义 Agent 行为边界 |
- 关键事实:MAI-Thinking-1 是 Build 2026 的七款新模型之一,也是微软真正意义上的第一款从零自研推理模型;Majorana 2 的量子比特寿命比上代提升约 1667 倍
- 互补信息:The Verge 关注技术参数,TechCrunch 强调开发者工具,华尔街见闻提供了 Web IQ 如何改变 AI 与互联网关系的完整叙事框架
- 后续看点:MAI-Thinking-1 在主流推理评测(AIME、MATH-500)上的得分何时公开;Majorana 2 是否能在 DARPA 审查中通过量子纠错验证,解决第一代遭外部研究者质疑的争议
特朗普 AI 行政令签署:强制测试被产业游说压缩为自愿框架
特朗普于 6 月 2 日签署 AI 网络安全行政令,要求 AI 企业以"自愿参与"的形式,在前沿模型发布前向联邦政府提供访问权限,配合建立"网络安全信息共享中心"。这一版本与最初草案差距显著——原方案曾讨论将政府审批作为发布前置条件,但在 AI 行业集体反对后大幅缩水。多家媒体从不同角度揭示了这一博弈过程。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 政策内容 | The Verge | 行政令要求建立"自愿框架",同时设立机密基准评估 AI 网络能力 |
| 产业博弈 | TechCrunch | 经行业反对后签署,原计划强制政府审批 AI 系统被删除 |
| 白宫内部冲突 | WIRED | 行政团队内部在 AI 监管力度上存在分歧,官员与 AI 高管之间仍在协商框架 |
| Mythos 触发因素 | 华尔街见闻 | 政策加速落地直接因 Anthropic Mythos 的技术突破,由白宫幕僚长苏西·威尔斯牵头推进 |
- 关键事实:行政令保留"自愿"参与条款;政府将制定机密基准评估 AI 网络能力;整个政策周期因 Anthropic Mythos 突破而加速
- 互补信息:WIRED 揭示白宫内部存在监管力度分歧,这意味着"自愿框架"可能是临时妥协而非最终立场;华尔街见闻将政策时间线与 Anthropic Mythos 进展明确关联
- 后续看点:白宫内部分歧是否会推动后续立法将"自愿"改为"强制";欧盟 AI Act 实施与美国自愿框架的分歧是否会影响全球前沿模型发布策略
OpenAI Codex 全角色知识工作扩展:从编程工具走向多职能自动化平台
OpenAI 于同日发布两篇官方文章,从不同角度介绍 Codex 的角色扩展。第一篇聚焦于非工程角色(分析师、营销、设计、投资者),介绍新上线的 Codex 插件、站点和注释功能;第二篇通过《知识工作新时代》报告,将 Codex 定位为通过 AI 驱动的研究、数据分析、工作流自动化和内容创作改变生产力的平台工具。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 非工程角色扩展 | OpenAI 新闻 | 新增插件和注释功能,使分析师、营销、设计、投资者等角色能直接从 Codex 获取 AI 辅助 |
| 知识工作定位 | OpenAI 新闻 | Codex 转变为通用知识工作生产力工具,覆盖研究、数据分析、工作流自动化和内容创作 |
- 关键事实:Codex 从以编程为核心扩展至分析师、营销、设计、投资等多职能场景;官方定位从"编程助手"升级为"知识工作平台"
- 互补信息:两篇文章合并来看,Codex 的产品战略是将编程能力作为底层基础,向上延伸至所有依赖信息处理的知识工作岗位,这与 Claude 的企业定位形成直接竞争
- 后续看点:非工程用户的实际留存率和付费转化如何;Codex 与 ChatGPT Teams 之间的功能边界是否会继续模糊
📰 独立报道
🤖 AGI 前沿
Holo3.1:HuggingFace 发布快速本地化 Computer Use Agent
H Company 在 HuggingFace 发布 Holo3.1,这是一款面向本地运行的 Computer Use Agent,主打快速响应和端侧部署能力。随着微软 Scout、OpenAI Codex 等产品向 Computer Use 方向扩展,本地化 Computer Use Agent 成为多路径竞争的新赛段。Holo3.1 的技术路线重点在于在不依赖云端模型的前提下完成对计算机界面的理解和操作。
- 关键事实:Holo3.1 定位快速、本地化的 Computer Use Agent,部署于 HuggingFace 上开放访问
- 后续看点:Holo3.1 在 ScreenSpot 等标准 Computer Use 评测上的基准表现,以及与 Claude 3.5 Computer Use 的性能对比
来源:Hugging Face
Travelers 与 OpenAI 合作的 AI 理赔助手在全美推广
美国保险公司 Travelers 与 OpenAI 合作开发的 AI 理赔助手正式覆盖全美,用于引导客户完成理赔流程、提供 24/7 支持,并在灾害事件高峰期实现运营弹性扩展。这是 OpenAI 企业应用在保险行业的标志性规模化案例,理赔流程的 AI 自动化程度直接关系到客户体验和运营成本。
- 关键事实:Travelers AI 理赔助手已覆盖全美,提供全天候服务支持,具备灾害期弹性扩容能力
- 后续看点:理赔准确率和客户满意度数据是否会披露;其他大型保险公司是否会跟进类似方案
来源:OpenAI 新闻
GitHub Copilot 桌面应用发布技术预览:引入 Canvas 画布功能
GitHub 在 Build 2026 上发布 GitHub Copilot 桌面应用技术预览版,引入新功能 Canvases(画布),实现用户与 Agent 之间的双向工作协同。这与传统 IDE 插件模式不同,桌面应用定位为以 Agent 为原生工作方式的独立开发环境,允许 Agent 在画布上独立完成任务并与用户互动。
- 关键事实:GitHub Copilot 桌面应用进入技术预览,Canvases 功能实现用户-Agent 双向协作
- 后续看点:Canvases 正式发布时间;与 VS Code Copilot 扩展的功能重叠度如何处理
来源:GitHub 博客
告别 Ai2:OLMo 核心研究员 Nathan Lambert 宣布离职
Interconnects 作者、Allen Institute for AI(Ai2)OLMo 模型核心研究员 Nathan Lambert 宣布离职,结束了其在 Ai2 的开源大模型研究工作。OLMo 系列是少数坚持完全开放权重、数据和训练代码的大型语言模型。Lambert 的离开引发了开源 AI 研究社区的关注,尤其是在各大 AI 实验室的商业化趋势持续加深的背景下。
- 关键事实:Nathan Lambert 宣布离开 Ai2,其曾主导 OLMo 模型的训练和开源工作
- 后续看点:Ai2 是否会保持对 OLMo 系列开源路线的投入力度;Lambert 后续动向
国际数学联盟背书《莱顿宣言》:数学界警告 AI 对研究领域的五重威胁
由 16 名研究者历经八个月起草的《莱顿 AI 与数学宣言》由国际数学联盟正式背书,首次以集体声明形式记录了 AI 对数学研究的潜在冲击。宣言发布时间恰在 OpenAI 公开宣称其 AI 模型推翻了一个有 80 年历史的几何猜想的两周之后。宣言的核心关切包括:AI 对数学研究过程的侵蚀、学术独立性的维持,以及科技公司在数学领域日益增加的影响力。
- 关键事实:宣言由莱顿大学 2025 年 9 月会议后起草,共 16 名研究者参与,国际数学联盟正式背书
- 后续看点:各数学顶会是否会基于宣言调整 AI 辅助研究的投稿规范
来源:Ars Technica
OSCAR:KV Cache 压缩至 2-bit,长上下文推理加速 3 倍
最新论文 OSCAR 提出面向长上下文推理的 2-bit KV Cache 系统,将旋转目标从重建 KV 向量改为保留 Attention 对 KV 的消费方式,压缩至 2.28 BPE(Bits Per Element)。系统在 Qwen3-4B-Thinking 上相对 TurboQuant 最高提升 40.1 分,在 100k 上下文、batch-size-1 条件下 decode 最高加速 3 倍。OSCAR 已接入 SGLang,可直接在主流推理框架上部署。
- 关键事实:KV Cache 压缩至 2.28 BPE,100k 上下文推理最高 3 倍加速;已接入 SGLang
- 后续看点:OSCAR 在更大规模推理模型(如 Qwen3-70B、Llama 4)上的性能表现;商业推理服务是否会采纳 2-bit KV Cache 降低长上下文成本
🏢 AI 战略与组织变革
Meta 缩减员工 AI 行为追踪工具:员工反弹后压缩范围
Meta 内部备忘录显示,公司正在缩减其于 4 月推出的员工 AI 行为追踪工具的功能,该工具原本用于收集员工工作数据以训练 AI 模型。多名员工对追踪范围提出异议后,公司调整了实施方案。这是 AI 公司在数据采集与员工隐私之间边界问题上的典型案例。
- 关键事实:Meta 4 月上线员工行为追踪工具用于 AI 训练数据,员工反弹后主动压缩追踪范围
- 后续看点:Meta 是否会对员工同意机制作出制度性调整;其他 AI 公司的员工数据使用规范如何
来源:Techmeme
X 平台全球 AI 自动翻译上线:文化碰撞随互动壁垒消失而显现
X 平台通过 Grok AI 向全球用户推出自动翻译功能,将外语帖子译成用户母语语言。技术上,Grok 翻译采用缓存机制:一旦某用户触发翻译,同语言用户可直接看到已翻译版本。这导致原本限于特定语言社区的内容瞬间被放大到全球可见。日本用户因匿名发言被意外全球化而引发抗议,同时全球用户也借此发现不同语言社区在日常烦恼上的高度共通性。
- 关键事实:Grok 翻译为缓存式全局触发,一次翻译即可令同语种用户全体可见
- 后续看点:X 平台是否会提供用户端的翻译可见性控制选项;其他社交平台是否会推出类似功能
来源:虎嗅-前沿科技
字节跳动开源 Bernini:多模态大模型引导的 AI 视频生成统一框架
字节跳动商业化技术团队开源 Bernini 视频生成框架,将任务拆分为语义规划(多模态大模型)和视觉渲染(Diffusion 模型)两个独立阶段。模型可直接处理用户自然语言指令,先理解语义再执行渲染,解决了现有 AI 视频模型"听不懂指令"导致的可控性问题。Bernini-R 推理代码和权重已开放,完整版将进一步包含 MLLM Planner。
- 关键事实:Bernini-R 已开源;框架支持参考生成和视频编辑,能稳定保持帧间一致性
- 后续看点:完整版含 MLLM Planner 的 Bernini 何时开源;在 EvalCrafter 等视频生成评测上的数值表现
来源:量子位-公众号
💰 金融科技前沿
微信 AI Agent 测试中:腾讯计划本月启动合规审批,14 亿月活用户的入口之争
《金融时报》报道,腾讯正测试微信内置 AI Agent 原型,计划最快于 6 月启动合规审批。该 Agent 将直接置于微信主界面,通过自然语言指令调用小程序,串联微信生态服务(咖啡下单、餐厅预约等)。微信及 WeChat 合并月活用户达 14.32 亿,AI Agent 若成功集成,将形成目前全球规模最大的 AI Agent 分发渠道之一。但腾讯面临合规审批、算力供给和小程序生态协调等多重挑战。
- 关键事实:微信合并月活 14.32 亿;AI Agent 将直接嵌入微信主界面;最快本月启动合规审批
- 后续看点:腾讯 AI Agent 的合规审批通过时间;是否允许第三方小程序开发者接入 AI Agent 调度能力
来源:虎嗅-前沿科技
BIS 工作论文:稳定币监管中的流动性与资本阈值设计
BIS 发布工作论文 1355,研究稳定币快速增长带来的流动性错配风险,提出流动性阈值和资本阈值两类监管缓冲工具。关键发现:无监管状态下稳定币发行方倾向于持有生息债券而非现金,增加挤兑时违约风险;严格的最低要求可能反而引发恐慌性抛售,加剧违约概率;同时持有流动性阈值和资本阈值才能有效降低系统性风险,两者组合优于任何单一工具。
- 关键事实:BIS 建立模型证明:流动性阈值增加现金持有,资本阈值同时增加资本和现金,二者组合可有效控制稳定币挤兑风险
- 后续看点:美国稳定币立法(GENIUS Act)的监管细则是否会采纳类似阈值框架;欧洲 MiCA 框架下的储备要求如何与 BIS 建议对齐
来源:经济学前沿
🎓 学术前沿
Functional Attention:ICML 2026 论文提出将注意力机制重新解释为函数映射
德国慕尼黑工业大学、牛津大学、德克萨斯大学奥斯汀分校等合作发表 ICML 2026 论文,提出 Functional Attention(FUNCATTN)框架,将注意力机制从离散 token 点对匹配转变为连续函数空间上的线性算子。在 ShapeNet 3D 点云分割任务中达到 87.2% mIoU(对比 Point Transformer 85.7%),在 PDE 求解任务中表现出更强的分辨率不变性。论文代码已开源:https://github.com/xjffff/FUNCATTN
- 关键事实:FUNCATTN 在 40 个实验中证明了比标准注意力更好的分辨率不变性和分布外泛化能力
- 后续看点:FUNCATTN 在更大规模 Transformer(如 LLM/VLM)上的扩展效率测试
来源:BAAI 智源
MPA:深度原理发布材料基础模型,40 个实验任务中 35 项达 SOTA
「深度原理 Deep Principle」发布材料性质预测基础模型 MPA(Materials Property Axiom),将 LLM 三阶段训练思路引入材料领域:预训练→物理对齐中期训练→后训练。在 40 个真实实验性质预测任务上,MPA 相比 ChemBERTa、ChemProp、Uni-Mol2 等主流模型综合最优,35 项达到 SOTA。在更接近真实研发条件的骨架划分(scaffold split)测试中,MPA 平均误差降低 14.6%。
- 关键事实:40 个真实实验任务中 35 项 SOTA;骨架划分下平均误差降低 14.6%;比同类方法更适合"预测全新结构"场景
- 后续看点:MPA 在工业实际化合物筛选中的应用验证;是否会开源训练代码和权重
来源:BAAI 智源
🔧 硬件算力与智能设备
伊利诺伊大学突破:200°C 低温三层硅芯片堆叠,良率达 98%~100%
伊利诺伊大学团队开发出新型单片 3D 硅芯片集成技术,在 200°C 以下低温条件下,用超薄硅纳米膜实现三层晶体管垂直堆叠,制造良率达 98%~100%。关键创新在于使用无结晶体管(junctionless transistor),对温度的要求不超过 200°C,完全兼容现有产线;辊式转印工艺将薄层晶体管直接转移到目标基底,无需新材料。在摩尔定律面临物理极限的背景下,垂直堆叠路线通过提升计算密度延续性能提升。
- 关键事实:三层硅晶体管垂直堆叠,温度限制 ≤200°C,与现有产线兼容,良率 98%~100%
- 后续看点:该技术从实验室到量产的时间线;英特尔和台积电是否会评估该堆叠路线与其 CFET 方案的兼容性
SK Hynix 计划五年内晶圆产能翻倍,供应 Nvidia Vera Rubin HBM
SK Hynix 宣布计划在未来五年内将晶圆产能翻倍,并正在扩展与台湾方面超出台积电范围的合作伙伴。公司将为 Nvidia 的 Vera Rubin 系统供应高带宽内存(HBM)。在 AI 算力需求持续高增长的背景下,HBM 成为最紧缺的半导体产品之一。
- 关键事实:SK Hynix 五年内晶圆产能翻倍目标;为 Nvidia Vera Rubin 供应 HBM
- 后续看点:扩产计划是否会缓解当前 HBM 供应瓶颈;三星是否会跟进类似规模的产能扩张
来源:Tech in Asia