前沿科技日报 · 2026-09-02
AI 系统从“扩大模型能力”转向“校准真实能力、接入受控工作流、重做内存与互连”
2026-09-02 前沿科技洞见 · 日报
过去 24 小时的新增事实指向三个变化:微软用零后训练的滑动窗口基线重新检验线性注意力投入,Ai2 用题目反应理论拆解安全评测究竟测到了什么;OpenAI、CrowdStrike 与印度 UPI 则把 Agent 接入病历、攻防检测和支付规则,权限与验证开始成为产品本体;三星、Tenstorrent 和 Lightmatter 同时把推理瓶颈指向存储层级与互连。
📊 今日关键数据
- 99.0%:带 4 个 attention sinks 的 SWA(64,4) 在六项知识与推理任务上平均恢复原全注意力模型的性能,且不需要后训练。(来源:PaperWeekly)
- 79% vs. 70%:BenchMIRT 对留出题目答对与否的预测准确率,相比简单基准平均分基线。(来源:Ai2)
- 90.25%:StageWAM 在 RoboTwin 2.0 的 50 个双臂任务上的整体成功率,成功轨迹步数较 Motus 少 5.97%。(来源:大模型智能)
- 8/8:SafeMind 体系中三条通过质量门的检测规则捕获全部八种未用于规则生成的新攻击。(来源:NVIDIA AI)
- 950 亿美元:戴尔季度末 AI 服务器积压订单;当季新订单为 609 亿美元。(来源:华尔街见闻)
🔍 今日值得深读
微软用零后训练滑动窗口恢复全注意力模型 99.0% 的平均性能
微软团队把带 attention sinks 的滑动窗口注意力(SWA)补回线性注意力研究常被忽略的强基线:SWA(64,4) 固定保留前 4 个 sink token、其余 60 个位置保存局部历史,不改权重、不做蒸馏。
- 发生了什么:在六项知识与推理任务上,SWA 平均恢复原全注意力模型 99.0% 的性能,接近使用 3.5亿—7亿 token 后训练的 QRWKV6(99.1%);主实验覆盖 Phi、Mistral、Llama、Qwen、QwQ,11 组比较中有 9 组取得除原模型外的最高平均成绩。Llama 3.1 8B 的 S-NIAH 长上下文测试中,它在最长 4K 上下文、128/256/512 三种窗口下均不低于 LoLCATs 和 Liger-GLA。
- 为什么值得深读:结果不是提出更复杂的新结构,而是说明既有比较可能低估了正确配置的简单基线;若窗口小于 512 时其内存开销已与线性注意力相当,线性化改造所需的后训练成本就需要重新论证。
- 后续看点:关注更长上下文、不同层数和真实解码吞吐下的准确率—内存曲线,以及在训练时原生采用线性注意力的模型上,结论是否仍成立。
来源:PaperWeekly
Ai2 用 100 个模型和 3.4 万道题审计 16 项大模型评测
BenchMIRT 把心理测量学中的多维题目反应理论用于大模型评测,不预先告诉系统各基准声称测量的能力,而是从回答模式估计模型能力维度、题目难度及题目区分度。
- 发生了什么:系统在 100 个 LLM、16 项基准、超过 3.4 万道题的结果上训练,自动识别出通用推理与安全两条主维度。对留出题目的答对与否预测准确率为 79%,高于按基准平均分预测的 70%;保留信息量最高的 10% 题目,仍能近似保留完整题集描绘的模型强弱关系。
- 为什么值得深读:审计显示 BBQ 社会偏见评测更多地区分推理而非安全能力;HarmBench 整体偏安全,但版权题更依赖推理;ToxiGen 对两条主维度都提供的信号有限。这直接影响安全排行榜、模型选型和评测预算的解释方式。
- 后续看点:需要在训练集之外的新模型与新基准上验证维度稳定性,并检查压缩到 10% 题目后,对小众能力和尾部失败是否出现系统性漏检。
来源:Ai2 · BenchMIRT 说明
OpenAI 将 Astra 列为首个达到“关键”网络能力阈值的模型
OpenAI 披露 Astra 已达到其 Preparedness Framework 中的 Critical 网络安全能力阈值,计划近期公开发布一个受限版本,而高级网络能力仅向选定合作伙伴开放。
- 发生了什么:测试中,Astra 找到两个 V8 零日漏洞并以较少人工协助组成利用链;独立专家评估还显示,它能攻破加固浏览器、逃逸沙箱并在宿主机执行命令,以及串联多个操作系统漏洞从低权限账户提升至 root。OpenAI 曾在 Hugging Face 事件后暂停部分训练,并于 8 月 28 日在更严格控制下恢复主要前沿强化学习运行。
- 为什么值得深读:这是模型能力首次越过 OpenAI 自己定义的关键网络门槛,发布方式因此从统一开放转向能力分层与合作伙伴预警,模型安全措施直接改变可用功能范围。
- 后续看点:关注公开版具体移除了哪些能力、合作伙伴提前获得多长防御窗口,以及对沙箱逃逸、零日发现和自主提权的持续评测与访问审计。
来源:OpenAI · Wired 报道索引
Code World Model 用代码维护持久世界,视频模型只负责视觉呈现
西湖大学与南洋理工大学把开放世界建模拆成两层:Coding Agent 处理低频、语义复杂的事件与规则,并生成可执行代码维护世界状态;视频模型依据代码编译出的粗粒度 Proxy 视频和文本生成高保真观察。
- 发生了什么:团队从 157 段 GTA V gameplay 中采样 9,420 个 5 秒片段,总计约 5.6 小时,以 LoRA 适配 MiniMax-H3。定性结果显示模型能遵循 Proxy 给出的实体位置、轨迹、布局和镜头运动,同时补足外观与局部动态。
- 为什么值得深读:该架构把可复现的碰撞、冷却、伤害和长程状态交给代码,把高频视觉生成交给视频模型,绕开语言模型每步更新的延迟,也避免视频模型从像素中独自反推长期因果规则。
- 后续看点:当前原型训练规模小,尚未实现自回归实时生成;需要观察长时交互中的状态一致性、代码错误恢复、量化基准和端到端帧率。
来源:学术头条
StageWAM 为机器人动作模型加入无人工标注的任务阶段预测
清华大学 AIR 等机构提出 StageWAM,用 Stage-JEPA 在潜空间预测下一任务阶段,再把阶段表征注入世界动作模型,同时指导未来视频与动作生成。
- 发生了什么:RoboTwin 2.0 的 50 个双臂任务上,StageWAM 整体成功率达到 90.25%,成功轨迹平均执行 74.82 步,较 Motus 减少 5.97%。阶段划分基于 V-JEPA2 表征自动生成,不需要人工阶段标签。
- 为什么值得深读:固定长度的视频—动作片段能回答机械臂“下一步怎么动”,却不一定知道任务何时进入抓取、移动或放置的新阶段;潜空间阶段目标为短期物理预测增加了任务进度约束。
- 后续看点:关注对未见任务、相机变化和真实机器人噪声的泛化,以及 90.25% 成功率中不同任务类型的分布、失败原因和计算延迟。
来源:大模型智能
OpenAI 把 Epic 病历和九类官方医疗数据接入 ChatGPT
ChatGPT for Healthcare 新增 Epic EHR 集成与 Healthcare Public Data 插件,让获授权的患者记录、医学证据和公共数据在同一受治理工作区中被检索、汇总并回链。
- 发生了什么:临床团队可查询就诊记录、化验、用药与专科建议的变化;公共数据插件提供对 PubMed、DailyMed、CMS Coverage 等九类官方来源的结构化访问。输入材料称,99.1% 的临床场景回复经医师评估为安全,并配套企业权限控制与 HIPAA 合规措施。
- 为什么值得深读:医疗 Agent 的核心变化不是新增问答能力,而是模型开始跨 EHR、医学文献和机构知识工作,同时保留授权边界与支持信息回链。
- 后续看点:需要继续核验 99.1% 指标的场景构成、医生评分方法与错误严重度,并观察 Epic 环境中的最小权限、审计记录和错误信息回写流程。
来源:OpenAI
📰 独立报道
AGI、Agent 与产品
Google 让 Gemini 按需抽取视频片段,最高减少 88% token
Gemini 不再等距扫描整段视频,而是联合推理转录、音频与画面,并动态调整帧率提取所需时刻;Google 称长视频分析最高可少用 88% token。该能力正通过 API 推向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,Gemini App 将随后上线。
Meta 发布覆盖 70 多种语言的实时流式语音转录模型
Meta AI Research 发布 Muse Voice Transcribe,这是 MSL 首个实时音频感知模型,支持流式自动语音识别并覆盖 70 多种语言。正式材料尚未给出跨语言错误率、延迟或硬件条件,实际部署价值仍取决于弱网、口音和多人重叠语音下的结果。
Codex 桌面运行时内置 LibreOffice、Python、Node.js 与 Poppler
Simon Willison 检查本地缓存发现,Codex 主运行时约 1.7GB,包含完整 Python、Node.js,以及 Poppler、git 和 LibreOffice 原生二进制;文档技能会调用这些工具。桌面 Agent 因而获得可重复的本地文档处理环境,同时也扩大了安装体积、依赖更新与沙箱治理范围。
Anthropic 将 Claude Fable 5.1 的 Agent 任务成本最多降低 45%
Anthropic 发布 Fable 5.1 与 Mythos 5.1,称 Fable 5.1 通常比上一代便宜约 25%,复杂 Agent 任务最多便宜 45%,同时减少安全机制的误拦截。输入材料未提供可复核的任务集、token 用量与质量—成本曲线,企业选型仍需在自身工具链上重测。
来源:The Verge · TechCrunch
安全与工程
CrowdStrike 与英伟达用攻防 Agent 自动生成检测规则
SafeMind 让攻击 Agent 生成受控攻击、把遥测转为检测规则,再用新攻击路径复测。系统以 Nemotron 3 Ultra 编排、微调版 Nemotron 3 Super 编写和修复规则;三条通过质量门的规则捕获了八种未参与生成的新攻击,原始攻击的平均回测检出率由 16.5% 升至 41.9%。
来源:NVIDIA AI
PyTorch 展示 Primus Tuning Agent 预估千卡训练配置性能
AMD 的 Primus Tuning Agent 先用快速硬件基准预测不同分布式配置的运行速度,再为 6710 亿参数、千张 GPU 训练寻找较优组合,目标是替代逐项实跑并节省数千 GPU 小时。正式材料尚未披露预测误差、搜索空间和最终吞吐提升。
来源:PyTorch
AIR 持续发现企业 Agent,并审查其技能与插件行为
AIR 的平台面向企业内部 Agent 资产盘点,可发现正在运行的 Agent,持续检查它们调用的技能和扩展,并阻断不期望行为。产品把安全边界从模型输入输出扩展到可执行插件供应链;公司同时完成 5000 万美元融资,但本次入选依据是其新增治理工作流。
来源:TechCrunch
资管金融
印度支付机构为 AI Agent 使用 UPI 准备规则
印度国家支付公司正为 Agent 发起 UPI 操作准备规则。输入材料未披露授权、限额、撤销和责任分配细节,但底层网络 8 月处理 245.1 亿笔交易、金额 29.8 万亿卢比;若 Agent 获准接入,身份确认与逐笔授权方式将直接决定风险边界。
来源:Tech in Asia
央行开始讨论 AI 交易系统对政策沟通的反向作用
普林斯顿经济学家 Markus Brunnermeier 在杰克逊霍尔提出,AI 交易系统可更快解析央行反应函数并提前交易,甚至迫使央行减少可预测表达或分别面向人和机器沟通。关键风险不是单个模型预测更准,而是同质 Agent 同时调仓后改变市场条件与政策选择。
CFA Institute 把投资 Agent 的难点落到碎片数据、压力测试与治理
CFA Institute 圆桌讨论了投资工作流中构建 Agent、处理不完整且碎片化的金融数据、用合成数据做情景分析和组合压力测试,以及用开源数据训练小模型。讨论把透明度、偏差和组织问责与模型能力并列,强调决策流程仍需可追溯控制。
硬件与算力
三星规划 HBM5 采用 2nm 基础芯片,zHBM 改为存储堆叠在处理器上方
三星称 HBM5 目标性能为 HBM4E 的两倍、单瓦性能提升 20%、热阻降低 20%,并准备 12/16/20 层堆叠,预计 2028 年前后量产。更长期的 zHBM 计划把存储直接堆叠在处理器顶部,目标性能为 HBM4E 的八倍、单瓦性能三倍,预计 2029 年后推出。
来源:华尔街见闻
Tenstorrent 把 MoE 模型完整放入 SRAM,实现每秒 400 token
Ankura 在售价约 1.2 万美元的 Tenstorrent QuietBox 上,把 MoE 模型整体放进 SRAM,报告推理速度达到每秒 400 token。该结果把瓶颈直接指向权重搬运而非算术吞吐;正式材料尚未给出模型名称、精度、批量和输入输出长度,跨平台比较需等待完整条件。
来源:Tenstorrent
Lightmatter 用光子 scale-up fabric 降低不同上下文长度的推理延迟
Lightmatter 称其 2026 年 IEEE HOTI 最佳论文展示了光子 scale-up fabric 如何突破铜互连的距离与带宽限制,并在短、中、长上下文推理负载下降低延迟。正式材料未给出具体拓扑、系统规模和延迟降幅,工程价值仍需结合论文演示核验。
来源:Lightmatter
戴尔 AI 服务器季度订单达 609 亿美元,积压订单升至 950 亿美元
戴尔第二财季 AI 优化服务器营收 164 亿美元、同比翻倍,季度订单创 609 亿美元纪录,期末积压订单 950 亿美元;公司把全年 AI 服务器销售预期提至约 740 亿美元。需求同步拉动网络、存储与传统 CPU 服务器,显示 Agent 负载并未消除通用基础设施需求。
来源:华尔街见闻