FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-09-02

AI 系统从“扩大模型能力”转向“校准真实能力、接入受控工作流、重做内存与互连”

降低FOMO的每日信息交付

2026-09-02 前沿科技洞见 · 日报

过去 24 小时的新增事实指向三个变化:微软用零后训练的滑动窗口基线重新检验线性注意力投入,Ai2 用题目反应理论拆解安全评测究竟测到了什么;OpenAI、CrowdStrike 与印度 UPI 则把 Agent 接入病历、攻防检测和支付规则,权限与验证开始成为产品本体;三星、Tenstorrent 和 Lightmatter 同时把推理瓶颈指向存储层级与互连。

📊 今日关键数据

🔍 今日值得深读

微软用零后训练滑动窗口恢复全注意力模型 99.0% 的平均性能

微软团队把带 attention sinks 的滑动窗口注意力(SWA)补回线性注意力研究常被忽略的强基线:SWA(64,4) 固定保留前 4 个 sink token、其余 60 个位置保存局部历史,不改权重、不做蒸馏。

来源:PaperWeekly

Ai2 用 100 个模型和 3.4 万道题审计 16 项大模型评测

BenchMIRT 把心理测量学中的多维题目反应理论用于大模型评测,不预先告诉系统各基准声称测量的能力,而是从回答模式估计模型能力维度、题目难度及题目区分度。

来源:Ai2 · BenchMIRT 说明

OpenAI 将 Astra 列为首个达到“关键”网络能力阈值的模型

OpenAI 披露 Astra 已达到其 Preparedness Framework 中的 Critical 网络安全能力阈值,计划近期公开发布一个受限版本,而高级网络能力仅向选定合作伙伴开放。

来源:OpenAI · Wired 报道索引

Code World Model 用代码维护持久世界,视频模型只负责视觉呈现

西湖大学与南洋理工大学把开放世界建模拆成两层:Coding Agent 处理低频、语义复杂的事件与规则,并生成可执行代码维护世界状态;视频模型依据代码编译出的粗粒度 Proxy 视频和文本生成高保真观察。

来源:学术头条

StageWAM 为机器人动作模型加入无人工标注的任务阶段预测

清华大学 AIR 等机构提出 StageWAM,用 Stage-JEPA 在潜空间预测下一任务阶段,再把阶段表征注入世界动作模型,同时指导未来视频与动作生成。

来源:大模型智能

OpenAI 把 Epic 病历和九类官方医疗数据接入 ChatGPT

ChatGPT for Healthcare 新增 Epic EHR 集成与 Healthcare Public Data 插件,让获授权的患者记录、医学证据和公共数据在同一受治理工作区中被检索、汇总并回链。

来源:OpenAI

📰 独立报道

AGI、Agent 与产品

Google 让 Gemini 按需抽取视频片段,最高减少 88% token

Gemini 不再等距扫描整段视频,而是联合推理转录、音频与画面,并动态调整帧率提取所需时刻;Google 称长视频分析最高可少用 88% token。该能力正通过 API 推向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,Gemini App 将随后上线。

来源:Google DeepMind

Meta 发布覆盖 70 多种语言的实时流式语音转录模型

Meta AI Research 发布 Muse Voice Transcribe,这是 MSL 首个实时音频感知模型,支持流式自动语音识别并覆盖 70 多种语言。正式材料尚未给出跨语言错误率、延迟或硬件条件,实际部署价值仍取决于弱网、口音和多人重叠语音下的结果。

来源:Meta AI Research(Techmeme 索引)

Codex 桌面运行时内置 LibreOffice、Python、Node.js 与 Poppler

Simon Willison 检查本地缓存发现,Codex 主运行时约 1.7GB,包含完整 Python、Node.js,以及 Poppler、git 和 LibreOffice 原生二进制;文档技能会调用这些工具。桌面 Agent 因而获得可重复的本地文档处理环境,同时也扩大了安装体积、依赖更新与沙箱治理范围。

来源:Simon Willison

Anthropic 将 Claude Fable 5.1 的 Agent 任务成本最多降低 45%

Anthropic 发布 Fable 5.1 与 Mythos 5.1,称 Fable 5.1 通常比上一代便宜约 25%,复杂 Agent 任务最多便宜 45%,同时减少安全机制的误拦截。输入材料未提供可复核的任务集、token 用量与质量—成本曲线,企业选型仍需在自身工具链上重测。

来源:The Verge · TechCrunch

安全与工程

CrowdStrike 与英伟达用攻防 Agent 自动生成检测规则

SafeMind 让攻击 Agent 生成受控攻击、把遥测转为检测规则,再用新攻击路径复测。系统以 Nemotron 3 Ultra 编排、微调版 Nemotron 3 Super 编写和修复规则;三条通过质量门的规则捕获了八种未参与生成的新攻击,原始攻击的平均回测检出率由 16.5% 升至 41.9%。

来源:NVIDIA AI

PyTorch 展示 Primus Tuning Agent 预估千卡训练配置性能

AMD 的 Primus Tuning Agent 先用快速硬件基准预测不同分布式配置的运行速度,再为 6710 亿参数、千张 GPU 训练寻找较优组合,目标是替代逐项实跑并节省数千 GPU 小时。正式材料尚未披露预测误差、搜索空间和最终吞吐提升。

来源:PyTorch

AIR 持续发现企业 Agent,并审查其技能与插件行为

AIR 的平台面向企业内部 Agent 资产盘点,可发现正在运行的 Agent,持续检查它们调用的技能和扩展,并阻断不期望行为。产品把安全边界从模型输入输出扩展到可执行插件供应链;公司同时完成 5000 万美元融资,但本次入选依据是其新增治理工作流。

来源:TechCrunch

资管金融

印度支付机构为 AI Agent 使用 UPI 准备规则

印度国家支付公司正为 Agent 发起 UPI 操作准备规则。输入材料未披露授权、限额、撤销和责任分配细节,但底层网络 8 月处理 245.1 亿笔交易、金额 29.8 万亿卢比;若 Agent 获准接入,身份确认与逐笔授权方式将直接决定风险边界。

来源:Tech in Asia

央行开始讨论 AI 交易系统对政策沟通的反向作用

普林斯顿经济学家 Markus Brunnermeier 在杰克逊霍尔提出,AI 交易系统可更快解析央行反应函数并提前交易,甚至迫使央行减少可预测表达或分别面向人和机器沟通。关键风险不是单个模型预测更准,而是同质 Agent 同时调仓后改变市场条件与政策选择。

来源:Lingowhale 专题

CFA Institute 把投资 Agent 的难点落到碎片数据、压力测试与治理

CFA Institute 圆桌讨论了投资工作流中构建 Agent、处理不完整且碎片化的金融数据、用合成数据做情景分析和组合压力测试,以及用开源数据训练小模型。讨论把透明度、偏差和组织问责与模型能力并列,强调决策流程仍需可追溯控制。

来源:CFA Institute 视频

硬件与算力

三星规划 HBM5 采用 2nm 基础芯片,zHBM 改为存储堆叠在处理器上方

三星称 HBM5 目标性能为 HBM4E 的两倍、单瓦性能提升 20%、热阻降低 20%,并准备 12/16/20 层堆叠,预计 2028 年前后量产。更长期的 zHBM 计划把存储直接堆叠在处理器顶部,目标性能为 HBM4E 的八倍、单瓦性能三倍,预计 2029 年后推出。

来源:华尔街见闻

Tenstorrent 把 MoE 模型完整放入 SRAM,实现每秒 400 token

Ankura 在售价约 1.2 万美元的 Tenstorrent QuietBox 上,把 MoE 模型整体放进 SRAM,报告推理速度达到每秒 400 token。该结果把瓶颈直接指向权重搬运而非算术吞吐;正式材料尚未给出模型名称、精度、批量和输入输出长度,跨平台比较需等待完整条件。

来源:Tenstorrent

Lightmatter 用光子 scale-up fabric 降低不同上下文长度的推理延迟

Lightmatter 称其 2026 年 IEEE HOTI 最佳论文展示了光子 scale-up fabric 如何突破铜互连的距离与带宽限制,并在短、中、长上下文推理负载下降低延迟。正式材料未给出具体拓扑、系统规模和延迟降幅,工程价值仍需结合论文演示核验。

来源:Lightmatter

戴尔 AI 服务器季度订单达 609 亿美元,积压订单升至 950 亿美元

戴尔第二财季 AI 优化服务器营收 164 亿美元、同比翻倍,季度订单创 609 亿美元纪录,期末积压订单 950 亿美元;公司把全年 AI 服务器销售预期提至约 740 亿美元。需求同步拉动网络、存储与传统 CPU 服务器,显示 Agent 负载并未消除通用基础设施需求。

来源:华尔街见闻