前沿科技日报 · 2026-07-20
腾讯混元开源可免训外推至 4M 上下文的 HiLS-Attention,黎曼动力用 23.2 万小时多源视频把 RoboCasa-365 成功率推至 62.6%,HSCodeComp 显示最强深度检索 Agent 的海关编码准确率仅 49.4%
2026-07-20 前沿科技洞见 · 日报
📊 今日关键数据
- 512 倍:HiLS-Attention 在 8K 训练条件下展示从 8K 到 4M 的免训长度外推,512K 上下文的单步解码加速 15.7 倍(来源:机器之心)
- 62.6%:Riemann-1.0 在 RoboCasa-365 取得 62.6% 成功率,比此前最佳结果高 8.4 个百分点(来源:BAAI 智源)
- 49.4% 对 95%:HSCodeComp 中表现最好的深度检索 Agent 海关编码准确率为 49.4%,十年经验人类专家为 95%(来源:机器之心)
- 51.5%:无问芯穹 PDD 跨集群异构 PD 分离架构在测试中将首 Token 延迟降低 51.5%(来源:AI提效手册)
- 68 万人、52 年:ALADYNOULLI 在 3 个队列中联合建模 348 种疾病,样本超过 68 万人,最长随访 52 年(来源:BAAI 智源)
- 32 人、100%:NEO-ONE SCI 注册临床研究纳入 32 人,术后 3 个月设备辅助状态下 ARAT 抓握响应率为 100%(来源:钛媒体)
🔍 今日值得深读
腾讯混元开源 HiLS-Attention,8K 训练可免训外推至 4M
腾讯混元团队开源分层地标稀疏注意力 HiLS-Attention。该方法跳过简单的均值或最大值估计,用泰勒展开构造带熵偏置的分块摘要,再通过分层 Softmax 让块选择可以跟随语言建模损失端到端训练。
团队在 345M 至 7B 参数模型上做了系统验证:8K 训练条件下可免训外推到 4M 上下文;在 512K 上下文中,prefill 和单步 decode 分别加速 13.5 倍和 15.7 倍。论文与代码已公开,为外部复现提供了入口。
- 关键事实:HiLS-Attention 在 8K 训练下展示了 512 倍免训长度外推,512K 上下文的单步解码加速 15.7 倍。
- 为什么值得深读:它同时处理了稀疏注意力中的块重要性估计和离散选择不可导问题,两者直接决定长上下文的效果与成本。
- 后续看点:开源代码在 7B 参数、不同硬件和非检索型长程任务中能否复现 4M 外推与加速结果。
来源:机器之心
Riemann-1.0 用 23.2 万小时多源视频刷新 RoboCasa-365
黎曼动力发布面向通用机器人操作的世界动作模型 Riemann-1.0。模型的 23.2 万小时训练数据包含 20 万小时以上人类第一视角视频、1.2 万小时 UMI 与外骨骼手套数据,以及 2 万小时机器人真机和仿真轨迹,覆盖 41 种机器人本体。
为了把无动作标签的人类视频转为可训练材料,团队用 VLM 切分动作,再重建手部姿态和世界坐标轨迹。模型在 RoboCasa-365 取得 62.6% 成功率,比此前最佳结果高 8.4 个百分点。
- 关键事实:Riemann-1.0 用 23.2 万小时多源数据训练,RoboCasa-365 成功率达 62.6%。
- 为什么值得深读:该工作给出了从无标签人类视频到机器人动作对齐的完整工程链路,正面处理真机数据稀缺和跨本体适配问题。
- 后续看点:外部团队能否复现 62.6% 成功率,以及 41 种本体的适配能否在未见环境和长程任务中保持稳定。
来源:BAAI 智源
HSCodeComp:最强深度检索 Agent 海关编码准确率 49.4%
阿里巴巴 ATH-MaaS 团队发布 HSCodeComp,这是面向专家级层级规则应用的深度检索 Agent 基准,获得 ACL 2026 最佳资源论文奖。基准要求 Agent 结合商品图像、属性、官方税则与历史裁定,逐层推导唯一的 10 位海关编码。
评测中,表现最好的系统准确率约为 49.4%,而从业十年的人类专家可达 95%。上层规则一旦判错,后续编码会级联失败;增加推理步数或让模型自我反思,也没有显著缩小差距。
- 关键事实:HSCodeComp 中最强 Agent 的准确率为 49.4%,人类专家为 95%。
- 为什么值得深读:基准把评测对象从通用检索问答换成了真实合规流程,能看到 Agent 在层级规则、工具检索和回溯上的具体失败位置。
- 后续看点:开源数据集与代码能否在同一税则库、工具权限和 10 位分类规则下复现这一专家能力差距。
来源:机器之心
无问芯穹 PDD 架构把跨集群首 Token 延迟降低 51.5%
无问芯穹在 WAIC 首发跨集群异构 PD 分离架构 PDD。它把推理拆成预填充、接力解码和主解码三段,用 Token ID 重算替代大体积 KV Cache 的跨广域网传输,再通过延迟掩盖把分散集群接入同一推理管线。
专访材料给出的测试结果是,PDD 将首 Token 延迟降低 51.5%。这一设计面向异地、异构算力之间的网络带宽与状态传输约束,超出了单集群内 PD 分离的范围。
- 关键事实:PDD 采用三段式推理和 Token ID 重算,测试中首 Token 延迟下降 51.5%。
- 为什么值得深读:它把 PD 分离从单一数据中心扩展到广域网和异构芯片,直接处理分散算力难以组成稳定推理服务的带宽瓶颈。
- 后续看点:不同城市、不同芯片与不同并发负载下,51.5% 的延迟改善能否复现,Token 重算又会带来多少额外算力开销。
来源:AI提效手册
Richard Sutton 披露 Oak Lab 的 20 瓦万亿参数模型目标
强化学习奠基人 Richard Sutton 在 WAIC 期间接受群访,首次具体说明新公司 Oak Lab 的工程目标:建造可以约 20 瓦功耗运行的万亿参数模型。他将现有大模型定位为对人类已有知识的高度压缩,主张系统应更多从环境互动和经验中持续学习。
Sutton 还对“将 AI 强行对齐到特定人类价值”表达了反对。这部分是他的判断,与 20 瓦目标一样,都需要等待 Oak Lab 公布架构、模型和测量方法后才能验证。
- 关键事实:Sutton 表示 Oak Lab 的目标是让万亿参数模型以约 20 瓦功耗运行。
- 为什么值得深读:这次群访提供了新公司的可核查能效目标,也把其技术路线与静态人类数据驱动的训练方式明确区分开。
- 后续看点:Oak Lab 何时公布模型架构、参数定义、硬件环境和 20 瓦功耗的测量边界。
来源:机器之心-公众号
📰 独立报道
🤖 AGI 前沿
上海科学智能研究院开放 11B 多模态科学基础模型“神珍”
上海科学智能研究院发布并开放总参数 110 亿的“神珍”。模型以 Qwen3-VL-8B 为共享主干,为 DNA、RNA、蛋白质、小分子、地球系统和医学影像分别配置编解码器,在统一表征空间内保留结构化科学信息,并能输出 RNA 序列、SMILES、气象场和医学影像分割结果。
- 关键事实:“神珍”覆盖 6 类科学数据,采用模态专属编解码器处理输入和结构化输出。
- 后续看点:开放权重、代码和评测集能否支持外部团队在 6 种模态上复现跨模态推理结果。
来源:机器之心
IQA-T1 用 15 种视觉工具校正图像质量评估的语义偏差
西北工业大学与香港科技大学团队提出 IQA-T1 框架,让多模态大模型调用噪声残差图、频谱图等 15 种专业分析工具,把底层图像退化转成可视证据后再打分。方法使用两阶段训练和强化学习优化工具选择,团队还发布了包含 1.1 万条推理链的数据集。
- 关键事实:IQA-T1 配置 15 种视觉证据工具,并公布 1.1 万条高质量证据推理链。
- 后续看点:工具库、训练集和强化学习策略公开后,在不同退化类型和模型基座上能否稳定复现评估改善。
来源:量子位-公众号
MiniCPM-Robot 开源 1.5B 端侧 VLA 操作模型
面壁智能发布并开源 MiniCPM-Robot 系列,包含 1.5B 参数的 RobotManip 操作模型和 0.9B 参数的 RobotTrack 跟踪模型。RobotManip 的单次决策延迟为 120 毫秒;RobotTrack 面向断网或弱网环境的本地目标跟踪。同时开放的 PhyAI 框架用于缩短模型对不同机器人硬件的适配流程。
- 关键事实:MiniCPM-Robot 包含 1.5B 操作模型和 0.9B 跟踪模型,RobotManip 单次决策延迟 120 毫秒。
- 后续看点:120 毫秒延迟的硬件环境、功耗和任务条件是否公开,PhyAI 在不同本体上的迁移成功率如何。
来源:量子位-公众号
Datadog 用 Agent 自相矛盾的结果定位决策灰区
Datadog 技术负责人 Diane Lin 介绍了安全 Agent 的一套持续校正流程:对同一任务反复运行,将冲突结果视为决策边界不清的信号,再把人工复核集中到这些样本。系统将域知识与业务规则写入语义记忆,将过去的相似案例写入情节记忆,用两者替代对所有问题频繁微调。
- 关键事实:该流程把模型分歧用作主动学习的样本选择信号,并联合语义记忆与情节记忆减少决策摇摆。
- 后续看点:Datadog 能否公布安全场景中的冲突率、人工复核量和上线后的误报、漏报变化。
Microsoft 团队用状态机接管语音 Agent 的流程控制
Ornella Bahidika 和 Joel Allou 介绍了生产环境中的语音导师 Ace。课程流程被拆成介绍、教学、检查、评分、推进和收尾等状态;每个状态只向模型交付窄化合约,由外部 harness 校验返回值、切换状态并决定是否结束。模型提前宣布完成或跳步时,harness 会按真实完成信号驳回。
- 关键事实:Ace 不让大模型决定课程结束、评分或下一步,这些状态都由确定性 harness 管理。
- 后续看点:该设计在用户打断、工具超时、长会话和并发状态修改下的任务完成率与失败恢复时间。
DataChain 将物理数据 Agent 的状态从上下文转到数据集
DataChain 联合创始人 Dmitry Petrov 演示了 Agent 如何处理 S3 中的大规模视频、日志和传感器数据。这类任务的首次感知处理可能需要数小时至数天并花费数千美元,重跑验证不再是廉价操作。他给出的方案是默认物化中间结果,使后续问题从已发现的数据集中召回,而不是重新运行感知模型。
- 关键事实:该方案将物化结果和召回设为默认,数据集而非上下文窗口成为持久状态单元。
- 后续看点:演示中“数秒和数美分”的召回成本,在数据更新、索引失效和多模态校验下能否保持。
Linus Torvalds:AI 找到了更多内核缺陷,也带来幻觉报告与补丁审查压力
Linus Torvalds 在开源技术会议对谈中表示,大模型已经能帮助发现少有人审查的代码角落,这也让 Linux 的后期修复量增加。但 AI 生成的错误报告、幻觉内容和只修表面问题的补丁会消耗维护者时间,目前不能替代架构判断和长期维护经验。他还表示,Linux 仍保持约 9至10 周的版本节奏。
- 关键事实:Linus 确认 AI 发现的缺陷正进入 Linux 修复流程,但 AI 输出不能直接作为可合并代码。
- 后续看点:Linux 社区是否会为 AI 生成的缺陷报告和补丁增加单独的验证、标记或限流规则。
来源:AI前线
Hugging Face 披露自主 AI 攻击系统入侵生产基础设施
Hugging Face 披露,攻击者滥用数据集远程代码加载器和数据集配置模板注入两条代码执行路径,随后获得节点级访问、收集云与集群凭据,并横向移动到多个内部集群。调查涉及超过 1.7 万条攻击者动作。少量内部数据集和服务凭据受影响,但未发现公开模型、数据集、Spaces 或软件供应链被篡改的证据。
事件响应中,商业前沿模型 API 因安全护栏拒绝处理真实攻击命令、利用载荷和 C2 工件。Hugging Face 转而在自有基础设施上使用 GLM 5.2 分析日志,将原本需要数天的时间线重建压缩到数小时。
- 关键事实:入侵经由两条代码执行路径开始,调查重建了超过 1.7 万条攻击动作。
- 后续看点:Hugging Face 对合作伙伴和客户数据的最终评估,以及两条代码执行路径的修复与凭据轮换结果。
来源:AI前线
OpenAI 将于 8 月 9 日停运 Atlas 浏览器
OpenAI 官方文档显示,Atlas 将于 2026 年 8 月 9 日停止运行。书签、已打开标签页和浏览历史不会自动迁移,用户需提前导出需要保留的数据。Atlas 于 2025 年 10 月上线,运行不到一年。OpenAI 表示会将基于浏览器的智能体能力引入 ChatGPT 和 Codex,而不再维护独立浏览器入口。
- 关键事实:Atlas 将于 8 月 9 日停运,用户浏览数据不会自动迁移。
- 后续看点:ChatGPT 和 Codex 何时承接 Atlas 的页面理解、跨站操作和登录状态调用能力。
来源:硅星人Pro
⛓️ 区块链创新
Robinhood Chain 采用 Arbitrum 技术与 ETH Gas,代币化股票不附带投票权
Robinhood 于 2026 年 7 月上线 Robinhood Chain,这是基于 Arbitrum 技术、兼容 EVM 的以太坊 Layer 2 网络,并使用 ETH 支付 Gas。其股票代币的法律形式是债务证券,持有者不获得底层股票的投票权。早期交易量主要由 Meme 币推动,RWA 交易仍处在起步阶段。
- 关键事实:Robinhood Chain 兼容 EVM、使用 ETH Gas,股票代币不给持有者底层证券投票权。
- 后续看点:RWA 交易量占比是否提高,以及代币化股票的债务权利、兑付和信息披露规则如何落地。
来源:吴说Real-公众号
🎓 学术前沿
JustGRPO 在强化学习阶段改用自回归顺序训练扩散语言模型
清华大学团队的 ICML 2026 杰出论文分析了扩散语言模型的“灵活性陷阱”:任意顺序解码可能绕过关键字符,收窄后续推理路径。团队提出 JustGRPO,在强化学习阶段切换到自回归生成顺序,让优化目标约束推理过程;推理时再恢复扩散模型的并行解码。
- 关键事实:JustGRPO 在 RL 微调期间采用自回归顺序,推理期间保留并行解码。
- 后续看点:代码公开后,该方法相对纯扩散训练和自回归基线的推理质量、延迟与吞吐量差异。
来源:智源社区-公众号
GeoRA 用几何约束的低秩适配处理 RLVR 谱坍缩
美团与北京大学团队提出 GeoRA 几何感知低秩适配框架,该工作获得 ACL 2026 杰出论文奖。研究将现有低秩方法在可验证奖励强化学习中的不稳定归因于谱坍缩,并通过约束子空间的 SVD 分解提取主要优化方向。来源材料报告,GeoRA 在数学、代码和跨领域任务中取得当时最佳结果。
- 关键事实:GeoRA 用约束子空间 SVD 分解修正 RLVR 低秩微调中的谱坍缩与训练不稳定。
- 后续看点:GeoRA 在不同模型规模、秩上限和长程 RLVR 训练中的稳定性与灾难性遗忘水平。
来源:智源社区-公众号
HalluWorld 把大模型幻觉定义为参考世界的建模冲突
CMU、斯坦福等机构的研究者将大模型幻觉统一表述为“相对于参考世界的不准确世界建模”,并引入参考世界、视图函数、冲突策略和真值函数四个组件。与框架同时发布的 HalluWorld 覆盖网格世界、国际象棋和终端任务。实验中,增加推理预算在部分任务上反而提高了幻觉率。
- 关键事实:HalluWorld 用 3 类环境测量世界建模冲突,并观察到更高推理预算不总能减少幻觉。
- 后续看点:外部复现能否确定“更多推理、更多幻觉”出现的任务类型、模型和冲突阈值。
来源:AI提效手册
RoboDojo 实机评测中的最强机器人策略成功率仅 12.8%
多校研究团队发布统一机器人评估基准 RoboDojo,同时覆盖仿真和真实场景,测量泛化、长程执行等 5 类操作能力。测试结果显示,领先模型在仿真环境的平均成功率不足 9%,最强策略在真实部署中成功率为 12.8%。实机评测还记录了动作抖动和安全风险等仿真外失败。
- 关键事实:RoboDojo 的最强实机策略成功率为 12.8%,仿真中领先模型平均成功率不足 9%。
- 后续看点:基准协议、任务设置和硬件参数开放后,实机 12.8% 的结果能否跨实验室重复。
来源:学术头条-公众号
ALADYNOULLI 用 68 万人纵向病历联合建模 348 种疾病
研究人员提出贝叶斯生成框架 ALADYNOULLI,将纵向电子健康记录、年龄与 36 种多基因风险评分放入同一概率模型。研究在 UK Biobank、Mass General Brigham Biobank 和 All of Us 三个队列中验证,总样本超过 68 万人,最长随访 52 年,覆盖 348 种疾病。模型稳定识别 21 类潜在疾病特征,并报告 151 个全基因组显著位点。
- 关键事实:ALADYNOULLI 联合建模 348 种疾病,在 3 个独立队列中覆盖超过 68 万人和最长 52 年随访。
- 后续看点:21 类潜在疾病特征在更多医疗系统、族群和编码体系中的稳定性,以及一年和十年风险预测的校准度。
来源:BAAI 智源
CMU 用人机联合学习与触觉反馈提高无创脑机接口光标控制
卡内基梅隆大学贺斌团队设计了人机双向适应框架,算法随用户脑电信号变化多轮迭代,用户则通过手腕振动马达获得触觉反馈。来源材料报告,一维和二维光标控制准确率分别达到 86% 和 77.5%,新手完成 3 轮训练后即可使用。
- 关键事实:双向适应框架下,一维和二维光标控制准确率为 86% 和 77.5%。
- 后续看点:更大样本、更长时间和跨会话测试中,触觉反馈带来的学习速度与控制准确率改善能否维持。
🔧 硬件算力与智能设备
NEO 植入式脑机接口完成首例商业化植入
复旦大学附属华山医院于 7 月 13 日将 NEO-ONE SCI 植入式脑机接口手部运动功能代偿系统用于一名颈段脊髓损伤患者。系统通过硬膜外电极采集运动意图,再驱动外部气动手套完成抓握。上海相关部门称,这是全球首款获批上市的植入式脑机接口医疗器械的首例商业化植入。
注册临床研究纳入 32 名受试者:术后 3 个月,设备辅助状态下的 ARAT 抓握响应率为 100%;徒手单侧 ARAT 评分较基线提高至少 6 分的受试者,3 个月和 6 个月占比分别为 62.5% 和 68.8%。试验未报告与器械相关的不良事件和严重不良事件。目前获批功能是手部抓握代偿与康复,不等于治愈瘫痪。
- 关键事实:32 人注册临床研究中,术后 3 个月的设备辅助 ARAT 抓握响应率为 100%。
- 后续看点:商业化患者的长期真实世界数据,以及植入、每日康复训练、算法个性化和支付流程能否在更多医院复制。
来源:钛媒体