🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-07-20

腾讯混元开源可免训外推至 4M 上下文的 HiLS-Attention,黎曼动力用 23.2 万小时多源视频把 RoboCasa-365 成功率推至 62.6%,HSCodeComp 显示最强深度检索 Agent 的海关编码准确率仅 49.4%

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-07-20 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

腾讯混元开源 HiLS-Attention,8K 训练可免训外推至 4M

腾讯混元团队开源分层地标稀疏注意力 HiLS-Attention。该方法跳过简单的均值或最大值估计,用泰勒展开构造带熵偏置的分块摘要,再通过分层 Softmax 让块选择可以跟随语言建模损失端到端训练。

团队在 345M 至 7B 参数模型上做了系统验证:8K 训练条件下可免训外推到 4M 上下文;在 512K 上下文中,prefill 和单步 decode 分别加速 13.5 倍和 15.7 倍。论文与代码已公开,为外部复现提供了入口。

来源:机器之心


Riemann-1.0 用 23.2 万小时多源视频刷新 RoboCasa-365

黎曼动力发布面向通用机器人操作的世界动作模型 Riemann-1.0。模型的 23.2 万小时训练数据包含 20 万小时以上人类第一视角视频、1.2 万小时 UMI 与外骨骼手套数据,以及 2 万小时机器人真机和仿真轨迹,覆盖 41 种机器人本体。

为了把无动作标签的人类视频转为可训练材料,团队用 VLM 切分动作,再重建手部姿态和世界坐标轨迹。模型在 RoboCasa-365 取得 62.6% 成功率,比此前最佳结果高 8.4 个百分点。

来源:BAAI 智源


HSCodeComp:最强深度检索 Agent 海关编码准确率 49.4%

阿里巴巴 ATH-MaaS 团队发布 HSCodeComp,这是面向专家级层级规则应用的深度检索 Agent 基准,获得 ACL 2026 最佳资源论文奖。基准要求 Agent 结合商品图像、属性、官方税则与历史裁定,逐层推导唯一的 10 位海关编码。

评测中,表现最好的系统准确率约为 49.4%,而从业十年的人类专家可达 95%。上层规则一旦判错,后续编码会级联失败;增加推理步数或让模型自我反思,也没有显著缩小差距。

来源:机器之心


无问芯穹 PDD 架构把跨集群首 Token 延迟降低 51.5%

无问芯穹在 WAIC 首发跨集群异构 PD 分离架构 PDD。它把推理拆成预填充、接力解码和主解码三段,用 Token ID 重算替代大体积 KV Cache 的跨广域网传输,再通过延迟掩盖把分散集群接入同一推理管线。

专访材料给出的测试结果是,PDD 将首 Token 延迟降低 51.5%。这一设计面向异地、异构算力之间的网络带宽与状态传输约束,超出了单集群内 PD 分离的范围。

来源:AI提效手册


Richard Sutton 披露 Oak Lab 的 20 瓦万亿参数模型目标

强化学习奠基人 Richard Sutton 在 WAIC 期间接受群访,首次具体说明新公司 Oak Lab 的工程目标:建造可以约 20 瓦功耗运行的万亿参数模型。他将现有大模型定位为对人类已有知识的高度压缩,主张系统应更多从环境互动和经验中持续学习。

Sutton 还对“将 AI 强行对齐到特定人类价值”表达了反对。这部分是他的判断,与 20 瓦目标一样,都需要等待 Oak Lab 公布架构、模型和测量方法后才能验证。

来源:机器之心-公众号


📰 独立报道

🤖 AGI 前沿

上海科学智能研究院开放 11B 多模态科学基础模型“神珍”

上海科学智能研究院发布并开放总参数 110 亿的“神珍”。模型以 Qwen3-VL-8B 为共享主干,为 DNA、RNA、蛋白质、小分子、地球系统和医学影像分别配置编解码器,在统一表征空间内保留结构化科学信息,并能输出 RNA 序列、SMILES、气象场和医学影像分割结果。

来源:机器之心


IQA-T1 用 15 种视觉工具校正图像质量评估的语义偏差

西北工业大学与香港科技大学团队提出 IQA-T1 框架,让多模态大模型调用噪声残差图、频谱图等 15 种专业分析工具,把底层图像退化转成可视证据后再打分。方法使用两阶段训练和强化学习优化工具选择,团队还发布了包含 1.1 万条推理链的数据集。

来源:量子位-公众号


MiniCPM-Robot 开源 1.5B 端侧 VLA 操作模型

面壁智能发布并开源 MiniCPM-Robot 系列,包含 1.5B 参数的 RobotManip 操作模型和 0.9B 参数的 RobotTrack 跟踪模型。RobotManip 的单次决策延迟为 120 毫秒;RobotTrack 面向断网或弱网环境的本地目标跟踪。同时开放的 PhyAI 框架用于缩短模型对不同机器人硬件的适配流程。

来源:量子位-公众号


Datadog 用 Agent 自相矛盾的结果定位决策灰区

Datadog 技术负责人 Diane Lin 介绍了安全 Agent 的一套持续校正流程:对同一任务反复运行,将冲突结果视为决策边界不清的信号,再把人工复核集中到这些样本。系统将域知识与业务规则写入语义记忆,将过去的相似案例写入情节记忆,用两者替代对所有问题频繁微调。

来源:YouTube · AI Engineer


Microsoft 团队用状态机接管语音 Agent 的流程控制

Ornella Bahidika 和 Joel Allou 介绍了生产环境中的语音导师 Ace。课程流程被拆成介绍、教学、检查、评分、推进和收尾等状态;每个状态只向模型交付窄化合约,由外部 harness 校验返回值、切换状态并决定是否结束。模型提前宣布完成或跳步时,harness 会按真实完成信号驳回。

来源:YouTube · AI Engineer


DataChain 将物理数据 Agent 的状态从上下文转到数据集

DataChain 联合创始人 Dmitry Petrov 演示了 Agent 如何处理 S3 中的大规模视频、日志和传感器数据。这类任务的首次感知处理可能需要数小时至数天并花费数千美元,重跑验证不再是廉价操作。他给出的方案是默认物化中间结果,使后续问题从已发现的数据集中召回,而不是重新运行感知模型。

来源:YouTube · AI Engineer


Linus Torvalds:AI 找到了更多内核缺陷,也带来幻觉报告与补丁审查压力

Linus Torvalds 在开源技术会议对谈中表示,大模型已经能帮助发现少有人审查的代码角落,这也让 Linux 的后期修复量增加。但 AI 生成的错误报告、幻觉内容和只修表面问题的补丁会消耗维护者时间,目前不能替代架构判断和长期维护经验。他还表示,Linux 仍保持约 9至10 周的版本节奏。

来源:AI前线


Hugging Face 披露自主 AI 攻击系统入侵生产基础设施

Hugging Face 披露,攻击者滥用数据集远程代码加载器和数据集配置模板注入两条代码执行路径,随后获得节点级访问、收集云与集群凭据,并横向移动到多个内部集群。调查涉及超过 1.7 万条攻击者动作。少量内部数据集和服务凭据受影响,但未发现公开模型、数据集、Spaces 或软件供应链被篡改的证据。

事件响应中,商业前沿模型 API 因安全护栏拒绝处理真实攻击命令、利用载荷和 C2 工件。Hugging Face 转而在自有基础设施上使用 GLM 5.2 分析日志,将原本需要数天的时间线重建压缩到数小时。

来源:AI前线


OpenAI 将于 8 月 9 日停运 Atlas 浏览器

OpenAI 官方文档显示,Atlas 将于 2026 年 8 月 9 日停止运行。书签、已打开标签页和浏览历史不会自动迁移,用户需提前导出需要保留的数据。Atlas 于 2025 年 10 月上线,运行不到一年。OpenAI 表示会将基于浏览器的智能体能力引入 ChatGPT 和 Codex,而不再维护独立浏览器入口。

来源:硅星人Pro


⛓️ 区块链创新

Robinhood Chain 采用 Arbitrum 技术与 ETH Gas,代币化股票不附带投票权

Robinhood 于 2026 年 7 月上线 Robinhood Chain,这是基于 Arbitrum 技术、兼容 EVM 的以太坊 Layer 2 网络,并使用 ETH 支付 Gas。其股票代币的法律形式是债务证券,持有者不获得底层股票的投票权。早期交易量主要由 Meme 币推动,RWA 交易仍处在起步阶段。

来源:吴说Real-公众号


🎓 学术前沿

JustGRPO 在强化学习阶段改用自回归顺序训练扩散语言模型

清华大学团队的 ICML 2026 杰出论文分析了扩散语言模型的“灵活性陷阱”:任意顺序解码可能绕过关键字符,收窄后续推理路径。团队提出 JustGRPO,在强化学习阶段切换到自回归生成顺序,让优化目标约束推理过程;推理时再恢复扩散模型的并行解码。

来源:智源社区-公众号


GeoRA 用几何约束的低秩适配处理 RLVR 谱坍缩

美团与北京大学团队提出 GeoRA 几何感知低秩适配框架,该工作获得 ACL 2026 杰出论文奖。研究将现有低秩方法在可验证奖励强化学习中的不稳定归因于谱坍缩,并通过约束子空间的 SVD 分解提取主要优化方向。来源材料报告,GeoRA 在数学、代码和跨领域任务中取得当时最佳结果。

来源:智源社区-公众号


HalluWorld 把大模型幻觉定义为参考世界的建模冲突

CMU、斯坦福等机构的研究者将大模型幻觉统一表述为“相对于参考世界的不准确世界建模”,并引入参考世界、视图函数、冲突策略和真值函数四个组件。与框架同时发布的 HalluWorld 覆盖网格世界、国际象棋和终端任务。实验中,增加推理预算在部分任务上反而提高了幻觉率。

来源:AI提效手册


RoboDojo 实机评测中的最强机器人策略成功率仅 12.8%

多校研究团队发布统一机器人评估基准 RoboDojo,同时覆盖仿真和真实场景,测量泛化、长程执行等 5 类操作能力。测试结果显示,领先模型在仿真环境的平均成功率不足 9%,最强策略在真实部署中成功率为 12.8%。实机评测还记录了动作抖动和安全风险等仿真外失败。

来源:学术头条-公众号


ALADYNOULLI 用 68 万人纵向病历联合建模 348 种疾病

研究人员提出贝叶斯生成框架 ALADYNOULLI,将纵向电子健康记录、年龄与 36 种多基因风险评分放入同一概率模型。研究在 UK Biobank、Mass General Brigham Biobank 和 All of Us 三个队列中验证,总样本超过 68 万人,最长随访 52 年,覆盖 348 种疾病。模型稳定识别 21 类潜在疾病特征,并报告 151 个全基因组显著位点。

来源:BAAI 智源


CMU 用人机联合学习与触觉反馈提高无创脑机接口光标控制

卡内基梅隆大学贺斌团队设计了人机双向适应框架,算法随用户脑电信号变化多轮迭代,用户则通过手腕振动马达获得触觉反馈。来源材料报告,一维和二维光标控制准确率分别达到 86% 和 77.5%,新手完成 3 轮训练后即可使用。

来源:DeepTech深科技-公众号


🔧 硬件算力与智能设备

NEO 植入式脑机接口完成首例商业化植入

复旦大学附属华山医院于 7 月 13 日将 NEO-ONE SCI 植入式脑机接口手部运动功能代偿系统用于一名颈段脊髓损伤患者。系统通过硬膜外电极采集运动意图,再驱动外部气动手套完成抓握。上海相关部门称,这是全球首款获批上市的植入式脑机接口医疗器械的首例商业化植入。

注册临床研究纳入 32 名受试者:术后 3 个月,设备辅助状态下的 ARAT 抓握响应率为 100%;徒手单侧 ARAT 评分较基线提高至少 6 分的受试者,3 个月和 6 个月占比分别为 62.5% 和 68.8%。试验未报告与器械相关的不良事件和严重不良事件。目前获批功能是手部抓握代偿与康复,不等于治愈瘫痪。

来源:钛媒体


图文卡片 ⬇️ 一键下载图文卡片