🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-07-20

Riemann-1.0发布材料披露23.2万小时多源数据及RoboCasa365 62.6%成功率

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

Riemann-1.0发布材料披露23.2万小时多源数据及RoboCasa365 62.6%成功率

2026/07/20

BAAI智源7月20日报道,Riemann-1.0使用的训练材料共23.2万小时,其中包括20万小时以上人类第一视角视频、1.2万小时UMI与外骨骼手套数据,以及2万小时机器人真机和仿真轨迹;发布材料称这些数据覆盖41种机器人本体。团队先用视觉语言模型切分没有动作标签的人类视频,再重建手部姿态和世界坐标轨迹,把人的操作过程转成可训练材料。[S1]

同一报道记录称,Riemann-1.0在RoboCasa365上的成功率为62.6%,比发布方所称的此前最佳结果高8.4个百分点。这些数字均来自发布材料的转述;目前没有可核验的官方技术报告、代码仓库或外部实验室复现,也没有41种本体各自的真机成功率、适配时长和安全结果。今天新增的是多源数据规模与固定仿真榜单结果,尚不是跨本体真机可靠性的证明。[S1]

近季度,通用操作模型的证据正在从“同构示教加一个固定任务总分”走向分层验证:数据规模、动作表示、本体适配、基准效度、物理执行和安全分别回答不同问题。今天的发布修正了“数据已不再重要”的说法,也限制了“高分已经证明通用性”的外推。

多源数据扩大了动作经验,榜单增益仍停留在各自实验体系内

3月发布的RoboCasa365以365个日常任务、2500个厨房环境、600多小时人类示范和1600多小时合成示范建立仿真训练与评测基线。到7月,训练输入已出现另一种来源结构:Riemann-1.0组合人类第一视角视频、UMI、真机与仿真轨迹;7月16日公开的Xiaomi-Robotics-1则使用10万小时UMI轨迹覆盖1700多个场景,并以跨本体数据和7200多小时真实家庭机器人数据后训练。[S1][S2][S7]

这些数据小时并非同一采集和评测口径,不能直接比较规模高低。它们共同改变的是数据入口:经验不再只来自目标机器人上的同构示教,人类视频和UMI开始承担更广场景与物体交互的预训练输入。轨迹重建、自动标注和后训练把状态变化转成动作监督,再映射到具体本体的运动学、相机和控制接口。Xiaomi项目页报告,在该团队的实验体系内,数据与模型规模上升时,验证动作误差下降、未见环境中的真机成功率上升。这是同体系关联,不能外推为跨实验室规律。[S2]

数据团队可能因此增加非机器人原生数据和自动标注管线的投入,部署方仍不能只按总小时数或“覆盖本体数”选模型。人类动作到机器人控制的映射误差、数据去重、长尾任务和本体后训练成本都要单独核验。多源经验已经进入大规模训练;现有证据不能确认Riemann-1.0的62.6%主要由视频时长造成,也不能把“覆盖41种本体”写成41种本体均已可靠运行。[S1][S2]

固定仿真榜单保留比较价值,通用能力外推开始受效度审计约束

RoboCasa365的62.6%首先是365项家庭操作仿真任务及其2500个厨房环境内的结果。这个边界不削弱榜内进展,却决定了数字能回答什么:它可以比较同一协议中的策略表现,不能自动代表未见本体、真实接触和长期运行。[S1][S7]

6月2日发布的基准审计研究,把捷径可解、统计显著性不足、榜单过拟合和数据源依赖列为四类诊断,并检查了LIBERO、CALVIN、SimplerEnv、RoboCasa与RoboTwin 2.0;论文称LIBERO和CALVIN在多个诊断上失败。固定分布可能奖励训练数据匹配或特定捷径。任务变化、数据来源和统计不确定性受到控制后,分数才有更强的外部有效性。[S4]

这改变了研究者、平台和采购方的阅读顺序:先确认任务划分、训练数据重叠和置信区间,再判断榜单能否支持部署决策。审计论文没有检查RoboCasa365,也没有检查Riemann-1.0,因而不能拿来否定62.6%;它提供的是外推边界。基准效度成为独立验证位置后,一个更高的总分仍是必要证据,但不再独自承担“通用操作能力”的结论。[S1][S4][S7]

评测接入多本体真机闭环,仿真与真机仍不能合成一条性能曲线

4月的RoboWM-Bench把视频世界模型生成的行为转成动作序列并交给机器人执行,发现空间推理错误、接触预测不稳和非物理形变会阻断任务;在操作数据上微调后,物理不一致仍然存在。5月的WorldArena 2.0把评测从纯视觉扩到视觉与触觉,从离线策略评估扩到交互式强化学习环境,并接入多种仿真与真实机器人平台。[S5][S6]

7月5日发布的RoboDojo进一步提供42个仿真任务、18个真机任务和ARX X5、Piper、Piper X三个本体,统一硬件、重置、协议与接口。其论文报告的真机榜单最佳策略总体成功率为12.8%,但论文同时说明仿真任务与真机任务并非一一对应。12.8%只能在RoboDojo协议内解释,与RoboCasa365的62.6%在任务、硬件、训练数据和评测条件上都不同,两者不存在可计算的“仿真到真机跌幅”。[S3]

两类设施传递不同信息:仿真可以高吞吐地定位记忆、精度和长程任务缺口,标准化真机则引入接触、传感噪声、执行误差和环境变化。共享接口降低重复接入成本,却不会替模型完成本体对齐。发布方若主张跨本体通用性,需要在目标本体和独立真机协议上另交结果;评测方必须说明任务是否对齐。这些研究显示验证位置正在向物理闭环移动,尚未建立同一策略、任务和硬件下可量化的仿真与真机预测关系。[S3][S5][S6]

动作稳定和安全把部署门槛推到任务成功率之外

RoboDojo的标准化真机评测记录了动作抖动、接触不稳、重复无效动作和偶发的安全关键行为。RoboWM-Bench显示,即使生成行为在视觉上连贯,空间、接触和非物理形变问题仍可能使机器人无法执行。两项研究把总成功率拆开后,暴露的是同一传导缺口:高层任务目标落到连续控制时,误差会在接触与多步骤切换中累积,部分进展未必能转成完整任务,还可能形成硬件或人身风险。[S3][S6]

这使部署方需要在任务完成率之外检查动作稳定、接触质量、安全干预和偏轨恢复;公开视频、子步骤评分与安全终止记录也能把失败位置反馈给控制和训练。训练方据此可以补充接触感知与纠错信号,但现有论文只证明这些失败存在,没有证明加入反馈后能让新模型持续降低风险。Riemann-1.0的发布材料也没有同口径的动作稳定或安全结果,所以今天的新闻只更新了数据与榜单两层,没有更新真实闭环与部署安全两层。[S1][S3][S6]

数据与评测位置已经变化,独立真机复现仍是滞后环节

3月至7月,数据供给已从同构示教扩展到人类视频、UMI、跨本体真机和仿真混合;基准效度开始被独立审计;评测设施开始覆盖交互式环境、多本体真机、物理可执行性和安全失败。滞后的是Riemann-1.0的技术报告、代码与跨实验室复现,未见本体上的适配成本和安全结果,以及同一任务、硬件和策略下的仿真与真机预测关系。[S1][S2][S3][S4][S5][S6][S7]

因此,今天的Riemann-1.0结果对阶段判断的作用是修正:它确认数据扩张仍能产生固定榜单内的进展,却没有把这些进展直接传到跨本体执行和安全可靠。到2026年10月20日,如果公开、统一的任务、硬件、训练数据和评测协议能够让固定仿真排名稳定预测多个本体的真机完成率、动作稳定性与安全结果,并由独立实验室复现,“各层必须分别验证、单一榜单不足以代理通用能力”的判断将被明显削弱。反之,若RoboDojo或WorldArena 2.0同模型的仿真、真机与安全排名持续分化,分层证据仍不可互相替代。[S1][S3][S5]

参考资料

图文卡片 ⬇️ 一键下载图文卡片