NVIDIA 发布 4B Cosmos 3 Edge,并把统一世界模型家族扩展到端侧
NVIDIA 发布 4B Cosmos 3 Edge,并把统一世界模型家族扩展到端侧
2026/07/21
7 月 20 日,NVIDIA 正式开放 Cosmos 3 Edge。它是一个 4B 参数的 Mixture-of-Transformers 全模态世界模型,可处理文本、图像、视频、环境声音和动作相关的理解或生成任务,面向 Jetson、RTX PRO、DGX 与 GeForce RTX。NVIDIA 同时提供权重、推理代码和后训练资源,并把 Edge 与 16B Nano、64B Super 放入同一产品家族。Agile Robots、Doosan、Siemens、Skild AI、Centific、Vaidio 和 YUAN 被列为正在评估该模型的伙伴,当天材料没有给出客户生产环境中的任务成功率、连续运行时间、功耗或事故率。[S1][S2]
模型卡只把 BF16 列为正式测试精度。其初步端侧测量中,Reasoner 在 Jetson AGX Thor T5000 上处理文本、图像和视频提示的端到端延迟分别为 3.60、3.17 和 3.25 秒,在 Jetson AGX Orin 64GB 上则为 10.83、10.81 和 10.97 秒。另一组 Generator 测量采用默认 480p、图生视频 189 帧、单 GPU、batch 1 等条件;T5000 上 vLLM-Omni 的图生视频耗时 137.50 秒,PyTorch 为 153.00 秒,vLLM-Omni 的前向动力学和 DROID 策略分别为 6.05 秒与 6.32 秒,PyTorch 行没有报告后两项。模型卡还写明,长时或高分辨率输出可能出现时间不一致、动作—状态漂移和物理交互失真,输出不能被当作物理精确仿真、可靠事实推理或安全认证决策。[S2]
可核验的变化是:Cosmos 3 正在从只有工作站和数据中心档位、端侧依靠独立推理模型与运行时组件的交付状态,走向 4B Edge、16B Nano、64B Super 分层。具体连接从模型档位开始:4B Edge 降低相对 16B、64B 档位的模型占用,端侧运行时与 Jetson/Orin 提供执行环节,后训练和控制接口再把本地输出映射为本体动作。模型占用、执行效率和动作连续性沿这条路径传导;只要任务时延、动作—状态漂移或系统安全在任一环节形成约束,生产部署就会受阻。[S1][S2][S3][S4][S5][S6]
这个判断只适用于 NVIDIA Cosmos 交付栈。7 月 20 日确认的是端侧能力已经可获取、可测量、可适配,尚未证明真实机器人能够稳定自治。[S1][S2]
Cosmos 3 Edge 补上了统一世界模型家族的端侧档位
5 月 31 日发布 Cosmos 3 时,NVIDIA 已用双塔 MoT 架构统一此前分离的物理理解、世界生成和动作流程:自回归 Reasoner 负责推理,扩散 Generator 处理连续模态生成。公开档位当时只有面向工作站的 16B Nano 和面向数据中心的 64B Super,Edge 尚未交付。不到两个月后,4B Edge 从预告变成可下载模型,产品层从 Nano/Super 两档扩展到 Edge/Nano/Super 三档。[S1][S2][S3]
变化先落在交付单位上。统一架构维持推理与生成的分工,4B 档位降低单设备的内存和计算门槛,后训练路径再把通用能力适配到具体传感器和机器人本体。开发团队因此可以在同一模型家族内按端侧执行、工作站后训练或数据中心高质量生成选择资源层,不必把统一模型局限在工作站和数据中心。[S1][S2][S3]
范围扩大不代表能力等价。现有材料没有证明 4B 在所有任务上保持 Nano 或 Super 的能力,也没有客户生产数据。端侧档位已经成为正式交付物,瓶颈随之从“同族模型是否存在”转到任务频率、后训练效果和闭环验证;这些条件决定它能否成为生产系统的主模型。[S1][S2]
4B 只解决装入设备,实时性仍由任务和运行时共同决定
端侧执行层早于 Edge 模型出现。3 月 12 日,TensorRT Edge-LLM 已在 Jetson Thor 和 DRIVE AGX Thor 上增加对 MoE、Cosmos Reason 2 等模型的支持,目标是在功耗和时延约束下运行时空推理、定位与规划。7 月开放的 4B 权重把这条执行路径接到同族世界模型,Jetson、Orin 的板卡数据让开发者能够按硬件、输入和任务核对工作负载。端侧运行时是模型档位变成可测工作负载的依赖环节;没有这个执行层,权重可下载也不能直接转化为板卡上的任务性能。[S2][S4]
板卡表也显示,4B 不是一个通用的实时性答案。Reasoner 的单次端到端延迟以秒计,前向动力学和策略生成约为 6 秒,189 帧图生视频则超过两分钟;模态 token 数、扩散生成步数、动作块长度、运行时和并发都会改变结果。Xiaomi-Robotics-0 在 2 月采取了另一条路线:通过异步执行后训练、连续动作块前缀处理和部署时的时间步对齐,减少大模型推理造成的动作停顿,并在两项双臂实机任务上报告实时执行。参数规模影响模型占用,但这种影响要传导为连续动作,还受调度和时序设计约束。[S2][S6]
采用方的选择标准也随之改变。机器人控制、视觉分析和离线视频生成需要分别设定频率、吞吐和延迟门槛,模型榜单或“real-time”标签无法替代任务验收。现有端侧数字由 NVIDIA 在指定条件下自报,部分结果标为 preliminary;不同分辨率、板卡和运行时之间不能直接横比,表中也缺少每任务功耗。Xiaomi-Robotics-0 的结果来自模型作者且只覆盖两项任务。端侧性能已有可检查的条件,跨任务、跨运行时的可比性仍未建立。[S2][S4][S6]
闭环可靠性没有随端侧发布自动完成
模型卡已经把生产边界写进交付物:长时生成中的动作—状态漂移、物理近似和分布外退化都可能破坏结果,模型也没有安全认证。6 月 29 日,一项独立研究在 UR5e 上部署 OpenVLA 和 OpenVLA-OFT,观察到良好的离线指标仍可能对应不稳定的真实闭环;动作语义、坐标系、模态时序、图像预处理和数据覆盖中的偏差都会进入控制系统。该研究没有评测 Cosmos 3 Edge,不能据此声称 Cosmos 已出现相同失败,但它说明了模型上板之后仍要通过的系统闸门。[S2][S5]
闭环反馈会把本轮输出送入执行器,再把新的环境状态交给下一轮推理。表示或时间上的小偏差可能逐步累积,公开权重和本地推理只能缩短一部分路径,无法替代本体数据、控制接口、回退策略、独立安全层和长期运行监测。伙伴仍处于 evaluating 阶段,说明试验入口已经开放;任务成功率、连续运行、能耗和故障数据尚未出现,厂商基准到生产采用之间的连接仍待验证。[S1][S2][S5]
3 月的端侧运行时先形成执行基础,5 月的 Cosmos 3 统一模型能力,7 月又补上 4B 档位和板卡级性能。三项变化按交付顺序相接:统一架构提供同族能力,运行时与硬件把模型变成可测工作负载,本体适配和闭环反馈再决定工作负载能否支持持续执行。模型档位、执行环境和性能披露已经相接;本体适配之后的第三方复现、非 BF16 正式支持、长时闭环可靠性、安全认证和客户运营数据仍然滞后。7 月 20 日的新闻确认了端侧已进入 Cosmos 家族,也用任务时延和模型限制修正了“4B 就等于实时生产”的解释。[S1][S2][S3][S4][S5][S6]
未来一个季度,判断能否继续成立取决于两类可核查结果。一类是第三方能否在 Thor 或 Orin 上复现 Reasoner、前向动力学和策略延迟,同时报告能耗、峰值内存与热降频后的持续吞吐;另一类是同一机器人、同一数据集上的对照测试。若 Cosmos 3 Edge 在相同功耗下达不到任务控制频率,或长任务中的动作—状态漂移明显高于小型专用 VLA 与异步执行路线,而现有伙伴仍没有生产运行数据,那么“端侧成为第一类交付层”的判断应缩小为一次模型打包和发布动作。[S1][S2][S4][S5][S6]
参考资料
- S1|NVIDIA Blog:Cosmos 3 Edge 正式开放
- S2|NVIDIA Cosmos3-Edge Hugging Face Model Card
- S3|NVIDIA Developer Blog:Develop Physical AI Reasoning, World and Action Models with NVIDIA Cosmos 3
- S4|NVIDIA Developer Blog:TensorRT Edge-LLM
- S5|Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform
- S6|Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution