蚂蚁 VLA2.0 开源、Mistral Robostral 发布、Manna 无人机美国扩张:机器人 AI 三层技术栈在同一天达到落地节点
蚂蚁 VLA2.0 开源、Mistral Robostral 发布、Manna 无人机美国扩张:机器人 AI 三层技术栈在同一天达到落地节点
2026/07/09
第一层:开源具身 AI 基础模型——蚂蚁 VLA2.0 填补了什么空缺
具身智能的核心技术瓶颈,长期以来不在机器人本体(机械臂、传感器、驱动器),而在于让机器人理解指令并规划动作的"大脑"——即 VLA(Vision-Language-Action)模型。VLA 需要同时处理视觉输入(摄像头画面)、语言指令(人类自然语言)和动作输出(关节运动序列),技术难度远高于单纯的视觉识别或语言理解。
蚂蚁集团发布的 Robbyant/VLA2.0 以 Apache 2.0 许可证开源,其核心技术突破在于支持 20+ 种异构机器人本体。这意味着同一个模型权重,可以无需重新训练地被应用于机械臂、服务机器人、人形机器人等完全不同的硬件形态。此前行业中大多数 VLA 模型都是针对特定机器人硬件训练的——即每换一种机器人,就需要重新收集数据并微调模型。蚂蚁 VLA2.0 的"通用本体"设计,是对这一碎片化问题的正面解决。
开源策略的产业意义与纯技术价值同样重要。Apache 2.0 许可证允许商业使用和修改分发,这意味着中国机器人制造商(宇树、追觉、小米等)可以直接基于此模型进行商业产品开发,而无需从头训练数据密集型的 VLA 基础模型。这在事实上将机器人 AI 的入场门槛从"必须拥有大规模训练数据"降低到"有机器人本体+微调数据即可"。
第二层:专项导航能力模型——Mistral Robostral Navigate 的设计选择与产业逻辑
如果说 VLA2.0 代表"机器人 AI 大脑"的开源,Mistral 的 Robostral Navigate 则代表另一种技术路径:不做通用 VLA,而是专攻导航这一单一但高频的机器人能力。
Robostral Navigate 的三个设计选择值得关注:
硬件无关(hardware-agnostic):模型不依赖特定的传感器配置,可以跨轮式机器人、四足机器人、移动服务机器人等不同平台部署,不需要为每种硬件重新设计感知层。
单摄像头(single camera):仅使用一个普通摄像头作为输入,而不依赖 LiDAR 或深度相机。这一选择大幅降低了硬件成本,使模型可以直接部署到成本受限的商业机器人产品上。
仿真训练(simulation-based):模型的训练数据来自仿真环境,而非真实世界的物理采集。这解决了机器人 AI 的一个核心数据问题——真实世界数据采集成本极高、场景覆盖有限,而仿真环境可以生成任意场景的大规模训练数据。
Mistral 这一选择暗示了一个产业判断:机器人 AI 的近期商业价值,更多集中在"能用"而非"最优"的导航能力上。一个硬件无关、仅需单摄像头、可快速部署的导航模型,比一个在论文基准上表现更好但部署复杂的模型,更接近真实工业客户的需求。
第三层:商业落地加速——Manna 无人机扩张背后的 AI 导航商业化临界点
Manna 是一家爱尔兰无人机外卖公司,在欧洲已完成商业验证(爱尔兰、德国等地的实际配送运营)。此次宣布美国多城市大规模扩张,是 AI 导航型无人机首次进入全球最大消费市场的规模化部署。
从技术角度看,Manna 选择此时进入美国,背景是 FAA(美国联邦航空局)近两年对无人机商业配送的监管框架逐渐明确,Beyond Visual Line of Sight(BVLOS,超视距飞行)的豁免申请流程已趋于成熟。技术层面,AI 导航的可靠性已足以满足商业 SLA(服务水平协议),这是从"技术演示"进入"商业运营"的核心门槛。
Manna 的案例揭示了一个关于机器人 AI 商业化的重要规律:商业落地不等于技术最优,而是等于"在现有技术水平下,供给侧成本与需求侧支付意愿首次交叉的时刻"。无人机外卖在 2026 年达到商业化临界点,不是因为无人机技术在 2026 年突然完善,而是因为 AI 导航成本下降、监管框架确立、竞争格局收窄(竞争对手如 Wing、Amazon Prime Air 均已完成技术验证)共同将边际部署成本压到了商业可行区间。
这个规律同样适用于地面机器人(外卖机器人、清洁机器人)、工业机械臂和人形机器人。技术并非突破即商业化,而是等待一个"供需剪刀差闭合"的时刻。