具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

Veo-Act 细读

WAM 论文细读 · 级联 · 显式(Veo-3 生成像素未来 → 逆动力学抽动作;分层:视频规划器 + π0.5 执行器)· arXiv:2604.04502(v1 2026-04-06) 机构:清华大学(Zhongru Zhang · Yanjiang Guo〔项目负责〕· Jianyu Chen 等 7 人)· 标准 arXiv 许可(未释放代码/权重) ← WAM 总览 · 主报告

TL;DR

Veo-Act 问了一个尖锐问题:通用前沿视频模型(Google Veo-3)对物理动态的理解,能多大程度直接迁移到机器人操作? 论文分两步作答:

  1. 零样本「Veo-3 + IDM」:用 Veo-3 从当前观测 + 指令生成未来帧,再用一个**只在「随机玩耍」数据上训练(无人类示范)的多头逆动力学模型(IDM)**从帧间变化反解动作,并输出门控值 G_t∈[0,1]。结论:能生成大致正确的「任务级」轨迹,但低层控制精度不足,解不了多数需精细接触的任务。
  2. 分层 Veo-Act:把 Veo-3 当高层运动规划器(出视觉轨迹 → IDM → 平滑动作队列),把 π0.5(Physical Intelligence)当底层执行器;在线监测交互检测器,G_t>0.5 触发切换——接触密集阶段交给策略执行,过后再回到规划队列。这套分层显著提升了 SOTA VLA 的指令跟随。

⚠️ 可信度提示:arXiv ID ✅ 已核(标题、作者、清华单位一致)。下列全部成功率为作者自评(仿真各设置 30 trials、真机 13–19 trials),非第三方复现。另注:Veo-3 是 Google 闭源模型,访问/成本/可复现性受限——本站补注的现实约束。

一、定位与动机

大规模机器人数据采集贵、且把 VLM 适配到机器人会牺牲部分泛化;而前沿视频模型已展现「强物理动态理解」。Veo-Act 的问题因此是:能否借通用视频模型的泛化,补足机器人数据的稀缺? 这把它放进 WAM 里最经典的「级联·显式」一支——先生成像素未来、再抽动作——但用的是通用前沿视频模型而非自训机器人视频模型,这是它和 UniPiGen2Act 的关键差别。

二、零样本 Veo-3 + IDM

  • 流程:Veo-3 由 I_0 + 指令生成未来帧序列 I_{0:n};多头 IDM(DINOv3 视觉编码器)从帧间反解动作 a_t 与门控 G_t∈[0,1](grasp 步标 1、非 grasp 标 0,作交互/非交互信号)。
  • IDM 训练数据(无示范):30 万仿真帧对(100–200 步随机抓放)+ 10 万随机运动 + 15 万真机帧对,配 STEM-OB 噪声增广(扩散反演:50 去噪 + 10 反演步)。
  • 结论:Veo-3 凭强泛化能持续生成「大致正确」的任务级轨迹,但低层控制精度不够,无法可靠完成多数操作——这正是要分层补救的动机。

三、分层 Veo-Act 框架

  • 高层:Veo-3 生成视觉轨迹 → 多头 IDM → 平滑动作队列;
  • 底层:π0.5 VLA 策略,当门控 G_t>τ=0.5 时接管执行;
  • 切换逻辑:监测交互检测器,在接触密集阶段切到策略执行、之后回到规划队列;动作队列逐步喂入,门控由真实观测在线评估触发换挡。

直觉:让擅长「想象大致怎么动」的视频模型管高层、让擅长「精细接触」的 VLA 管底层——与本站 双系统 / 分层架构 命题相合,只是这里的「System 2」换成了一个通用视频世界模型。

四、实验与关键结果

全为作者自评 ⚠️。基线:π0.5、VPP(Video Prediction Policy)。

  • 仿真(3 设置,各 30 trials;指令跟随 / 总体):腕部相机不可见 π0.5 0.37/0.33 → Veo-Act 0.83/0.67;相似物干扰 0.47/0.40 → 0.93/0.93;过路交互 0.03/0.00 → 0.50/0.47合计(180 trials)总体成功率 π0.5 0.50 → Veo-Act 0.80(+60%)
  • 真机灵巧手(3 设置,共 48 trials):相似物干扰 0.50/0.50 → 0.94/0.75;过路交互 0.23/0.15 → 0.92/0.85;更丰富语义 0.21/0.11 → 0.95/0.79合计真机总体 π0.5 0.25 → Veo-Act 0.79(≈3.2×);sim+real 合并 0.45 → 0.80(+78.4%)
  • 消融(腕部不可见):ResNet 主干 0.73/0.57 · 无噪声 0.73/0.53 · 单头 0.83/0.57 → 全多头 0.83/0.67

五、与本站谱系的关系

  • 「级联·显式」正统:与 UniPi(文生视频规划奠基)、Gen2Act(人类视频)一脉——先生成像素未来、再抽动作;Veo-Act 的特别处是直接用通用前沿视频模型 Veo-3
  • 分层 = WAM 当高层、VLA 当底层:执行器是 π0.5;思路呼应 双系统/分层架构
  • 基线 VPP:同为「视频预测 → 策略」,但 VPP 自训视频表征、Veo-Act 借通用 Veo-3。
  • 一剂清醒剂:对「前沿视频模型即将单独解决具身」的乐观叙事,本文给出实证边界——任务级轨迹大致对、低层精度不够、接触密集仍是瓶颈,必须分层补救。

六、局限与存疑

  1. 强依赖底层视频模型的保真与稳定(作者自陈):外观/视角/场景布局的微小变化都可能让 Veo-3 预测大变;接触密集交互仍是瓶颈,「逆动力学不足以独立完成任务」。
  2. Veo-3 是 Google 闭源模型(本站补注):访问门槛、调用成本、推理延迟、不可复现性,都是把它当生产级规划器的现实障碍。
  3. 样本量小 ⚠️:仿真各 30 trials、真机各 13–19 trials;未释放代码/权重。
  4. 作者明确把「需要在分布漂移下更一致、对接触物理建模更准的视频模型」列为未来工作——即当前结论绑定 Veo-3 这一代模型的能力边界

参考文献

体例声明:本页 arXiv ID 经 ✅ 核验;一切成功率为作者自评 ⚠️,非第三方复现。Veo-3 闭源属性的现实约束为本站补注。引用数据请连同 ⚠️ 一并保留。