预测式 VLA:把世界模型直接当策略
专题 · 代表作 VPP(arXiv:2412.14803)/ DreamVLA(arXiv:2507.04447)/ WorldVLA(阿里)等 · 2024H2–2026 · 路线:世界模型作策略主体(推理时预演未来→反推动作) ← 返回主报告
📐 范式定位:本页的「预测式 VLA」是更上位范式 世界-行动模型 WAM 的早期 / 狭窄切片,且在综述(arXiv:2605.12090,Fig 2)的 Cascaded/Joint taxonomy 中横跨两支——VPP 属 Cascaded·隐式(潜空间规划)、WorldVLA 属 Joint·自回归,并非同一类别。要把握「联合预测未来状态+动作」的完整范式、分类与 2026 旗舰(DreamZero / X-WAM / GR00T N2),见 WAM 调研。
读图方式:预测式 VLA 的关键不是「训练时见过视频」,而是推理时真的预演未来,再把最合适的未来状态反推成动作。
TL;DR
本站 具身数据全景 §4.1 把"世界模型"在 VLA 里的角色分成三种定位,此前只覆盖了前两种,第三种一直挂着"待补"——本页就补这一格:
| 定位 | 世界模型做什么 | 代表 | 本站覆盖 |
|---|---|---|---|
| ① 数据引擎 | 离线生成机器人视频 + 回收伪动作 → 放大训练数据 | DreamGen、Cosmos | embodied-data §4 ✅ |
| ② 生成式预训练先验 | 用 next-frame 视频生成预训练学动态先验,推理时丢弃未来帧 | RynnVLA-001、Genie | RynnVLA 细读 ✅ |
| ③ 作策略主体(本页) | 推理时真的预演未来、再把"想象的结果"反推成动作 | VPP、DreamVLA、WorldVLA、UniPi | 本页 ✅ |
三者的分水岭是一句话:预测在推理时用不用? RynnVLA(定位②)只在训练期用视频预测学先验、推理时把未来帧丢掉直接出动作;而 VPP / DreamVLA(定位③)在推理时真的先"想象未来",再据此生成动作——形成"感知→预测→动作"的闭环。这条"训练期先验 vs 推理期预演"的界线,正是本页相对 RynnVLA 细读 的独有价值。
⚠️ 本页各模型成绩均为作者自评(公开基准多为自跑),无第三方统一复现;凡定量标 ⚠️,一手未给标"待核"。
1. 要解决的问题:预测能不能直接当策略
主流 VLA(π0、OpenVLA)是"观测 → 动作"的直接映射;视频生成路线(RynnVLA)证明了"预测未来"能学到好的动态先验,但它在推理时把预测丢掉。一个自然的问题:既然模型能预测"接下来世界会变成什么样",为什么不在推理时直接用这个预测来指导动作?
直觉支撑:人类操作时会预演("我这样推,杯子会滑到那里")。把世界模型的预测放进推理闭环,理论上能:① 提供更强的、面向结果的中间表示(预测的未来表征比当前观测信息更丰富);② 让动作"目标导向"(朝着想要的未来状态走);③ 把网络规模视频预训练的动态知识真正用在决策上,而非只当初始化。难点在于:预测要足够快、足够准、且能干净地反推成动作(否则预测幻觉会污染动作)。
2. 三种代表实现
2.1 VPP(Video Prediction Policy)— 用视频扩散模型的"预测表征"驱动动作
- arXiv:2412.14803。核心:在视频扩散模型(VDM)内部预测的未来视觉表征上,学一个隐式逆动力学模型,把"预测的未来表征"映射成动作。先用机器人数据 + 互联网人类操作视频微调视频基础模型以提升预测精度,推理时真的用预测表征来条件化动作生成(是定位③而非纯预训练)。
- 成绩(⚠️ 自评):CALVIN ABC-D 相对前 SOTA +18.6%;真机复杂灵巧操作成功率 +31.6%。
- 定位:把"视频预测"从训练期先验提升为推理期的预测表征条件。
2.2 DreamVLA — 预测"对操作最有用的世界知识",感知-预测-动作闭环
- arXiv:2507.04447。核心:不是预测整帧像素,而是前瞻性地预测三类"对操作最相关的世界知识"——运动中心的动态区域(motion region)、3D 深度几何、高层语义;用 block-wise 结构化注意力防止三类表征间信息泄漏;再用一个扩散 Transformer 把动作表示从共享潜特征里解耦出来,据预测的世界知识生成动作。构成显式的"感知 → 预测 → 动作"闭环。
- 成绩(⚠️ 自评):真机操作成功率 76.7%;CALVIN ABC-D 平均链长 4.44。
- 定位:预测的不是"未来图像"而是"未来的、任务相关的结构化知识"。
2.3 WorldVLA — 自回归统一"动作 + 图像"的动作世界模型
- 阿里提出。核心:在单一自回归框架内统一动作理解/生成与图像理解/生成,把"未来图像预测"主要当作联合训练信号,推理时可生成动作(也可生成图像)。介于定位②③之间——比 RynnVLA 更"统一",但未来图像生成更多作为训练耦合而非强制的推理输出。
- 定位:用一个自回归世界模型把"动作"与"图像"双向预测联系起来。⚠️ 具体基准数字待核。
其它相关:UniPi(把"文生视频"当策略、再用逆动力学抽动作,定位③的早期代表)、Seer 等端到端预测式策略。本页以 VPP/DreamVLA/WorldVLA 三者勾勒主线,不逐篇展开。
3. 与本站已有"运行时预测"实例的连接
定位③并非全新——本站已有的几篇细读其实已经包含推理期预测组件,只是没被归到这条线:
- π0.7 的视觉子目标生成器 g_ψ(BAGEL-14B 初始化的轻量 world model):推理时异步合成多视角视觉子目标图像,再喂给动作专家——这正是"推理期预演未来(子目标画面)→ 指导动作"的工业级实例。
- SpatialVLA 提到的 3D-VLA:以 3D 为中心的生成式世界模型,对齐扩散模型预测目标图像与点云(想象未来状态)再规划——也是定位③,只是注入的是 3D。
- 对照:RynnVLA 是定位②(视频生成预训练、推理丢弃未来);DreamGen/Cosmos 是定位①(离线生成数据,不在推理闭环)。
4. 横向对照与定位
| 模型 | 预测什么 | 推理时用预测? | 与动作的接法 | 成绩(⚠️ 自评) |
|---|---|---|---|---|
| VPP | VDM 内部未来视觉表征 | ✅ 用 | 隐式逆动力学 | CALVIN ABC-D +18.6%、真机 +31.6% |
| DreamVLA | 动态区域 + 3D 深度 + 语义 | ✅ 用 | 扩散 Transformer 解耦动作 | 真机 76.7%、CALVIN avg-len 4.44 |
| WorldVLA | 未来图像(+ 动作) | 部分(主作训练信号) | 自回归统一 token | 待核 |
| RynnVLA(对照·定位②) | 未来帧(预训练) | ❌ 丢弃 | ActionVAE | 三任务真机 90.6% |
| DreamGen(对照·定位①) | 机器人视频(离线) | ❌ 不在闭环 | IDM 回收伪动作 → 训练 | RoboCasa 最高 333× |
一句话总结:预测式 VLA(定位③)把"世界模型"从"数据/先验"升级为推理闭环里的策略组件——预演未来、反推动作。它与"直接动作回归"(π0/OpenVLA)、"双系统分层"(dual-system)并列为一条独立思路;代价是预测的速度/精度/幻觉直接传导到动作质量(VPP/DreamVLA 都要在"预测够快够准"上做工程权衡)。
5. 局限与争议
- 全自评、口径不一:VPP/DreamVLA 的 CALVIN/真机数字均作者自跑,跨工作不可直接横比(标 ⚠️);WorldVLA 具体数字待核。
- 预测幻觉 → 动作污染:世界模型预测错误会直接传导到动作;高保真预测又昂贵(π0.7 的 g_ψ 需多张 H100、约 1.25s/张)。
- 推理成本:推理时跑一遍世界模型预测,延迟显著高于"直接出动作"的 VLA,是部署瓶颈。
- 与"先验"路线的边界并非绝对:WorldVLA 等介于定位②③之间;实际系统常混用(既预训练又部分推理预测),分类是为理解、非硬界线。
6. 在 VLA 谱系中的位置
预测式 VLA 是 VLA 的"第三类决策范式":相对 π0/OpenVLA 的直接映射、GR00T N1/Helix 的双系统分层,它主张先建模世界、预演未来,再反推动作。它把视频/世界基础模型的预测能力从"数据引擎/预训练先验"推进到"推理期策略组件",与 RynnVLA(定位②)形成"训练期 vs 推理期"的清晰对照,也与 embodied-data §4 的 DreamGen/Cosmos(定位①)区分用途。随着 π0.7 把视觉子目标生成做进工业系统,这条线正从研究走向落地。
相关条目:RynnVLA-001(定位②对照)· π0.7(运行时视觉子目标)· SpatialVLA(3D-VLA 生成式世界模型)· 具身数据全景 §4(世界模型三定位 + DreamGen/Cosmos)· 双系统架构原理
来源
- VPP:arxiv.org/abs/2412.14803(Video Prediction Policy)· video-prediction-policy.github.io
- DreamVLA:arxiv.org/abs/2507.04447(DreamVLA: A VLA Model Dreamed with Comprehensive World Knowledge)
- WorldVLA:阿里(自回归动作世界模型;arXiv 编号与基准数字待核)
- 相关:UniPi(text-to-video as policy)· Seer · 综述 World Model for Robot Learning(arXiv:2605.00080)
- 本站交叉:RynnVLA 细读 · π0.7 细读 · 具身数据全景
- 说明:本页定量均为各模型作者自评、无第三方统一复现;VPP CALVIN 提升为 +18.6%(以论文摘要为准,网络流传的 41.5% 系另一口径/误传,已纠)。

