WAV 细读
命名提示:WAV 全称 World–Value–Action model;作者在脚注里自注玩了个 "WAVe" 的梗——强调"价值像波一样在预测的未来中传播"。请勿与音频格式 WAV 混淆。
TL;DR
WAV 是 西湖大学(MiLAB,王东林组)× 南京大学苏州校区 的统一世界-价值-动作模型(8 位作者,共同一作 Runze Li / Hongyin Zhang,通讯 王东林 Donglin Wang;v1 2026-04-16、v2 2026-04-19)。核心主张:规划不必是外挂的显式优化模块,可以作为结构化生成模型内部的推理过程"隐式"涌现。做法:在单一多视角 Diffusion Transformer(DiT,flow matching)里统一三个紧耦合模块——①指令条件视频生成(冻结 T5-XXL 编码指令,多视角 head/left/right,自回归生成未来视觉潜轨迹);②轨迹价值模块(把累计折扣回报本身当作 flow matching 的生成目标,奖励为仿 ReinboT 的规则式稠密奖励);③动作解码(逐块 cross-attention 视频与价值特征出动作块)。推理时不在动作空间搜索,而是 MPPI 风格地在"flow 初始噪声"空间迭代:采 M 个未来视频候选 × 各 N 个价值评估,以 SNR 打分、精英重加权更新两个高斯噪声分布,K 轮(K=3 较优)后才解码一次动作——即价值引导的 latent planning。配套理论:动作空间规划的可行轨迹概率随 horizon 指数衰减 exp(−cH),潜空间采样把可行概率比放大 ≥ exp(cH)(1−δ),且一次性采样不够、必须迭代。规模 2.2B ⚠️(论文正文未点名视频底座;仓库实查需下载 GE-Base-fast(Genie Envisioner)与 LTX-Video 组件)。成绩(全部作者自评 ⚠️):LIBERO 四套件单模型平均 98.1(去掉 latent planning 降至 96.4);真机双臂 Piper 三任务平均 35.6%→75.6%(对同底座基线 GE-ACT)。开源(2026-06-11 实查):GitHub Win-commit/WAV 真实存在,训练+推理代码已放(17 星),权重未放(README TODO 未勾)。另:本站对其 LIBERO 表做了逐格算术核对——前期流传的"自报均值 99.6 与分套均值 97.775 矛盾"不属实,系列错位解析的假象,详见 §三核对小节。
一、定位与动机
WAV 把矛头对准 VLA 的"直接动作预测"范式:每步独立出动作、既不向前推演轨迹也不评估后果,长程多步决策因此乏力。论文梳理了两条既有补救路线并各打五十大板:统一架构派(世界模型与策略共享主干,如 WorldVLA、Genie Envisioner、Motus 等)靠静态数据集监督学习,"难以刻画细粒度动态、难以评估长程轨迹质量";世界模型当仿真器派(rollout 出合成数据/奖励做 RL)受世界模型自身泛化能力的天花板制约,复合误差导致仿真数据不可靠。WAV 借 model-based RL(TD-MPC 系、MPPI)的视角给出第三条路:预测(world)+ 评估(value)联合,规划(planning)作为推理过程内生——提问"规划能否被学成隐式的推理,而非实现成显式的优化模块",并给肯定答案。
支撑这个设计的是一组理论刻画(§4.1 + 附录 A,作者自述是"几何/概率刻画、非紧的最优性保证"):Lemma 4.1(可行质量消失)——horizon-H 的轨迹空间维数随 H 线性涨,而视觉/物理/语义约束把有效行为压在低内在维数流形上,均匀采样碰到近似可行轨迹的概率 ≤ exp(−cH);Proposition 4.2(潜空间重加权)——若学到的潜轨迹生成器以 ≥1−δ 概率落在可行流形内,则相对均匀动作采样,可行概率比被放大 ≥ exp(cH)(1−δ);Corollary 4.3(迭代必要性)——可行 ≠ 高价值,一次性潜采样在亚指数样本预算下不保证找到近优轨迹,必须迭代地把概率质量向高价值区集中。三条合起来就是 WAV 的结构:潜空间解决可行性,迭代推理解决优化。
在本站 WAM 谱系中,WAV 属联合系·扩散路线:单一主干同时承担未来预测、价值估计与动作生成(联合训练、共享特征),推理时的"想象-评估-择优"全部发生在同一模型的潜空间内——与级联式"先生成整段视频再抽动作"不同,也与"联合生成但一遍前向"的纯联合式不同(多了显式的迭代搜索回路)。
机构口径:论文署名为 Westlake University(Runze Li、Hongyin Zhang 等 6 人)与 Nanjing University Suzhou Campus(Shangke Lyu);"MiLAB"一词论文全文未出现,系通讯作者王东林在西湖大学的实验室名(本站补注口径)。
二、方法与架构(据论文 §4)
整体:三个紧耦合模块装在 DiT 式主干上,训练目标全部是 flow matching(论文 Fig.1)。论文正文未点名视频底座(只写 DiT + 冻结 T5-XXL 文本编码器);仓库 README 实查:训练/推理需下载 LTX-Video 组件(tokenizer / text encoder / VAE,Lightricks)与 GE-Base-fast 权重(agibot-world/Genie-Envisioner)——即 WAV 站在智元 Genie Envisioner 的视频底座(其本身为 LTX-Video 系)之上;表 1 自报总参数 2.2B ⚠️。
① 语言条件视频生成模块 𝒲:冻结 T5-XXL 编码指令,经 cross-attention 注入 DiT;输入多视角(head / left / right)初始观测潜变量 + 稀疏视觉记忆(某时刻 t̂ 的历史帧)+ 各视角潜噪声,自回归地生成时序连贯的未来视觉段——它就是理论部分潜轨迹生成器 𝒲θ 的视觉子空间实现。
② 轨迹价值模块 𝒱:初始化潜价值 token z_val ∼ 𝒩(0,I),逐 DiT 块与视频特征做 cross-attention 精炼。关键设计:价值不是回归头,而是 flow matching 的生成目标——目标分布是累计折扣回报 v¹ = Σ γⁱR(s,a)。奖励为规则式稠密奖励(仿 ReinboT,删去 sub-goal achievement 项):双臂设定下共 9 个奖励项 / 16 个标量分量——腕视角与顶视角的 MSE / SSIM 接近度(对终态画面)、关节态接近度,以及关节/动作的速度、加速度平滑罚(附录 Table 2)。
③ 动作解码模块:潜动作 token 在每个 DiT 块内先 cross-attend 视频特征 x_i、再 cross-attend 价值嵌入 u_i,最终 flow matching 出可执行动作块——动作生成被显式地"摆在"预测与评估的下游。
三阶段训练(论文 §4.2;README 称 video adaptation → trajectory value learning → action post-training):先用视频 flow loss 训 𝒲;冻结视频模块训价值模块;最后三模块联合训练动作 flow loss。
推理 = 潜空间迭代规划(论文算法 1,MPPI 风格):维护两个独立高斯噪声分布 f_vid、f_val(替代固定的标准高斯先验)。每轮迭代:采 M 组视频潜噪声 → 𝒲 去噪成 M 个未来视频特征候选;每个候选再采 N 组价值噪声 → 𝒱 去噪出价值预测;对每次评估算 SNR = 𝔼[v]/(Std[v]+ε),候选得分取 φ(m) = max_n SNR(m,n);top-K₁ 精英更新视频噪声分布(经验均值/方差)、全体 M×N 中 top-K₂ 更新价值噪声分布,再加指数平滑(α、β)与方差衰减防塌缩。K 轮后从优化后的分布采样、去噪,由动作模块解码一次动作执行。要点:整个搜索回路从不触碰动作空间——规划发生在"flow 初始噪声"这个潜空间里,这正是标题里的 implicit planning。
三、实验与关键结果(全部为作者自评 ⚠️,预印本未经第三方复现)
LIBERO(论文 Table 1):四套件(Spatial / Object / Goal / Long),单一 WAV 模型跨四套件部署;全参微调(8×A100-80GB,约 5 天)。下表节选原表(共 25 行)中的代表行,全表数字均为作者自报或转引 ⚠️,本站仅核对表内算术(见下方核对小节):
| 模型(转引自论文 Table 1)⚠️ | 参数 | Spatial | Object | Goal | Long | Avg. |
|---|---|---|---|---|---|---|
| π0 | 3B | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 |
| π0.5 | 3B | 98.8 | 98.2 | 98.0 | 92.4 | 96.8 |
| MemoryVLA | 7B | 98.4 | 98.4 | 96.4 | 93.4 | 96.5 |
| OpenVLA-OFT | 7B | 97.6 | 98.4 | 97.9 | 94.5 | 97.1 |
| VLA-Adapter | 0.5B | 97.8 | 99.2 | 97.2 | 95.0 | 97.3 |
| WorldVLA(World Model 组) | 7B | 85.6 | 89.0 | 82.6 | 59.0 | 79.1 |
| GE-ACT(World Model 组) | 2B | 98.2 | 97.6 | 95.8 | 94.4 | 96.5 |
| WAV(Ours) | 2.2B | 99.6 | 100.0 | 98.6 | 94.4 | 98.1 |
| WAV 去 latent trajectory planning | — | 99.0 | 99.6 | 95.0 | 91.8 | 96.4 |
✅ LIBERO 表逐格算术核对(2026-06-11,本站实查)——前期流传一种说法:WAV 的 LIBERO 表存在内部算术矛盾,"分套元胞平均 97.775 ≠ 自报平均 99.6,且每行皆然"。本站对照 arXiv v1 与 v2 两版 HTML(两版表格逐格相同)核对全部 25 行,结论:
- 矛盾不属实。WAV 行为 Spatial 99.6 / Object 100.0 / Goal 98.6 / Long 94.4,四套等权平均 = 98.15 ≈ 自报 Avg. 98.1,口径自洽;消融行 96.35 ≈ 96.4 同样自洽。99.6 不是自报均值,而是 Spatial 列的数值。
- 传言数字的来历可被精确重构:该表表头为两层(「LIBERO」横跨四个子列 + 独立「Avg.」列),若解析时列错位一格——把第一个数(Spatial 99.6)误当"自报均值",再对其余四个数(100.0、98.6、94.4、98.1,其中混入了真正的 Avg. 列)取平均——恰得 97.775。"每行皆然"正是这种系统性错位的特征,而非论文之误。
- 全表 25 行中 22 行在 ±0.05 舍入内自洽。仅有的实质例外在基线行:CoT-VLA 行四格均值 83.9 ≠ 表内 Avg. 81.1(差 2.8)——本站进一步核对 CoT-VLA 原文(arXiv:2503.22020)Table 1,其自报 Average 81.13 与自家四套数字(87.5/91.6/87.6/69.0)同样对不上,即 WAV 系逐字沿袭了上游论文自身的内部不一致;另 MemoryVLA 行四格均值 96.65 与所印 96.5 差 0.15(略超舍入,疑转录口径差,待核 MemoryVLA 原文)。两处均不涉及 WAV 自身两行的数据。
其余结果:
| 结果 | 数值(作者自评 ⚠️) | 出处 |
|---|---|---|
| LIBERO 消融:去 latent trajectory planning | 平均 98.1 → 96.4(−1.7);Long 掉最多:94.4 → 91.8 | 论文 Table 1 + §5.1 |
| 真机(双臂 Piper,三任务,每任务 15 trials,严格二值成功) | 平均成功率 35.6% → 75.6%(基线 GE-ACT → WAV) | 论文 §5.2 + Fig.2(逐任务数值仅以图形呈现,本页不读图取数) |
| 迭代数 K 消融 | K 1→5 明显提升,5→10 边际;K=3 为性能-效率较优点 | 论文 Fig.4 / Fig.6(趋势结论;数值在图中) |
| 采样数 M / N | 对 M 高度敏感(低样本区陡升);N 影响较温和、饱和早 | 论文 Fig.4(趋势结论) |
| 平滑参数 α/β、精英数 K₁/K₂ | α 过小则崩、增大后饱和;K₁/K₂ 不敏感但极小值劣化 | 论文 Fig.5(趋势结论) |
| 推理时延 / 显存绝对值 | 正文未给数值(仅 Fig.6 曲线),待核 | — |
真机设置(附录 B):双臂 Piper 平台;任务为碗收纳(bowl organization)、毛巾铺平(towel flattening)、长程抽屉(开抽屉-放物-关抽屉);自采数据 drawer / bowl 各约 300 条成功轨迹、towel 2,000 条;两腕相机 240×320 + 顶视 240×424,14 维关节态;每任务单独训练一个模型(与 LIBERO 的单模型跨套件不同)。基线选 GE-ACT,理由是"同一视频预训练模型、相近架构与参数量"——同底座对照是其真机实验设计上的可取之处。小笔误注记:正文称 LIBERO 微调"视频 30K 步 + 价值/动作 40K 步",而附录 Tab.3/Tab.4 印的是视频 40K / 价值动作 30K,正文与表格互换(无碍大局,录此存照)。
四、与本站谱系的关系
- 联合·扩散路线的"三头化":与 UWM 同属"视频与动作放进同一扩散过程"的联合系;UWM 是视频+动作两路联合去噪,WAV 把第三样东西——轨迹价值(累计折扣回报)——也当作 flow matching 的生成目标塞进同一主干,并据此把推理从"一遍前向"升级为"潜空间迭代搜索"。从两头到三头(video/value/action),"评估"第一次成为联合扩散主干的一等公民。
- 对直接动作预测 VLA 的立论:π0 是 flow matching VLA"直接动作预测"的代表,正是 WAV 引言批评的对象("缺轨迹级推理与后果评估");在其自报的同表口径下 π0 94.2 ⚠️、π0.5 96.8 ⚠️ vs WAV 98.1 ⚠️。
- 与记忆路线正交:MemoryVLA(同表基线 96.5 ⚠️)向过去要长程能力(感知-认知记忆库),WAV 向未来要(预测+价值评估);两种机制原则上可叠加。另注意 §三核对发现 WAV 表中 MemoryVLA 行有 0.15 的均值出入(待核)。
- 与自回归统一路线对照:WorldVLA(离散统一词表、自回归)被 WAV 归入表内 "World Model" 组作基线(79.1 ⚠️)——同为"统一世界模型+动作",离散自回归与连续扩散两条实现路线的 LIBERO 口径差距在此表被作者用作卖点(转引数字,各家训练设定不同,横比仅供参考 ⚠️)。
- 底座谱系(不另设链接):仓库实查 WAV 的视频底座是智元 Genie Envisioner 的 GE-Base-fast(LTX-Video 系),真机基线 GE-ACT 即同底座的官方动作接口——WAV 相当于在 GE 底座上换了"价值引导潜空间规划"的推理头;这也是本站观察到的"视频底座收敛"又一例(此处收敛到 LTX/GE 系,而非 Wan 系)。思想源头上,WAV 自述受 MPPI 启发,可视作 TD-MPC 系"潜空间规划+价值学习"在视频扩散 VLA 上的移植;与智元 τ0-WM 的"测试时算力"同题异解:τ0-WM 是候选动作的外挂模拟器升级评估,WAV 是同一主干内的初始噪声分布迭代重加权。
五、局限与存疑
- 全部数字作者自评 ⚠️,无第三方复现;真机逐任务成功率仅以 Fig.2 柱状图呈现,论文文本只给平均值(35.6%→75.6%),本页遵循"不读图取数"。每任务 15 trials、真机基线仅 GE-ACT 一家,样本量与对照面都偏小。
- LIBERO 均值口径:经本站逐格核对,WAV 自身两行算术自洽(98.15≈98.1),前期流传的"97.775 ≠ 99.6"矛盾不属实(系列错位解析假象,重构过程见 §三)。需要留意的反而是:其基线行存在未经重算的转引——CoT-VLA 行沿袭了原文自身不一致的 81.1(四格均值应为 83.9),MemoryVLA 行有 0.15 出入(待核)——提示读者对该表基线列横比保持谨慎,对 WAV 自报行则无此疑。
- 复现门槛:权重未放(README TODO 未勾),数据集称"发表后公开"(尚未);代码虽全(训练+推理),但 LIBERO 复现需 8×A100 约 5 天/全参微调;仓库未见 LICENSE 文件(GitHub License API 返回 Not Found),复用许可不明。
- 部署开销:作者在结论自承"当前工作的主要局限是部署所需的时间与存储开销"——推理是 K×(M 次视频去噪 + M×N 次价值去噪)的回路,绝对时延/显存数值正文未给(仅 Fig.6 曲线),实时性待核。
- 真机为每任务单独训练一个模型,与 LIBERO 的"单模型跨四套件"不一致;真机侧的单模型多任务能力未验证。
- 理论的对照基线偏弱(本站观察):Lemma/Proposition 对比的是"均匀动作空间采样"——实践中没有方法真这么做;定理证明的是"潜空间采样优于均匀采样",并不直接证明"WAV 优于学得好的直接动作策略"。假设(流形假设、生成器 1−δ 可行覆盖)也较强,作者自己定性为"刻画而非保证"。
- 小笔误:训练步数正文与附录 Tab.3/Tab.4 互换(见 §三);机构方面论文未出现"MiLAB"字样(本站按通讯作者实验室补注)。
参考文献
- 一手论文:arXiv:2604.14732 World–Value–Action Model: Implicit Planning for Vision–Language–Action Systems(v1 2026-04-16,v2 2026-04-19;Runze Li、Hongyin Zhang〔共同一作〕、Junxi Jin、Qixin Zeng、Zifeng Zhuang、Yiqi Tang、Shangke Lyu〔南京大学苏州校区〕、Donglin Wang〔通讯,西湖大学〕)。
- 官方项目页:win-commit.github.io/wavpage/(2026-06-11 实查可达);代码 GitHub
Win-commit/WAV(实查真实存在:2026-04-14 建仓、04-19 最后推送、17 星;训练+推理代码已放、权重 TODO 未放、无 LICENSE 文件)。 - 依赖权重(仓库 README):Lightricks
LTX-Video(tokenizer / text encoder / VAE)+ agibot-worldGenie-Envisioner的 GE-Base-fast。 - 算术核对旁证:CoT-VLA,arXiv:2503.22020(其 Table 1 自报 LIBERO Average 81.13,与自家四套数字均值 83.9 不符,WAV 表系逐字沿袭)。
- 基准:LIBERO(Liu et al., NeurIPS 2023)。
体例声明:✅ 为本站实查(arXiv v1/v2 表格逐格核对、GitHub/项目页放出状态、上游论文旁证);⚠️ 为作者/厂商自评或转引口径(预印本未经第三方复现);待核 表示一手源未给出、不以外部记忆或常识补全。
