具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

WALL-WM 细读

WAM 论文细读 · 联合 · 扩散(多流:Wan 视频塔 + 动作 DiT 逐层跨注意力耦合)· arXiv:2606.01955(v1 2026-06-01) 机构:自变量机器人(X Square Robot)· 代码 github.com/X-Square-Robot/wall-x(CC BY-NC-ND 4.0) ← WAM 总览 · 主报告

TL;DR

WALL-WM 的一句话主张:把视频-动作预训练的基本单元,从「按时钟切的定长动作块(fixed-length chunk)」换成「按具身动力学切的语义事件(event)」。论文的口号很直白——"Fixed chunks cut by clock; semantic events cut by embodied dynamics."(定长块按时钟切、语义事件按动力学切)。它认为现有 VLA 把语言描述、连续视觉动态、离散控制都塞进同一个定长预测窗,会带来三重错配:动作块可能从中间截断一个语义行为;定长窗忽视了「语言描述的是事件而非时钟间隔」;训练会把预训练的视觉-语义先验塌缩成短程动作相关性,削弱组合泛化。

为此 WALL-WM 以 reach / grasp / lift / place 等动作锚定的语义事件 作为训练原子,每条样本是「事件视频 + 事件轨迹 + 事件级 caption」三元组,使「文本命名事件、视觉锚定其演化、动作实现它」三者对齐。架构上是一个多流联合扩散 WAM:继承 Wan 文生视频模型做多视角视频塔(加 camera RoPE 与跨视角几何掩码),旁挂一个逐层单向跨注意力耦合的动作 DiT(相对位姿动作 token + 流匹配),再以冻结的 Qwen3.5-9B + 轻量 Mixture-of-Transformers 做阶梯式(staircase)潜在思维链。它支持两种推理:事件模式(由 VLM/人提出下一个事件描述,模型执行变长的视频-动作段)与统一模式(阶梯解码器并行产出潜在 CoT,注入做定长块预测)。

⚠️ 可信度提示:实验数值已于 2026-06-10 回填(arXiv HTML 此前在 §5.2 截断,本次重抓已完整渲染 §7,数值直接取自 Table 2–5)。注意两点口径:① 真机指标为 Task Progress(0–100 连续分,按 10 分制细则给中间步骤部分分再归一),不是成功率,与他文 success rate 不可直接比;② 真机套件与视频生成基准均为自变量自建自评 ⚠️,无第三方复现。

一、定位与动机

WALL-WM 出自 自变量机器人(X Square Robot),与本站已收录的 WALL-OSS / WALL-OSS-0.5 同源,但目标不同:WALL-OSS 是端到端 VLA 基座,WALL-WM 则是一个世界-动作模型(WAM)——联合建模「未来视频」与「未来动作」。

它要解决的核心错配是 「时钟切片」 vs 「事件切片」:

  • 现有 VLA(含流/扩散动作专家路线,如 π0 / π0.5)把动作切成固定长度的 chunk。但一次「抓取」在时间上可长可短,定长窗要么截断它、要么把多个语义动作混进一个窗。
  • 语言天然描述的是事件(「把瓶子放进盒子」),而非「未来 0.5 秒」。用定长窗去对齐语言,本身就错位。
  • 在定长块上做联合训练,容易把预训练视频塔里「世界如何随操作演变」的语义先验,塌缩成短程的动作相关性,削弱长程与组合泛化。

WALL-WM 的回答是:让事件成为预训练和推理的共同原子,使视频先验、语言语义、动作监督在同一个语义边界上对齐,而不是被时钟硬切。

二、方法与架构

WALL-WM 是一个多流联合扩散 WAM,可拆成三块:多视角视频塔、逐层耦合的动作 DiT、语言引导的阶梯式潜在推理;外加一条事件中心的数据流水线。

2.1 事件锚定预训练(核心)

把训练原子从定长 chunk 换成动作锚定的语义事件(reach/grasp/lift/place)。每条样本为三元组 (Ve,ae,ce) —— 事件视频、事件轨迹、事件级 caption。训练即在事件边界上对齐「文本(命名事件)× 视觉(锚定演化)× 动作(实现事件)」。

2.2 多视角视频塔(Wan-based DiT)

  • 继承 Wan 文生视频模型,扩展到 Nv 路相机:在「视角内自注意力」之后接一个零初始化的跨视角注意力分支(零初始化保证不破坏预训练先验)。
  • Camera RoPE:可学习的逐相机旋转位置编码,无需运行时标定
  • 跨视角几何掩码(仅训练期):① sight-cone masking 按视锥相交关系,禁止在几何上互不可见的 patch 间注意;② tube patch masking 随机遮掉某一视角全帧的空间窗,逼模型靠其它视角恢复。
  • 视频流走流匹配损失 Lv,边界掩码排除出画区域。

2.3 逐层耦合的动作 DiT

  • 随机初始化的 transformer,逐层单向跨注意力读取视频塔特征(只让动作读视频、不反向写,保护视频先验)。
  • 时序对齐嵌入:窗内帧索引 Et + 滑窗索引 Eabs,构成以观测为中心的布局;动作 token 用相对位姿(末端执行器位移),锚 token 固定为 0。
  • 非对称「视频-动作」时间步映射:默认 1-to-Na —— 所有动作去噪步都从单次冻结的视频前向(在调度锚点 s=45 / 50 步)读取条件,动作塔则在完整噪声调度上独立采样学习。
  • 动作流匹配损失 La;对接触丰富数据可选 DCT 辅助项。

2.4 语言引导的阶梯式潜在 CoT

  • 主干 Qwen3.5-9B(冻结) + 轻量 Mixture-of-Transformers 分支。
  • Staircase latent CoT:在「中继深度 Nr」处切分 transformer,只让第一个潜在位置走完下层(共享视觉-语言 grounding),其余 Kc 个潜在状态由上层并行生成 —— 用「深度并行」摊薄 VLM 的逐层开销,区别于逐 token 串行的潜在 CoT。
  • 冻结的 Qwen3.5-0.8B 做潜在→文本重建监督(把潜在投影成软前缀再重建)。

2.5 两种推理模式(同一个事件预训练主干)

  1. 事件模式(Event Mode):由 VLM 或人提出「下一个事件」的描述,WALL-WM 执行一段变长的视频-动作段,观测新状态后重复 —— 与「按事件推进」的人类操作直觉一致。
  2. 统一模式(Unified Mode):阶梯解码器并行吐出 Kc 个潜在 CoT 状态,注入 WAM 跨注意力做定长块预测,同时保持一条梯度连续的 VLA 通路。

2.6 数据流水线

事件中心的层级 caption(Task / Subtask / Action / Segment,在动作边界处)+ 在「VL 簇」与「动作簇」上的簇平衡采样(抑制长尾)+ 接触丰富数据的恢复式初始化;多本体数据用 XRZero-G0 可穿戴采集装置 + 无本体数据 + 少样本物理锚定来扩展。

三、实验与关键结果(2026-06-10 回填)

出处与口径:以下数值取自论文 §7(arXiv HTML v1,2026-06-10 重抓后完整渲染;此前因 HTML 截断而标「待核」的占位至此回填)。全部为作者自评 ⚠️——真机套件与视频生成基准均为自变量自建;真机指标为 Task Progress:每任务按 10 分制评分细则(Table 6)给中间步骤部分分,再归一为 0–100 连续分,不是成功率,跨论文比较时务必注意口径。 取数史(透明记录):此前四路一手源均不可取(HTML 截 §5.2 / ar5iv 无 2026 镜像 / wall-x 仓「Code coming soon」/ PDF 超抓取上限);本次 HTML 已可读,代码与权重仍未放出(wall-x 仓 WALL-WM 部分仍标 coming soon,HF 仅有 WALL-OSS)。

3.1 真机四套件主结果(Table 5,Task Progress 套件平均)

自研桌面双臂平台,多视角同步观测 + 语言指令。WALL-WM-E = 事件模式(事件预训练);WALL-WM-U-Scratch = 统一模式从零训(无事件预训练);"–" = 该基线未评。

套件(任务数)π0.5LingBot-VADreamZeroWALL-WM-U-ScratchWALL-WM-E
Diverse 多样操作(7)55.6429.7139.9763.0075.86
Reasoning 指令推理(5)56.4031.6032.7059.5071.60
Dexterous 双臂灵巧(2)15.0024.0025.0031.2532.00
Generalization 泛化(4)24.0028.5018.5053.75

三个值得记的读数(均 ⚠️ 自评):① 事件模式四套件全胜,泛化套件拉开最大(53.75 vs π0.5 24.00);② U-Scratch 在泛化套件(18.50)反而输给 π0.5(24.00)——拿掉事件预训练后统一模式并不占优,侧面支撑「事件切分才是增益主源」;③ 双臂灵巧套件(插线/文具入袋拉链)所有方法都低(≤32),仍是硬骨头。逐任务分见论文 Table 5;对比基线 LingBot-VADreamZeroπ0.5 本站均有细读。

3.2 事件与视角建模消融(Table 4)

Base = 预训练定长统一基线(无 View-Interaction Self-Attention),Event = 预训练事件模式(同表均为 Task Progress):

  • Reasoning 套件平均 32.6 → 71.6(+39.0)
  • Generalization 套件平均 22.0 → 53.75(+31.75)

直接对应其两大卖点:事件切分 + 跨视角交互建模。⚠️ 自评。

3.3 具身视频生成评测(Table 2,自建基准)

自建 Embodied Video Generation 基准:留出 200 个分布内 + 50 个分布外任务(OOD 考新「动词-物体」组合、改写指令、未见布局)。对比未经具身训练的视频基座 Wan2.1-1.3B / Wan2.2-5B(后者即其视频塔初始化来源),12 项指标分 Visual / Motion / Semantic / Physical 四组:视觉质量组两项略低于 Wan2.2-5B(如 Image Quality 0.503 vs 0.527),其余 10 项全部领先——与论文图注「提升嵌入式相关的运动/语义/物理指标、保持视觉质量有竞争力」一致。⚠️ 自建基准自评;逐项对位以论文 Table 2 为准。

3.4 3D 感知探针(Table 3,CO3Dv2)

冻结特征探针评测 3D 感知能力(点误差 / 深度误差 / AUC):

特征Point Err ↓Depth Err ↓AUC@5 ↑AUC@30 ↑
DINOv20.5590.2090.0510.508
V-JEPA0.4390.2140.0760.619
Wan2.1-14B0.2840.1510.2000.736
WALL-WM0.2710.1320.2100.727

继承并强化了 Wan 系视频特征的空间感知(Point/Depth/AUC@5 最优,AUC@30 略低于 Wan2.1-14B)。⚠️ 自评。

四、与本站谱系的关系

  • 同源于自变量:与 WALL-OSS / WALL-OSS-0.5 对读。WALL-OSS 是端到端 VLA(MoT 双专家 + 梯度桥接 co-train),WALL-WM 则把同一团队的能力推到 WAM(联合视频 + 动作)。一家两路,正好对照「VLA 基座」与「世界-动作模型」。
  • WAM taxonomy:联合 · 扩散 · 多流。视频塔与动作 DiT 是两条流、靠逐层跨注意力耦合,属本站综述里的「Joint · 扩散 · 多流(跨注意力)」一支;可与 X-WAMUWMLaDi-WM 对读;同月发布、同格但取向相反的 GigaWorld-Policy(动作中心、推理期视频可选)也值得对照。
  • 「事件 vs 定长块」是它最独特的切口。本站多数 VLA/WAM(含 VPPWorldVLA)仍以定长 chunk 为单位;WALL-WM 把预训练与推理都重组到语义事件上,是这一维度上少见的明确尝试。
  • 潜在 CoT 路线。其「阶梯式深度并行潜在 CoT」与近期一批「动作空间/潜在空间推理」工作(如本站候选中的 AtomicVLA、ACoT-VLA 的动作 CoT)同潮但机制不同(深度并行 vs 串行/路由)。
  • 术语:标题中的 "World Action Modeling" 即本站综述的 WAM(见 WAM 总览 §1.4 辨析)。

五、局限与存疑

  1. 定量全为自建自评(⚠️):四套真机套件与视频生成基准均为自变量自建,且指标是自定义的 Task Progress(0–100 部分分),无第三方复现、也无与他文 success rate 的可比口径;在统一第三方评测出现前,「四套件全胜」应当作厂商主张看待。
  2. 事件切分依赖标注质量:事件边界与层级 caption 的获取依赖动作边界检测与 VLM 标注,边界噪声如何影响训练,论文(本次可读部分)未充分量化。
  3. 冻结主干 + 多分支的工程复杂度:Wan 视频塔 + 动作 DiT + Qwen3.5 双尺度(9B 主干 / 0.8B 重建)+ MoT 阶梯解码,组件多、推理调度(尤其事件模式的变长段)在真机的时延与稳定性,待核。
  4. 开源边界:代码仓 wall-x 公开(CC BY-NC-ND 4.0),但权重是否释放本次未确认;许可证为非商用、禁改。

参考文献

体例声明:本页 ⚠️ 项为作者自评(自建套件 + Task Progress 口径)。实验数值已于 2026-06-10 自 arXiv HTML §7(Table 2–5)一手回填,初版因 HTML 截断而设的「待核」占位至此解除;代码与权重仍未放出(待核),释出后再核对脚本口径。