τ0-WM 细读
WAM 论文细读 · 推理时算力(test-time compute):RCS 初筛 → 不可靠才推演未来 → LAR 修正 · 智元 Finch / 上海创智(罗剑岚团队) ← WAM 总览 · 主报告
✅ 2026-06-11 校订完成 — 本页已逐节对照一手论文 arXiv:2606.01027(τ₀-WM: A Unified Video-Action World Model for Robotic Manipulation,v1 2026-05-31)重写;初版(媒体转述)的误差已修正,清单见 §五。GitHub 仓库与 HuggingFace 权重放出状态为 2026-06-11 实查。
命名提示:本页对象是 τ0-WM(tau-zero),部分中文转述写作"pi0_WM"系 τ(tau)与 π(pi)混淆;官方写法见项目页 finch.agibot.com 与 GitHub
sii-research/tau-0-wm。
TL;DR
τ0-WM 是 上海创智学院 × 智元 AGIBOT Finch 的统一视频-动作世界模型(19 位作者,通讯 罗剑岚,共同一作 Pengfei Zhou / Shengcong Chen),2026-05-31 论文、项目页与 VAM 权重同日放出。核心主张:视频预测只有与动作生成、动作评估联合训练在同一个未来预测框架里,才对操作真正有用。它在一个共享视频扩散主干上提供两个接口:VAM(视频-动作模型)以联合流匹配从多视角观测+语言指令+机器人状态同生未来视觉潜变量与连续动作块;ACVS(动作条件视频模拟器)把候选动作块推演成多视角未来并输出稠密任务进度分。规模:5.5B(Wan2.2-TI2V-5B 视频主干 + 0.5B DiT 动作分支)、27,300 小时异构预训练(真机遥操作 17.8K + UMI 式 6.5K + 人类第一视角 3.0K,另含 rollout/失败轨迹,按模态加监督掩码)。推理时算力是升级式而非全量推演:先用 RCS(重去噪自一致分)轻量初筛 N 个候选,只有评分低于阈值才调用 ACVS 推演未来、再以 LAR(以选中未来为条件重查 VAM)修正动作。⚠️ 作者自评(单次尝试、禁止重试):两任务均值 0.43 → RCS 0.50 → RCS+LAR 0.60,其中 Pen→Box 0.30→0.50(媒体广传的"30%→50%"出处即此)。开源状态(实查):VAM 权重 + 推理代码已放;ACVS 权重与 TTC 代码官方称"将后续放出"、尚未发布。
一、定位与动机
τ0-WM 把世界模型当作推理时的"预演 + 评估"引擎,而非仅仅训练期先验:让机器人在执行前先评估候选动作的后果、必要时"在脑内跑一遍"再择优——把更多算力花在推理时(test-time computation),换取长程精细操作的单次成功率。论文的设计哲学还有一层:异构数据不是噪声而是结构化的互补监督——人类视频训视觉动态、机器人轨迹训动作生成、进度/失败轨迹训动作条件评估,各按模态加监督掩码。
它在本站 WAM 谱系中是**"联合生成 + 测试时搜索"的混合形态**:VAM 本身是联合式(一个前向同生未来与动作,联合流匹配),但又外挂一个级联风格的模拟器(ACVS)专职"推演 + 打分",并把它嵌进推理回路。这既不同于纯级联"先生成整段未来视频、再抽动作"(如 UniPi),也比纯联合(如 DreamZero)多了一个显式的候选评估器。注:综述 arXiv:2605.12090(2026-05-12)发布于 τ0-WM 之前未收录本工作,其在 Cascaded/Joint taxonomy 中的归属无权威源;按论文自述("unified video-action world model"、联合训练)本站将其归在联合系、带测试时搜索,此为本站归类判断。
机构与谱系:出自 智元 AGIBOT Finch / 上海创智学院(论文署名机构原文 "Shanghai Innovation Institute" + "AGIBOT Finch"),与本站 GO-1、Genie Envisioner 同属智元系——是智元在"世界模型作策略/评估"方向的又一工作。
二、方法与架构(据论文 §III–VI)
VAM(Video Action Model) — 接口:输入多视角观测、语言指令、机器人状态,联合输出未来视觉潜变量 + 连续动作块。架构:视频分支为 Wan 视频 DiT 主干(5B 参数)(部署 README 实查依赖 Wan2.2-TI2V-5B 权重),动作分支为 0.5B 的 DiT 式动作解码器,合计 5.5B;动作 token 先在动作时域内建模时序依赖,再交叉注意到视频中间特征。训练目标为联合流匹配(joint flow-matching)。部署时延(论文附录):标准配置约 220ms/次动作查询,缓存文本表征后约 180ms(另有 KV 缓存、融合 QKV、简化 RoPE、torch.compile 等推理加速)。
ACVS(Action-Conditioned Video Simulator) — 复用 Wan VAE 与视频 transformer 主干、去掉动作分支:记忆与当前观测编码为干净潜变量上下文,未来潜变量槽从噪声去噪生成,候选动作块作为干净条件注入;同时输出稠密任务进度/奖励分(reward & progress scoring),供候选排序。
测试时算力(TTC,论文算法 1)— 升级式两段,不是每次全推演:
- 提议 + 初筛:VAM 采样 N 个候选动作块;每个候选做 RCS(Re-denoising Consistency Score,重去噪自一致分)——在随机 K 个流匹配时间步上重加噪再去噪,看动作与已学条件分布的自一致程度,轻量、不动用模拟器。
- 取最高分候选;若评分 ≥ 阈值 γ → 直接执行(多数情形走到这里,保住实时性)。
- 仅当候选不可靠时升级:ACVS 对各候选推演多视角未来、计算 rollout 价值 J,选出最有希望的未来 j*;再经 LAR(Low-quality Action Rectification,低质动作修正)——把选中的未来潜变量转成条件、带着这个未来重查一次 VAM,生成修正后的动作块执行。
预训练数据(27,300 小时,论文 §III):真机遥操作 17.8K 小时(AGIBOT-G01、ARX 机械臂、双臂 Franka)+ 6.5K 小时 经筛选的开源 UMI 式演示(Gen-DAS 夹爪采集)+ 3.0K 小时 开源人类第一视角交互视频(含 EgoDex 等);另含 rollout / 失败轨迹用于训练动作条件评估。其数据生态对应本站 具身数据全景 的真机 / UMI / 人类视频三路。
三、实验与关键结果(全部为作者自评 ⚠️,预印本未经第三方复现)
评测设置(论文 §VII):四项排除在预训练语料之外的长程精细操作任务——Toolbox(工具归位入箱)、School Bag(拉开书包-装物-拉合拉链)、Faucet(软管对接水龙头并锁紧)、Badminton(收纳羽毛球并合盖);本体覆盖三种(Badminton 用 ARX、Faucet 用双臂 Franka、其余用 AGIBOT-G01)。指标 = 任务成功率 + 逐步任务进度;基线含 π0.5 与 Fast-WAM。
| 结果 | 数值(作者自评 ⚠️) | 出处 |
|---|---|---|
| 四任务主结果 | 平均成功率最高、多数任务最佳;Faucet 对所有方法都难 | 论文 Fig.4(图形呈现,文本未列逐任务数值,本页不读图取数) |
| TTC 消融(单次尝试、禁止重试,两任务) | 均值:无 TTC 0.43 → CFG 0.20 → ACG 0.38 → RCS 0.50 → RCS+LAR 0.60 | 论文 Table II |
| 其中 Pen→Box | 0.30 → 0.50(RCS+LAR);Tissue→Box 0.55 → 0.70 | 论文 Table II(媒体"30%→50%"出处即此,为 TTC 消融而非对外基线) |
| 预训练配方消融 | 零样本 Pen-to-holder 均值 0.14 →(+UMI+Ego)0.55;SFT Object-wipe-place 0.70 → 0.83 | 论文 Table I |
| 公共基准(LIBERO / RoboTwin 等) | 论文未报告 | — |
质性观察(论文自述):基线常在工具"插进槽位但未到位"时就停手,τ0-WM 倾向补做推/压等修正动作再结束——作者归因于对未来视觉动态的显式建模。值得注意 Table II 还显示:CFG/ACG 两类通用引导反而把成功率拉低于无 TTC(0.20/0.38 vs 0.43),即"加测试时算力"本身不保证收益,关键在 RCS/LAR 这种与流匹配训练耦合的设计。
四、与本站谱系的关系
- Wan 系基座再下一城:VAM 视频主干为 Wan2.2-TI2V-5B(部署 README 实查)——又一例视频基座向 Wan 系收敛,与 WAM 全模型规格对比 的跨行观察相互印证。
- 智元系:与 GO-1、Genie Envisioner 同出智元;τ0-WM 的 ACVS 与 GE-Sim(动作条件神经仿真器)思路相通,但 τ0-WM 把仿真器直接嵌进推理时的动作择优回路,且只在候选不可靠时升级调用。
- 机制对读:与 DreamZero 的"联合同生未来与动作"同源;区别在 τ0-WM 在联合 VAM 之上加了显式多候选搜索 + 条件升级评估。与 RynnVLA-002 形成有趣对照:Rynn 推理时不 roll out 未来帧(解耦查询),τ0-WM 则把"必要时想象未来"做成了推理主回路——两家对"推理期世界模型该不该参与控制"给出了相反答案。
- 开源定位(2026-06-11 实查):部分开源——VAM 预训练权重(HuggingFace
sii-research/tau-0-wm)与部署/推理代码(GitHub 同名仓库,205 星)已放;ACVS 模拟器权重与 TTC 代码官方 README 称"将后续放出"、尚未发布——即论文最核心的测试时算力回路目前不可完整复现。
五、校订记录与仍存疑项
2026-06-11 对照一手论文的校订(初版媒体转述 → 论文口径):
| 项 | 初版(媒体转述) | 论文口径 |
|---|---|---|
| 参数规模 | 5B | 5.5B(5B Wan 视频 DiT + 0.5B 动作分支) |
| 预训练数据 | "约 3 万小时" | 27,300 小时(17.8K + 6.5K + 3.0K,另含 rollout/失败轨迹) |
| 推理流程 | 三步全量"提议→推演→评估" | 升级式:RCS 轻量初筛,仅当评分低于阈值 γ 才调用 ACVS 推演 + LAR 修正 |
| RCS / LAR | 全称待核 | Re-denoising Consistency Score / Low-quality Action Rectification(定义见 §二) |
| "Pen→Box 30%→50%" | 出处不明 | 论文 Table II:TTC 消融(单次尝试),0.30(无 TTC)→ 0.50(RCS+LAR) |
| "全球最大开源具身世界模型" | 转述为团队声称 | 论文全文无此表述——系发布宣传口径,论文不背书,本页降格为 ⚠️ 宣传语 |
仍存疑 / 待核项:
- 公共基准缺位:论文未报告 LIBERO / RoboTwin 等公共基准成绩,全部评测为自建任务、作者自评 ⚠️。
- 主结果数值在图中:四任务对 π0.5 / Fast-WAM 的逐任务成功率在 Fig.4 以图形呈现,论文文本未列数;本页遵循"不读图取数"原则,只录文字结论。
- 复现受限:ACVS 权重与 TTC 代码未放出(见 §四),RCS/LAR 回路暂无法独立验证;候选数 N、阈值 γ 等部署超参在论文附录,本页未逐项抄录。
- 综述归属:晚于综述 arXiv:2605.12090,Cascaded/Joint 归属无权威源;本站按论文自述归"联合系 + 测试时搜索"(本站归类判断)。
参考文献
- 一手论文:arXiv:2606.01027 τ₀-WM: A Unified Video-Action World Model for Robotic Manipulation(v1 2026-05-31;上海创智学院 × AGIBOT Finch,通讯罗剑岚)。
- 官方项目页:finch.agibot.com/research/tau0-wm;代码 GitHub
sii-research/tau-0-wm(部署/推理,实查 205 星);权重 HuggingFacesii-research/tau-0-wm(VAM);视频主干依赖Wan-AI/Wan2.2-TI2V-5B。 - 背景:2026-05-31 中文媒体发布报道(本页初版来源,已被一手论文替代;其"5B / 约 3 万小时 / 全球最大开源"等口径与论文的出入见 §五校订表)。
体例声明:✅ 为本站实查(arXiv 解析、GitHub/HF 放出状态);⚠️ 为作者/厂商自评或宣传口径(预印本未经第三方复现);待核 表示一手源未给出、不以外部记忆或常识补全。
