GE-Sim 2.0 细读
WAM 论文细读 · 世界模拟器 / 数据引擎(动作条件视频生成 + 本体状态 + 奖励)· arXiv:2605.27491(v1 2026-05-26) 机构:智元 AgiBot · 北航(BUAA)· LV-NUS Lab · 天津大学(颜水成 / 刘偲 / 姚卯青 / 任广辉 等)· 项目页 ge-sim-v2.github.io← WAM 总览 · 主报告
TL;DR
GE-Sim 2.0 是 Genie Envisioner 的正代升级:把「动作条件视频世界模型」从只会生成画面,补成一个面向双臂操作的闭环视频世界模拟器。它在 GE-Base 多视角文生视频底座上加了三件东西,正好补齐「用世界模型做策略仿真」缺的三块能力:
- 本体状态解码器(proprioceptive state decoder):一个轻量并行 transformer 分支,从视觉专家特征里流匹配预测 16 维关节状态(双臂各 7 关节角 + 夹爪开合),让现代策略拿到它们需要的本体反馈,而不只是像素。
- 自动成功打分模块(World Judge):一个视觉-语言奖励模型(冻结编码器 + 可训 LM 头),逐帧二分类判定成功,用类别平衡交叉熵训练 —— 把「人工看结果」换成模型自动评分。
- 推理加速:DMD2 步蒸馏把多步扩散压到 4 步,加随机步长训练支持推理时 4× 跳帧,做到「单张 H100 上 2.3 秒生成 25 帧 rollout」。
主干为 2B 的 Cosmos-Predict2-2B-Video2World 扩散 transformer,动作以**射线图(ray map,6 通道相机几何)+ 末端位姿图(EE pose map,3 通道)**做空间对齐条件,多视角分块自回归生成 + 稀疏记忆。作者自评(⚠️):仅 2B 参数即登顶公开 WorldArena 榜(自称超过 Sora、Veo),并能用「过滤式 BC」在真机把策略成功率平均 +15 个百分点。
⚠️ 可信度提示:WorldArena 虽是公开榜,但本页引用的「登顶 / 超过 Sora、Veo」「+15pp」「闭环一致性 81%」「World Judge 79% 准确率」等全部为作者论文自评数字,非独立第三方复现;榜单名次为论文「写作时」快照。本站不把它们当既成事实,定量均按自评标注。
一、定位与动机
现有的动作条件视频模型能生成「看着像真的」的 rollout,但拿来当策略仿真器时缺三样:① 不给现代策略需要的本体状态(只出画面);② 只渲染、不判定结果;③ 吞吐不够,撑不起大规模并行评估。而经典物理仿真器又在接触动力学、可形变物体、视觉保真上吃力。
GE-Sim 2.0 的定位因此是一个闭环视频世界模拟器:既生成未来多视角画面,又解码本体状态、又自动打分,且快到能做规模化 rollout —— 让世界模型既能评估策略、又能产出数据改进策略。在本站「世界模型三定位」框架里(见 具身数据全景 §4.1),它属于 ① 数据引擎 / 模拟器 一类,而非直接当策略主体。
二、方法与架构
主干为 Cosmos-Predict2-2B-Video2World(2B)扩散 transformer,沿用 Genie Envisioner 的 GE-Base 多视角文生视频底座与 GE-Sim 的动作条件框架,在「数千小时真机数据」上重训,并新增三个闭环模块。
2.1 动作条件:射线图 + 末端位姿图
动作不再走文本条件,而是空间对齐的几何条件:ray map(6 通道,编码相机几何)+ EE pose map(3 通道,渲染夹爪位置 / 朝向 / 开合)。多视角分块自回归生成,配稀疏记忆。
2.2 本体状态解码器
一个轻量并行 transformer 分支,消费视觉专家的特征,流匹配预测 16 维关节空间状态(双臂各 7 关节 + 夹爪)。用各视觉层加权融合:
2.3 自动成功打分(World Judge)
视觉-语言奖励模型(冻结编码器 + 可训 LM 头),输入多视角帧 + 子任务 caption,逐帧输出成功 logit,类别平衡交叉熵训练。把「人工检查结果」自动化,使闭环 rollout 能自评成败。
2.4 推理加速
两路并举:① DMD2 步蒸馏把多步扩散降到 4 步;② 随机步长训练让推理时可 4× 跳帧。合起来「25 帧 rollout / 2.3 秒 / 单 H100」,相对基线约 25× 吞吐(自评)。
2.5 保真增强
- 记忆帧误差模拟增强:对分布漂移更鲁棒。
- 历史状态增强(时间索引扰动、轨迹重采样):提升 sim-to-real 保真。
三、实验与关键结果
⚠️ 以下均为作者自评,非第三方复现;WorldArena 名次为论文写作时快照。
- WorldArena(自评):GE-Sim 2.0 以 2B 参数登顶公开 WorldArena,自称超过 Sora、Veo。
- 重放指标 vs Ctrl-World / DreamDojo:头视角 PSNR +3.96 dB、FID 减半(32.3 vs 62.7);多视角 FID -31.9;FVD 481 vs 1084。
- 闭环策略一致性:episode 级准确率 81%(vs Ctrl-World 63%),召回 82% vs 25% —— 较好保留真机任务成败模式。
- World Judge:在模拟 rollout 上成功分类准确率 79%(vs Qwen3.5-122B 的 60%),事件距离 28.2 帧 vs 57.8。
- 过滤式 BC 改进策略:真机平均成功率 +15pp(倒水 40%→55%、拔插头 45%→65%)。
- 长程稳定性:整段 50 秒 rollout 的 PSNR 衰减 <4 dB(基线 5+ dB)。
四、与本站谱系的关系
- Genie Envisioner 正代升级。与已收录的 Genie Envisioner 同属智元 AgiBot 体系:初代是「统一世界平台 / 表征型世界模型」,GE-Sim 2.0 把它推成可闭环交互的模拟器(出状态、出奖励、能加速)。
- 世界模型作「数据引擎 / 评估器」的代表。与 Cosmos 3(全模态世界模型平台)、DreamGen(神经轨迹放大)同属「① 数据引擎」定位(见 具身数据全景 §4.1);区别是 GE-Sim 2.0 专攻双臂操作的闭环评估 + 过滤式数据筛选,且自带本体状态与奖励。
- 以 Cosmos 为底座、做机器人专用化。主干取 Cosmos-Predict2-2B,叠加动作条件 + 本体 + 奖励 + 加速,是「把通用视频基座改造成机器人世界模拟器」的一条实路。
- 与智元 GO 系 / τ0-WM 同生态。同体系还有 τ0-WM(测试时搜索的世界-动作模型)、GO 系策略;GE-Sim 2.0 更偏「环境侧」(模拟 + 评估),可与「策略侧」对读。
五、局限与存疑
- 全为自评:WorldArena 名次、重放指标、+15pp、World Judge 准确率均为作者报告,无第三方统一复现;榜单为写作时快照。
- 接触丰富仍难:抓取状态、时机判定仍有残余误判;液面高度、火焰转移类检测(倒水、借火任务)不完整。
- 单一双臂本体:当前训练限于单一双臂本体,跨本体泛化未验证。
- World Judge 是外挂模块:奖励模型独立于生成器;论文把「统一模型联合预测帧 + 状态 + 奖励」列为未来工作。
- 依赖大规模真机数据 + H100 级算力:重训于「数千小时真机数据」,2.3s/25 帧的吞吐建立在单 H100 上,落地成本需注意。
参考文献
- GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation. arXiv:2605.27491(v1 2026-05-26)。作者:Boxiang Qiu, Liliang Chen, Yue Liao, …, Shuicheng Yan, Si Liu, Maoqing Yao, Guanghui Ren。机构:智元 AgiBot · 北航 · LV-NUS Lab · 天津大学。https://arxiv.org/abs/2605.27491 · 全文 https://arxiv.org/html/2605.27491v1
- 项目页:https://ge-sim-v2.github.io/
- 前作:Genie Envisioner 细读
体例声明:本页 ⚠️ / 自评项为论文作者报告,截至发布无第三方统一复现;WorldArena 名次为论文写作时快照,引用请连同自评属性保留。
