具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

WAM 全模型规格对比:29 篇细读横向一览

本页是什么:把本站 WAM 全部 29 篇细读拍平成三张横向对比表——「档案」「技术规格」「代表结果」。每个格值都取自对应细读页(细读页本身经多源核查),2026-06-10 整理、2026-06-11 增补 5 行(WAV / MotuBrain / OA-WAM / RoboDream / HiMem-WAM),2026-06-18 增补 Qwen-RobotWorld;绝大多数定量为提出方/厂商自评 ⚠️。VLA 主线的同类页面见 VLA 全模型规格对比

GPT-IMAGE2 生成的模型规格对比图:多模型卡片按主干、动作头、数据、频率、许可和本体形态横向排列

读图方式:WAM 规格表先看范式、未来预测形式与动作生成方式,再看主干/参数/数据和代表结果;第三张结果表只作口径索引,不能横向比强弱。

读表铁律(先读这个)

  1. 第三张表的数值不可横向比。各家用的基准、任务、口径完全不同:WALL-WMTask Progress 是 0–100 连续分、不是成功率;DreamZero 的「>2×」是对自家选定基线;Cosmos 3 的 RoboArena 名次随时间变动(本页为 2026-06 快照);τ0-WM 数值为论文作者自评(2026-06-11 已对照一手论文 2606.01027 校订,不再是媒体转述)。本表只回答「谁、什么范式、什么规格、开没开源」,不回答「谁更强」。
  2. 标记体例:⚠️ = 提出方自评(非第三方复现)/ ✅ = 经核查 / 待核 = 一手源未给,本站不编造(可开顶栏「可信度透镜」暗化存疑格)。
  3. 「机构:待核」≠ 没有机构——不少 arXiv 摘要不署机构,本站不以外部检索硬填;个别页面标注了「据公开检索/项目页,待核」的,原样保留。
  4. 行序 = 谱系图线序(范式)+ 线内时间,与首页路线卡、侧栏完全一致。

一、档案:谁 · 何时 · 什么范式 · 开没开源

模型范式(本站)机构发布 · arXiv开源(代码/权重)
UniPi级联·显式待核(摘要未明列)2023-02 · 2302.00111待核
Gen2Act级联·显式待核(摘要未明列)2024-09 · 2409.16283待核
Veo-Act级联·显式清华大学2026-04 · 2604.04502未释放代码/权重
VPP级联·隐式待核(页面未明列)2024-12 · 2412.14803待核
LAPA级联·隐式待核(摘要未明列)2024-10 · 2410.11758待核
DexWorldModel级联·隐式DexForce AI2026-04 · 2604.16484无代码/权重(论文 CC BY 4.0)
GR-1联合·自回归待核(推断字节系,页面标待核)2023-12 · 2312.13139待核
WorldVLA联合·自回归阿里达摩院2025-06 · 2506.21539代码开源(许可待核)
RynnVLA-002联合·自回归阿里达摩院2025-11 · 2511.17502代码+权重 Apache-2.0 全开
UWM联合·扩散待核(摘要未明列)2025-04 · 2504.02792待核
DreamZero联合·扩散待核(36 作者,lead S. Ye)2026-02 · 2602.15922待核
X-WAM联合·扩散待核(摘要未明列)2026-04 · 2604.26694待核
LingBot-VA联合·扩散蚂蚁集团灵波2026-01 · 2601.21998代码开源(许可待核)
τ0-WM联合·扩散智元 Finch/上海创智(罗剑岚团队)2026-06 · 2606.01027(v1 05-31)部分开源 ✅实查:VAM 权重+推理代码已放;ACVS 权重与 TTC 代码未放(称后续)
GR00T N2联合·扩散NVIDIA待核(预览,未释出)未释出(称年底可用,待核)
LaDi-WM联合·扩散国防科大/北大/深大系(据公开检索,待核)2025-05 · 2505.11528待核
WALL-WM联合·扩散自变量机器人(X Square)2026-06 · 2606.01955代码/权重未放出(仓 CC BY-NC-ND)
GigaWorld-Policy联合·扩散GigaAI 极佳视界2026-03 · 2603.17240未释放(项目页 CC BY-NC-SA)
WAV联合·扩散西湖大学 MiLAB(王东林组)·南大苏州2026-04 · 2604.14732部分 ✅实查:代码已放(Win-commit/WAV),权重未放、无 LICENSE
MotuBrain联合·扩散生数科技·清华 TSAIL(署名 MotuBrain Team)2026-04 · 2604.27792未开源 ✅实查(项目页 302 跳公司主页,无代码/权重)
UVA联合·混合Stanford(据项目页,待核)2025-03 · 2503.00200待核(有项目页)
FLARE联合·混合NVIDIA GEAR 等2025-05 · 2505.15659待核
OA-WAM联合·混合清华深圳 TBSI(丁文伯)·上交·NTU2026-05 · 2605.06481待核(文称已放 ckpt 与训练脚本,全文无链接、GitHub 检索无果)
HiMem-WAM联合·混合港大 × INFIFORCE × 华中科大等(6 机构 15 作者)2026-06 · 2606.10363(v1 06-09,观察级)未见开源 ✅实查(全文与摘要页均无代码/项目页链接)
Cosmos 3跨范式·基座NVIDIA Research2026-06 · 2606.02800OpenMDW-1.1 开源(可商用)✅
Qwen-RobotWorld跨范式·基座/数据引擎阿里巴巴 Qwen 团队2026-06 · 2606.17030官方博客公开;代码/权重待核
Genie Envisioner跨范式·平台智元 AgiBot2025-08 · 2508.05635代码开源(许可待核)
GE-Sim 2.0跨范式·仿真智元·北航·LV-NUS·天大2026-05 · 2605.27491待核(仅项目页)
RoboDream跨范式·数据引擎丰田研究院 TRI · USC2026-06 · 2606.02577未开源 ✅实查(repo 仅占位 README,"code release coming soon")

二、技术规格:预测什么 · 怎么出动作 · 多大 · 吃什么数据

WAM 的两条核心轴是「未来预测的形式/空间」(像素视频 / 潜表征 / 离散 token / 多模态)与「动作如何从预测中产生」(逆动力学抽取 / 联合去噪 / 同词表自回归 / 测试时搜索)。

模型未来预测(形式/空间)动作生成主干 / 参数训练数据
UniPi像素未来帧(文生视频)逆动力学从相邻帧抽动作待核互联网视频+语言嵌入;规模待核
Gen2Act人类视频(零样本生成)策略以生成视频为条件待核机器人数据比视频少一个量级 ⚠️
Veo-Act像素未来帧(Veo-3 生成)多头逆动力学 + π0.5 执行Veo-3(闭源)规划;IDM 用 DINOv3IDM:30万仿真+10万随机+15万真机帧对
VPPVDM 预测性视觉表征(潜空间)隐式逆动力学(条件于预测表征)预训练视频基础模型微调;参数待核机器人+互联网人类操作;规模待核
LAPA离散潜动作(刻画帧间变化)微调把潜动作解码为真实动作latent VLA;参数待核互联网级无动作视频+机器人微调
DexWorldModel未来 DINOv3 潜特征(不回像素)动作流匹配解码动作块(τ=16)MoT,自 Wan2.2-5B 初始化RoboMind+AgiBot+InternData-A1;合成后训练
GR-1未来图像帧(自回归)独立动作头(与视觉解耦)GPT 式因果 Transformer;~195M(据综述,待核)视频生成式预训练+机器人微调
WorldVLA未来图像(统一离散词表)同词表自回归+注意力掩码Chameleon 基 MLLM;约 7B(据综述)待核
RynnVLA-002下一帧图像(65,536 统一词表)离散动作 token + 连续动作头Chameleon 基自回归;基座参数待核真机自采约 500 条示范 + LIBERO
UWM像素视频(2D)视频+动作统一扩散联合去噪统一 transformer;参数待核多任务机器人数据+无动作视频
DreamZero未来视频帧(显式)视频-动作同序列联合去噪Wan2.1 基;14B 自回归视频扩散 ⚠️异构机器人数据;规模待核
X-WAM多视角 RGB-D 视频(4D)异步去噪 ANS:动作少步快解预训练视频扩散 DiT;参数待核>5,800 小时机器人数据 ⚠️
LingBot-VA近未来视频帧交错自回归(MoT 共享潜空间)MoT;参数待核待核
τ0-WM多视角未来潜变量(联合流匹配)测试时搜索(升级式):RCS 初筛→不可靠才 ACVS 推演+LAR 修正5.5B(5B Wan2.2 视频 DiT + 0.5B 动作分支)27,300h(真机17.8K+UMI6.5K+人类3K+rollout/失败轨迹)
GR00T N2潜空间目标转移表征Joint Video-Action DiT待核(预览未释出)大规模视频预训练;待核
LaDi-WMVFM 对齐潜表征演化(DINO+CLIP)扩散策略+预测态迭代精炼潜扩散+VFM;参数待核待核
WALL-WM多视角未来视频(事件锚定)动作 DiT(单向跨注意力+流匹配)Wan2.2-5B 塔+动作 DiT+冻结 Qwen3.5-9B多本体+无本体+少样本锚定;总规模待核
GigaWorld-Policy未来视频(动作中心,推理可关)流匹配 ODE;推理跳过视频分支Wan 2.2 DiT;5B~10,000 小时人类 ego+真机 ⚠️
WAV多视角未来视频潜轨迹 + 轨迹价值(回报作 flow 生成目标)流匹配动作块;推理时潜噪声空间 MPPI 式迭代(K≈3)收敛后一次解码2.2B ⚠️;DiT + 冻结 T5-XXL,README 实查依赖 GE-Base-fast + LTX-Video 组件无自述大规模预训练(承 GE-Base 底座);LIBERO 微调 + 真机 Piper 自采
MotuBrain视频流(UniDiffuser 统一调度两路连续模态)三流 MoT(text/video/action),中段 50% 层 V-A 联合注意,flow matching视频基座为生数 Vidu;参数量未公布(待核)四级数据金字塔(互联网视频→ego→异构本体→目标本体);绝对规模未公布(待核)
UVA视频-动作联合潜表征动作扩散头(推理跳过视频头)Transformer+VAE(kl-f16);参数待核每任务约 500 条真机轨迹
FLARE未来观测潜表征(不重建像素)动作流匹配+潜表征对齐损失流匹配 DiT;参数待核机器人示范+人类 ego 视频
OA-WAM逐对象槽位状态回归(N+1 槽,addr 32d + cnt 256d,MSE;非像素/视频 token)流匹配动作头(16 步动作块,4 步 Euler)~7B Chameleon 风格主干(暖启 Chameleon-7B)三阶段全仿真/开源:Stage0 ~2.5T token(web 60% + OXE 20% + DROID/RoboCasa/Bridge),~166k A100-h
HiMem-WAM多视角光流潜动作(DPFlow,仅训练期监督;推理因果、不生成未来)分层潜动作链:Qwen3-VL planner 出 skill latent → executor 展开低层动作块 → 解码器出控制planner = Qwen3-VL-4B;总参数待核待核(以细读页为准)
Cosmos 3五模态生成(视频/图/音/动作)生成塔直出 JSON 动作 tokenMoT 两塔;Nano 16B / Super 64B ⚠️~20T 多模态 token ⚠️(动作仅约 0.6%)
Qwen-RobotWorld语言条件未来视频轨迹(操作/驾驶/导航/人机迁移)非直接策略;自然语言作 action interface,生成未来视觉用于数据/评测/规划冻结 Qwen2.5-VL 7B action encoder + Wan-VAE 127M + MMDiT 20BEWK:8.6M video-text pairs / 200M+ frames;20+ embodiments / 500+ action categories ⚠️
Genie Envisioner指令条件视频(结构化潜空间)GE-Act 流匹配解码出动作GE-Base 视频扩散底座;参数待核~3,000h / >100 万 episodes ⚠️
GE-Sim 2.0多视角未来画面+16 维本体状态不直接出动作(闭环模拟器)Cosmos-Predict2-2B 基;2B数千小时真机(重训)⚠️
RoboDream多视角 photorealistic RGB 演示视频(机器人运动作渲染锚点,条件化场景/对象先验)非策略:数据合成引擎(下游统一 Diffusion Policy 另训)Cosmos-Predict2 2B 微调DROID ~40k episodes(限有相机标定);2×8 A100 约一周

三、代表结果:各家口径,禁止跨行比数值

模型主要评测头条结果(原页口径)
UniPi待核(摘要未给基准)摘要未给任何定量(待核)
Gen2Act真实世界多场景(自建)零样本操作未见物体/新动作(定性 ⚠️)
Veo-Act仿真+真机灵巧手(基线 π0.5/VPP)仿真 0.50→0.80、真机 0.25→0.79 ⚠️
VPPCALVIN ABC-D + 真机CALVIN 相对 SOTA +18.6%、真机灵巧 +31.6% ⚠️
LAPA真实世界操作(未具名)超 SOTA VLA(定性)⚠️;数值待核
DexWorldModelRoboTwin(50 任务)+ 真机零样本RoboTwin 94.00% ⚠️;零样本超真机微调基线
GR-1CALVIN标准 94.9%(基线 88.9%)、零样本 85.4% ⚠️
WorldVLALIBERO优于独立动作/世界模型(定性 ⚠️;数值待核)
RynnVLA-002LIBERO + 真机 SO100LIBERO 均 97.4% ⚠️;真机去世界模型 80→30 ⚠️
UWM待核更泛化更鲁棒(定性 ⚠️,无数值)
DreamZero真机新任务/新环境(自选基线)较 SOTA VLA >2×;14B @7Hz 闭环 ⚠️
X-WAMRoboCasa / RoboTwin 2.079.2% / 90.7% 平均成功率 ⚠️
LingBot-VARoboTwin 2.0-Plus(第三方研究)原文无定量;第三方报 74.2% ⚠️
τ0-WM四项自建长程任务(Toolbox/School Bag/Faucet/Badminton,基线 π0.5/Fast-WAM)自评平均最高(Fig.4 图形,逐任务数值论文未列);TTC 消融(单次尝试)均值 0.43→0.60、Pen→Box 0.30→0.50 ⚠️
GR00T N2MolmoSpaces / RoboArena称较领先 VLA 高 2×、两榜第一 ⚠️(预览,不可复核)
LaDi-WMLIBERO-LONG + 真机LIBERO-LONG +27.9%、真机 +20% ⚠️
WALL-WM真机自建四套件Task Progress(0–100,非成功率)事件模式全胜 ⚠️
GigaWorld-PolicyRoboTwin 2.0 + AgileX 真机较 Motus ≈9× 加速、成功率 0.83 ⚠️
WAVLIBERO 四套件(单模型)+ 真机 Piper 三任务LIBERO 均值 98.1 ⚠️(99.6/100.0/98.6/94.4,本站逐格核对口径自洽);真机较 GE-ACT 35.6%→75.6% ⚠️
MotuBrainRoboTwin 2.0 + WorldArenaRoboTwin clean/randomized 95.8/96.1 ⚠️(自评榜首;π0.5 82.7/76.8);WorldArena EWMScore 63.77 ⚠️
UVAPushT/Libero10 + 真机 UMILibero10 0.93、PushT 0.98;推理 0.23s(UniPi 24.07s)⚠️
FLARERoboCasa(24)+ GR-1 tabletop(24)多任务 SOTA、较基线最多约 +26% ⚠️
OA-WAMLIBERO + SimplerEnv WidowX + LIBERO-Plus(OOD 留出)LIBERO 均值 97.8 ⚠️(较 VLA-JEPA +0.6);SimplerEnv 79.3 ⚠️;LIBERO-Plus 几何轴自评 SOTA
HiMem-WAMLIBERO + LIBERO-PLUS(零样本)+ RMBench + 真机LIBERO 97.7 ⚠️;LIBERO-PLUS 76.0 ⚠️;RMBench 26.3 ⚠️;真机硬任务较 π0.5 +22.5% ⚠️(v1 仅 2 天,观察级)
Cosmos 3RoboArena发布登顶(1881),约 2 天后被 Spirit v1.6(1924)反超 ⚠️(2026-06 快照)
Qwen-RobotWorldEWMBench / DreamGen / WorldModelBench / PBenchEWMBench 4.60、DreamGen 4.952、WorldModelBench 8.99、PBench 0.804 ⚠️(视频世界模型 benchmark,非策略成功率)
Genie Envisioner待核(无统一第三方评测)GE-Act 200ms 出 54 步轨迹;新本体 1h 示范 ⚠️
GE-Sim 2.0WorldArena2B 登顶(称超 Sora/Veo)⚠️;过滤式 BC 真机 +15pp ⚠️
RoboDream自建 4 真机任务(Franka/DROID;部分成功计半分)Real-50 36.3% → 混合生成数据 62.5%,Mix-200 72.5% 后饱和 ⚠️;prop-free 采集 ~2.2× 快 ⚠️

四、几条跨行观察(只谈格局,不比数值)

  • 基座收敛:2026 年的新一批(DexWorldModel / WALL-WM / GigaWorld-Policy / DreamZero)不约而同地从 Wan 系视频生成模型初始化——视频生成基座正在成为 WAM 的「公共底盘」;NVIDIA 系则自带 Cosmos 底座(GE-Sim 2.0、RoboDream 均基于 Cosmos-Predict2)。但 2026-04 之后的新批显示底盘在多元化:MotuBrain 用生数 Vidu、WAV 实查依赖 GE-Base/LTX-Video——「Wan 一统」并未发生。
  • 「像素 vs 潜空间」分野贯穿三类范式:像素派(UniPi / UWM / DreamZero / WALL-WM)赌「看得见的未来」带来可解释与数据引擎能力;潜空间派(VPP / LAPA / LaDi-WM / FLARE / DexWorldModel / GR00T N2)赌实时性与表征效率——后者在 2025H2 起明显增多。
  • 推理期把世界模型「关掉」成为新趋势:GigaWorld-Policy(因果掩码,可跳视频分支)、UVA(推理跳过视频头)、RynnVLA-002(解耦查询,作策略时不 roll out 未来帧)殊途同归——训练期联合、推理期轻装。
  • 开源谱系两极:Apache-2.0 全开(RynnVLA-002)与 OpenMDW 可商用(Cosmos 3)在一端;多数处于「代码开源但许可待核」或「论文先行、权重未放」之间;真正第三方可复核的评测在本表中几乎缺位——这正是 WAM 相比 VLA(有 RoboChallenge / LIBERO 公共基准传统)更年轻的标志。

📌 配套阅读:WAM 总览(定义 / taxonomy) · VLA 全模型规格对比(姊妹页)· 评测基准全景 · 谱系图见 WAM 总览 开头(按时间轴)。各格出处 = 对应细读页;发布年月 = arXiv ID 前四位派生(无 ID 者按站内核对口径标注)。