具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

RynnVLA-002 细读

WAM 论文细读 · 联合 · 自回归(统一离散:单一 Chameleon 基自回归主干,next-frame + next-action 共享一张 65,536 词表,联合共训) · arXiv:2511.17502(v1 2025-11-21,v2 11-24,v3 2026-05-30) 机构:阿里达摩院(Alibaba DAMO Academy;据 GitHub 组织 alibaba-damo-academy 与同门 WorldVLA 同核心团队)· 代码 GitHub alibaba-damo-academy/RynnVLA-002(Apache-2.0)· 权重 HuggingFace Alibaba-DAMO-Academy/RynnVLA-002← WAM 总览 · 主报告

TL;DR

RynnVLA-002 的一句话主张:把 VLA(视觉-语言-动作)与世界模型并进同一个自回归框架、共享同一套权重联合共训,让二者相互增强。它建在 Chameleon(统一图像理解与生成的自回归模型)之上,用各自的 tokenizer 把图像、文本、状态、动作离散化后塞进同一张 65,536 的词表;训练时同时优化两个目标——VLA 目标(由语言、状态、观测历史预测动作,Eq.1)与世界模型目标(由历史观测 + 历史动作预测下一帧图像,Eq.2),两类任务按 1:1 采样,在单一微调阶段、不做额外大规模机器人预训练就完成训练。

与前作 RynnVLA-001 最关键的差别在于世界模型的角色升级:001 把未来帧预测当作预训练目标(分阶段先学、再迁移到机器人);002 则把动作预测与「以动作为条件的视觉预测」放进同一个建模空间联合共训——用论文原话,「与其只把世界模型当外部奖励、模拟器或预训练信号,RynnVLA-002 让动作预测与动作条件视觉预测共享同一建模空间,使两种能力在一个框架内彼此改进」(§2.1)。自评结论:RynnVLA-002 优于单独的 VLA 模型与单独的世界模型 ⚠️,佐证「互增强」。

成绩:LIBERO 四套件平均 97.4%(连续动作,无预训练) ⚠️;真机(LeRobot SO100)消融里,去掉世界模型后单目标成功率从 80% 跌到 30%——这正是摘要所称「整合的世界模型把整体成功率提升 50%」的来源(单目标 80−30 = +50 个百分点)⚠️。代码与权重已 Apache-2.0 开源。

⚠️ 可信度提示:arXiv ID ✅ 已核(标题逐字一致;GitHub 组织 alibaba-damo-academy、作者团队与 WorldVLA 高度重合,主作者同为 Jun Cen)。下列全部成功率均为作者论文自评 ⚠️:LIBERO 虽是公开基准但成绩由作者自跑、且强调「无额外机器人预训练」;真机为自采 LeRobot SO100、trials 数较小,非独立第三方复现。重要更正:本篇把 002 概括为「世界模型在推理期实际参与控制」并不准确——论文明确说作 VLA 策略时不 roll out 未来帧来控制(见 §2.4);「互增强」发生在训练期。基座参数量论文未给出(待核)。

一、定位与动机

VLA 动作模型与世界模型常被分开训练:世界模型擅长据当前观测 + 动作预测未来图像、隐式学到环境物理;VLA 模型擅长据观测生成动作。RynnVLA-002 延续同门 WorldVLA 的论点——把二者整合进单一自回归框架,世界模型学到的物理先验能改进动作,动作模型对图像的理解又能帮世界模型生成,形成双向增强,而非各自为政。

它要回答的真正问题是:怎样让世界模型不只是「训练前的先验来源」,而是与动作策略「长在同一套权重里」的共训对象。论文在相关工作里把自己与既有的视觉生成式 VLA 区分开(§2.1):

  • 一类把世界模型当外部奖励 / 模拟器(规划、想象式 rollout);
  • 一类把未来预测当预训练信号——论文点名 RynnVLA-001把未来视频预测当作一个强力的预训练目标」(§2.1,jiang2025rynnvla)。

RynnVLA-002 的回答是第三种:共享同一建模空间的联合共训——动作与「动作条件下的视觉预测」用同一张词表、同一主干、同一前向被一起优化。

二、方法与架构

2.1 基座与 token 化:Chameleon + 统一 65,536 词表

  • 基座:建在 Chameleon(统一图像理解与生成的自回归模型)之上(§2.1)。
  • 统一词表:图像、文本、状态、动作各用独立 tokenizer 编码,但所有模态 token 共享同一张词表(§1);词表规模 65,536(§3.2)。
  • 各模态 tokenizer(§3.2):图像用 VQ-GAN(码本 8,192,16× 压缩);文本用 BPE;状态 / 动作按每维离散化为 256 个 bin
  • 多视角:第三人称 + 腕部相机,VLA 与世界模型两路均支持(据 GitHub README)。

2.2 两个目标:next-action 与 next-frame 同框联合

同一自回归主干上同时建模两件事:

  • VLA 目标(Eq.1):由语言指令 l、本体状态 s 与观测历史 o 预测当前动作 a_t,即 a_t ∼ π(a_t | l, s_{t-1}, o_{t-h:t})
  • 世界模型目标(Eq.2):由历史观测与历史动作预测下一帧图像 ô_t,即 ô_t ∼ f(o_t | o_{t-h:t-1}, a_{t-h:t-1})

两类任务按 1:1 采样联合训练(§3.2),且在单一微调阶段完成,不做额外大规模机器人操作预训练(§4.1)。论文把这套「动作预测 + 动作条件视觉预测共享同一建模空间」当作互增强的机制基础。

2.3 动作生成:注意力掩码(承自 WorldVLA)+ 连续 Action Transformer 头

两条来自贡献列表(§1)的设计:

  • 离散动作块的注意力掩码策略:针对「自回归逐个生成动作序列时误差会向后累积」的老问题,在生成当前动作时选择性掩蔽先前动作——这正是 WorldVLA 提出的注意力掩码机制在本篇的延续
  • 额外的连续 Action Transformer 头:在离散动作 token 之外加一个连续动作头,换取更强泛化与更平滑轨迹;论文指出该头显著小于基座 LLM,有助于缓解过拟合(§3.3)。
  • 训练损失(§3.3):ℒ = 离散动作损失 + 图像损失 + α·连续动作损失,其中 α = 10

2.4 推理:解耦查询——作策略时不生成未来帧(关键澄清)

这是本篇与「世界模型推理期参与控制」的常见误读最该划清的地方。论文原文:

  • 尽管 RynnVLA-002 同时支持动作预测与未来图像预测,但单次推理调用只执行被查询的那一个任务。」
  • 作为 VLA 策略时,模型消费语言指令、本体状态与视觉历史来生成动作(经离散动作 token 或连续 Action Transformer),它不会为了控制而 roll out 未来图像。
  • 这种解耦查询避免把自回归图像预测的误差累积引入实时动作生成环。

也就是说:002 在推理控制环里同样不生成未来帧——与 001「推理时丢弃未来视觉 token、只出动作」其实同向。002 的真正差异不在「推理期世界模型直接控制」,而在「世界模型从预训练信号升级为与动作共享同一套权重的联合共训对象」——因此即便推理时只查询动作,所用权重也已被世界模型目标共同塑造。互增强的证据来自训练后的效果(自评优于单独 VLA / 世界模型,以及下文 Table 5 的真机消融),而非推理期的帧 rollout。

2.5 001 ↔ 002 对照(最重要的一组对读)

维度RynnVLA-001(2509.15212)RynnVLA-002(本篇)
世界模型角色未来帧预测作预训练目标,分阶段后迁移与动作预测共享同一建模空间联合共训(1:1)
训练流程三阶段(ego 视频 → 人手轨迹 → 机器人)单一微调阶段,无额外大规模机器人预训练
推理是否 roll out 未来帧否(只出动作)否(解耦查询;作策略时不 roll out 未来帧)
「互增强」体现处—(视频仅作预训练先验)训练期:自评优于单独 VLA / 世界模型 ⚠️
动作表征ActionVAE 连续隐向量离散动作 token + 注意力掩码,外加连续 Action Transformer 头
基座Chameleon 扩展为 I2V(7B 级)Chameleon(参数量论文未给,待核)

三、实验与关键结果

下列均为作者自评 ⚠️。

3.1 LIBERO 仿真(Table 1)

「无预训练」即指单一微调阶段、不加额外机器人预训练。连续动作为论文头条口径(平均 97.4%);离散动作为另一变体。

任务套件连续动作 ⚠️离散动作 ⚠️
LIBERO-Spatial99.094.2
LIBERO-Object99.896.8
LIBERO-Goal96.494.6
LIBERO-Long(10 任务)94.487.6
平均97.493.3

来源:连续动作四项与平均、离散平均 93.3 据 Table 1(§4.1);离散动作分项据 GitHub README「Model Zoo」对应指标(与 Table 1 离散平均 93.3 自洽:四项均值正为 93.3)。摘要「LIBERO 97.4%、无预训练」与 Table 1 一致 ✅(数值本身仍为作者自评 ⚠️)。

3.2 真机(LeRobot SO100)与世界模型消融(Table 5)

  • 平台:LeRobot SO100 机械臂;前置相机 + 腕部相机(与 RynnVLA-001 同系机器人配置);并用本体状态。
  • 任务与数据(§4.2):方块入圈(248 条示范)、草莓入杯(249 条示范),含多目标 / 带干扰物变体。
  • 消融(Table 5,连续动作)——「加 / 不加世界模型」对照:
设定(连续动作)去掉世界模型(Table 5 行④)⚠️加入世界模型(Table 5 行⑤)⚠️
单目标30.080.0
多目标10.080.0
带干扰物050.0

摘要「整合的世界模型把整体成功率提升 50%」= 单目标 80 − 30 = +50 个百分点 ⚠️(§4.3 消融)。这是「联合共训的世界模型确实让被部署的动作策略更好」的最直接证据——但它佐证的是共训之效,不是「推理期世界模型直接控制」。

3.3 自评要点

  • 优于单独的 VLA 与单独的世界模型 ⚠️(贡献列表,§1):论文据此主张二者「相互增强」。
  • 注意力掩码缓解离散动作块自回归生成的误差累积(§1 贡献、承自 WorldVLA);连续 Action Transformer 头换取更强泛化与更平滑轨迹(§3.3)。

四、与本站谱系的关系

  • 同门直系:WorldVLA(2506.21539,达摩院)。 主作者同为 Jun Cen、作者团队高度重合;RynnVLA-002 直接继承 WorldVLA 的「统一动作世界模型」主张与注意力掩码机制,可视为其在 Chameleon + 统一 65,536 词表、加入连续动作头、补上 LIBERO 强成绩后的延续。两者在本站同归 联合 · 自回归(统一离散)
  • 最重要的对照:前作 RynnVLA-001(2509.15212,达摩院)。 同走 Chameleon 自回归路线,但 001「世界/视频预测仅作预训练、之后迁移」,002「世界模型与动作共享同一建模空间联合共训」——这组对读正刻画「世界模型从预训练先验共训对象」的演进(详见 §2.5)。
  • 同格邻居:GR-1(字节系)。 同属「联合 · 自回归」,但 GR-1 是显式解耦(视觉/动作经各自独立输出头),RynnVLA-002 / WorldVLA 走统一离散(共享词表、共享 next-token 通道)。这条「解耦 vs. 统一」之分,是自回归 WAM 内部的关键分野。
  • 范式归位:本站 taxonomy WAM · 联合 · 自回归(统一离散)——视觉与动作量化进同一词表、由共享自回归主干联合建模,并以「单框架内 VLA × 世界模型互增强」为切口。

五、局限与存疑

  1. 全部成功率为作者自评 ⚠️:LIBERO 虽公开但成绩自跑(且强调「无预训练」这一有利设定);真机仅 LeRobot SO100、任务面窄(方块入圈 / 草莓入杯)、trials 数小,无独立第三方复现。
  2. 「推理期世界模型参与控制」是常见误读:论文明确为解耦查询——作策略时不 roll out 未来帧(§2.4)。互增强是训练期效应,由 Table 5 消融间接佐证;若按「推理期世界模型实际参与」来理解本篇,与原文不符,宜更正。
  3. 互增强的因果尚不充分解耦:Table 5 显示「有/无世界模型」差距巨大(+50 点 ⚠️),但这是「联合共训 vs. 仅动作训练」的对比,世界模型究竟通过何种表征改进动作、与单纯多任务正则的区别有多大,论文未给更细的解耦分析(待核)。
  4. 基座规模未公开:论文只说连续 Action Transformer 头「显著小于基座 LLM」,未给出基座参数量(待核);仅知建在 Chameleon 上(前作 / 同门为 7B 级)。
  5. 真机评测面窄:单臂 SO100、桌面抓放为主,未覆盖双臂 / 灵巧 / 长程,泛化与鲁棒性仍待更广验证(待核)。

参考文献

体例声明:本页 arXiv ID 经 ✅ 核验(标题逐字一致、GitHub 组织与作者团队佐证机构);一切成功率 / 提升幅度为作者自评 ⚠️,非第三方复现,LIBERO 为公开基准但成绩自跑。架构事实(Chameleon、65,536 词表、VQ-GAN 8,192、256 bin、Eq.1/Eq.2、α=10、1:1 采样、单阶段、注意力掩码、连续 Action Transformer 头)均注明节/式号。基座参数量论文未给出,标「待核」,不以外部记忆补全。「002 推理期世界模型参与控制」与原文不符,已据 §2.4 更正。引用数据请连同 ⚠️ 一并保留。