具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

RL Token:用紧凑「RL 读出」在冻结 VLA 上引导在线强化学习

arXiv: 2604.23073(v1 2026-04-24) 机构: Physical Intelligence(Charles Xu, J. T. Springenberg, Michael Equi, Ali Amin, Adnan Esmail, Sergey Levine, Liyiming Ke) 路线: VLA 在线 RL 后训练方法 —— 冻结大 VLA、压出一个紧凑「RL token」读出表征,在其上训练小型 actor-critic 做离策略在线 RL,把强化学习框成「对 VLA 参考动作块的局部精炼类型: 方法 / 训练技巧(非新基座模型)

← 返回主报告


TL;DR

RL Token(论文简称 RLT)是 Physical Intelligence 给出的一个轻量在线 RL 后训练方法,解决一个具体矛盾:VLA 泛化广,但在「精度苛刻、长程接触」任务上不够稳;而要补这块,整模型 RL 太慢、不适合快速在线适配,数据高效的轻量 RL 又往往牺牲 VLA 的泛化。RLT 想同时要「VLA 的泛化」与「轻量在线 RL 的速度与样本效率」。

它的做法有三个支点:

  1. RL token = 一个紧凑「读出」表征:在 VLA 的 token 嵌入后追加一个可学习嵌入,过一个编码器 transformer,再用自回归重建损失训练一对编解码器 —— 解码器必须从这个瓶颈里重建原始嵌入,从而逼它保留任务相关的预训练知识、同时足够紧凑
  2. 在冻结 VLA 之上挂小 actor-critic:冻结的 VLA 提供固定的 RL token + 参考动作块;小型 actor-critic 以 RL token 为状态、做离策略训练;actor 接收状态 + VLA 参考动作,输出精炼后的动作分布,并以 L2 正则锚向参考动作(系数 β),用「参考动作 dropout」(50% 批次遮蔽参考)防止 actor 塌缩。
  3. 把 RL 框成「局部精炼」:正则把学习锚在 VLA 行为附近,使探索变成「对有希望行为的局部精炼」,而非从零学起;且 RL 作用在**动作块(chunk,C=10)**上,缩短信用分配的时域。

基座为 π0.6(输出 50 步动作块 @ 50 Hz、14 维动作)。作者自评(⚠️):在拧螺丝、扎扎带、插网线、插充电器等亚毫米精度任务上,关键阶段成功率与吞吐显著提升(如拧螺丝 20%→65%、多任务约 3× 吞吐),且数分钟到数小时真机练习即见效。

⚠️ 可信度提示:下列全部成功率 / 加速倍数(20%→65%、3×、+40%/+60% 等)均为作者自评,在 PI 自有真机任务上得到,无独立第三方复现;RLT 训练期仍需人工介入(给奖励、纠正、在 RL 与基策略间切换),是「关键阶段」精炼而非全任务端到端自治。


1. 要解决的问题

VLA 的泛化来自大规模预训练,但模仿学习的上限是演示分布:在需要亚毫米精度、强接触、长时程的任务(插接、装配)上,纯模仿常卡在「差一点」。要突破,自然想到 RL。但两条现成路都有代价:

  • 整模型 RL(在线微调整个 VLA):算力 / 样本开销大,不适合快速在线适配;
  • 轻量 / 隐空间 RL:样本高效,但常牺牲 VLA 的泛化(把大模型能力蒸没了)。

RLT 的问题陈述就是这句:「如何既利用 VLA 的泛化,又获得轻量在线 RL 的速度与样本效率?」 它的答案是——不动 VLA,只在它的一个紧凑读出上做 RL,并把 RL 限定为对 VLA 参考动作的局部精炼


2. 方法与架构

2.1 RL token:从冻结 VLA 压出的「读出」瓶颈

在 VLA 的 token 嵌入序列后追加一个可学习嵌入,经编码器 transformer 得到一个压缩读出表征(RL token)。训练一对编码器-解码器,用自回归重建损失要求解码器从这个瓶颈重建出原始嵌入 —— 瓶颈被逼着保留任务相关的预训练知识,同时维持紧凑。直觉:把「十亿参数模型的表征」压成一个 actor-critic 吃得动的小状态。

2.2 在冻结 VLA 上的离策略在线 RL

  • 冻结 VLA 提供固定的 RL token 与参考动作块;
  • 小型 actor-critic 在 RL token 上离策略训练;actor 输入「状态 + VLA 参考动作」→ 输出精炼动作分布(直接对 VLA 提案做精炼,而非预测残差或调制隐变量);
  • BC 正则:以 L2 惩罚把策略锚向参考动作(系数 β);
  • 参考动作 dropout:50% 训练批次遮蔽参考,防 actor 塌缩成「照抄参考」。

2.3 训练配方

  1. 适配 + 训瓶颈:在任务演示上适配 VLA,同时训练 RL token 编解码器;
  2. warmup:用冻结 VLA 跑若干 episode 预填回放缓冲;
  3. 在线环:执行「冻结 VLA 动作」或「RL 精炼动作」,存转移,做 TD3 式离策略更新(高 update-to-data 比,5∶1);
  4. 可选人工介入:人工覆盖 actor 输出做纠正。

RL 作用在动作块(C=10)上、与 VLA 对齐,缩短信用分配时域;只在任务的关键阶段启用 RL,其余走基策略。


3. 关键设计与创新点

  1. 紧凑读出接口(RL token):把十亿参数 VLA 的表征压成可高效 RL 的小状态,是「冻结大模型 + 小 RL 头」范式的关键粘合层。
  2. 动作块级精炼:RL 在 chunk(而非单步)上操作,与 VLA 的分块输出对齐,显著缩短信用分配时域 —— 这是它在稀疏奖励、长程任务上胜过单步法的关键。
  3. 参考条件 + 局部精炼框架:actor 直接条件并精炼 VLA 提案,正则把学习锚在 VLA 行为附近,把「探索」变成「在有希望行为附近的局部改良」,从而既快又不毁泛化。
  4. 冻结主干 = 不牺牲泛化:与「整模型 RL」相反,VLA 全程冻结,RL 只在外挂小网络与读出上发生。

4. 实验与关键结果

⚠️ 以下均为作者自评(PI 自有真机任务,50 episode/任务量级),无第三方复现。

任务:拧螺丝、扎扎带、插网线、插充电器(30–120s/episode,亚毫米精度)。

关键阶段评测(自评)

  • 拧螺丝:成功率 20% → 65%,最高约 3× 提速;
  • 扎扎带:成功率显著提升 + 约 提速;
  • 插网线:维持约 95% 成功率,吞吐约 ;
  • 插充电器:维持成功率,吞吐约 ;
  • 部分任务上 RL 策略速度甚至超过人类遥操作(插网线关键阶段)。

全任务评测(自评):拧螺丝成功率 +40%、扎扎带 +60%

训练成本(自评):每任务 15 分钟到 5 小时 真机练习;学习曲线显示约 5 分钟关键阶段数据即见有意义改进。

对照(自评):HIL-SERL(单步)在稀疏奖励长程任务上失败;PLD 吞吐差;DSRL 成功率高但吞吐显著落后;DAgger(VLA 微调)受限于人类演示速度。

消融(自评):去掉 RL token → 吞吐砍半;去掉 chunk(单步)→ 难稳定匹配基策略;去掉 BC 正则(β=0)→ 单项最大跌幅;去掉 pass-through → 训练期更慢、更多失败。


5. 局限与争议

  1. 全为自评:全部数字来自 PI 自有真机任务,无第三方统一复现;任务集与对照复现的充分性由作者把握。
  2. 训练期需人工介入:RLT 依赖人工提供奖励信号、纠正干预,并在「关键阶段 RL」与「基策略」之间切换。论文承认部分可用奖励模型 / 进度预测自动化,但目前未自动化,是未来工作。
  3. 只精炼关键阶段、非全任务自治:RL 仅用于任务的关键(精度苛刻)阶段,而非端到端全程自治。
  4. 未提开源:论文未给出代码 / 权重发布信息;PI 体系实现多为闭源。

6. 在 VLA 谱系中的位置

  • Knowledge Insulationπ0.6 的 RECAP 同台对照。RLT 自我定位为 RECAP(π0.6 的整模型离线 RL 配方)的轻量替身:RECAP 在长程任务上「吞吐翻倍以上」但要迭代式离线更新;RLT 主打实时在线精炼、冻结主干。两者代表「整模型离线 RL」与「冻结模型 + 轻量在线 RL」两条后训练路。
  • SimpleVLA-RL / πRL 的对比。后者是整模型 RL;RLT 用冻结主干 + 读出瓶颈规避其算力 / 样本开销。
  • 与 GR-RL / DSRL 的对比。GR-RL、DSRL 走隐空间 steering;RLT 不同 —— 它在动作块上、显式条件参考动作做精炼,而非隐式调制扩散。(注:GR-RL 本站尚未单列。)
  • 「第四类数据 / 真机 RL」主题。它和 具身数据全景 §6.5 讲的「真机 RL 经验突破模仿上限」一脉相承,是该主题下「最轻量、最快上手」的一个代表。

一句话:RLT 把强化学习从「重训整模型」降维成「在冻结 VLA 的紧凑读出上、对其参考动作块做局部精炼」,用数分钟到数小时真机练习定向补强精度苛刻任务;代价是训练期仍需人工介入、且全为 PI 自评数字,但它给出了「不牺牲泛化的轻量在线 RL」一条很实用的配方。


来源

说明:第 4 节全部数字为作者自评(PI 自有真机任务),非独立第三方复现;RLT 训练期仍需人工介入,引用请保留这些限定。

已读 0/124