RL Token:用紧凑「RL 读出」在冻结 VLA 上引导在线强化学习
arXiv: 2604.23073(v1 2026-04-24) 机构: Physical Intelligence(Charles Xu, J. T. Springenberg, Michael Equi, Ali Amin, Adnan Esmail, Sergey Levine, Liyiming Ke) 路线: VLA 在线 RL 后训练方法 —— 冻结大 VLA、压出一个紧凑「RL token」读出表征,在其上训练小型 actor-critic 做离策略在线 RL,把强化学习框成「对 VLA 参考动作块的局部精炼」 类型: 方法 / 训练技巧(非新基座模型)
TL;DR
RL Token(论文简称 RLT)是 Physical Intelligence 给出的一个轻量在线 RL 后训练方法,解决一个具体矛盾:VLA 泛化广,但在「精度苛刻、长程接触」任务上不够稳;而要补这块,整模型 RL 太慢、不适合快速在线适配,数据高效的轻量 RL 又往往牺牲 VLA 的泛化。RLT 想同时要「VLA 的泛化」与「轻量在线 RL 的速度与样本效率」。
它的做法有三个支点:
- RL token = 一个紧凑「读出」表征:在 VLA 的 token 嵌入后追加一个可学习嵌入,过一个编码器 transformer,再用自回归重建损失训练一对编解码器 —— 解码器必须从这个瓶颈里重建原始嵌入,从而逼它保留任务相关的预训练知识、同时足够紧凑。
- 在冻结 VLA 之上挂小 actor-critic:冻结的 VLA 提供固定的 RL token + 参考动作块;小型 actor-critic 以 RL token 为状态、做离策略训练;actor 接收状态 + VLA 参考动作,输出精炼后的动作分布,并以 L2 正则锚向参考动作(系数 β),用「参考动作 dropout」(50% 批次遮蔽参考)防止 actor 塌缩。
- 把 RL 框成「局部精炼」:正则把学习锚在 VLA 行为附近,使探索变成「对有希望行为的局部精炼」,而非从零学起;且 RL 作用在**动作块(chunk,C=10)**上,缩短信用分配的时域。
基座为 π0.6(输出 50 步动作块 @ 50 Hz、14 维动作)。作者自评(⚠️):在拧螺丝、扎扎带、插网线、插充电器等亚毫米精度任务上,关键阶段成功率与吞吐显著提升(如拧螺丝 20%→65%、多任务约 3× 吞吐),且数分钟到数小时真机练习即见效。
⚠️ 可信度提示:下列全部成功率 / 加速倍数(20%→65%、3×、+40%/+60% 等)均为作者自评,在 PI 自有真机任务上得到,无独立第三方复现;RLT 训练期仍需人工介入(给奖励、纠正、在 RL 与基策略间切换),是「关键阶段」精炼而非全任务端到端自治。
1. 要解决的问题
VLA 的泛化来自大规模预训练,但模仿学习的上限是演示分布:在需要亚毫米精度、强接触、长时程的任务(插接、装配)上,纯模仿常卡在「差一点」。要突破,自然想到 RL。但两条现成路都有代价:
- 整模型 RL(在线微调整个 VLA):算力 / 样本开销大,不适合快速在线适配;
- 轻量 / 隐空间 RL:样本高效,但常牺牲 VLA 的泛化(把大模型能力蒸没了)。
RLT 的问题陈述就是这句:「如何既利用 VLA 的泛化,又获得轻量在线 RL 的速度与样本效率?」 它的答案是——不动 VLA,只在它的一个紧凑读出上做 RL,并把 RL 限定为对 VLA 参考动作的局部精炼。
2. 方法与架构
2.1 RL token:从冻结 VLA 压出的「读出」瓶颈
在 VLA 的 token 嵌入序列后追加一个可学习嵌入,经编码器 transformer 得到一个压缩读出表征(RL token)。训练一对编码器-解码器,用自回归重建损失要求解码器从这个瓶颈重建出原始嵌入 —— 瓶颈被逼着保留任务相关的预训练知识,同时维持紧凑。直觉:把「十亿参数模型的表征」压成一个 actor-critic 吃得动的小状态。
2.2 在冻结 VLA 上的离策略在线 RL
- 冻结 VLA 提供固定的 RL token 与参考动作块;
- 小型 actor-critic 在 RL token 上离策略训练;actor 输入「状态 + VLA 参考动作」→ 输出精炼动作分布(直接对 VLA 提案做精炼,而非预测残差或调制隐变量);
- BC 正则:以 L2 惩罚把策略锚向参考动作(系数 β);
- 参考动作 dropout:50% 训练批次遮蔽参考,防 actor 塌缩成「照抄参考」。
2.3 训练配方
- 适配 + 训瓶颈:在任务演示上适配 VLA,同时训练 RL token 编解码器;
- warmup:用冻结 VLA 跑若干 episode 预填回放缓冲;
- 在线环:执行「冻结 VLA 动作」或「RL 精炼动作」,存转移,做 TD3 式离策略更新(高 update-to-data 比,5∶1);
- 可选人工介入:人工覆盖 actor 输出做纠正。
RL 作用在动作块(C=10)上、与 VLA 对齐,缩短信用分配时域;只在任务的关键阶段启用 RL,其余走基策略。
3. 关键设计与创新点
- 紧凑读出接口(RL token):把十亿参数 VLA 的表征压成可高效 RL 的小状态,是「冻结大模型 + 小 RL 头」范式的关键粘合层。
- 动作块级精炼:RL 在 chunk(而非单步)上操作,与 VLA 的分块输出对齐,显著缩短信用分配时域 —— 这是它在稀疏奖励、长程任务上胜过单步法的关键。
- 参考条件 + 局部精炼框架:actor 直接条件并精炼 VLA 提案,正则把学习锚在 VLA 行为附近,把「探索」变成「在有希望行为附近的局部改良」,从而既快又不毁泛化。
- 冻结主干 = 不牺牲泛化:与「整模型 RL」相反,VLA 全程冻结,RL 只在外挂小网络与读出上发生。
4. 实验与关键结果
⚠️ 以下均为作者自评(PI 自有真机任务,50 episode/任务量级),无第三方复现。
任务:拧螺丝、扎扎带、插网线、插充电器(30–120s/episode,亚毫米精度)。
关键阶段评测(自评)
- 拧螺丝:成功率 20% → 65%,最高约 3× 提速;
- 扎扎带:成功率显著提升 + 约 3× 提速;
- 插网线:维持约 95% 成功率,吞吐约 3×;
- 插充电器:维持成功率,吞吐约 3×;
- 部分任务上 RL 策略速度甚至超过人类遥操作(插网线关键阶段)。
全任务评测(自评):拧螺丝成功率 +40%、扎扎带 +60%。
训练成本(自评):每任务 15 分钟到 5 小时 真机练习;学习曲线显示约 5 分钟关键阶段数据即见有意义改进。
对照(自评):HIL-SERL(单步)在稀疏奖励长程任务上失败;PLD 吞吐差;DSRL 成功率高但吞吐显著落后;DAgger(VLA 微调)受限于人类演示速度。
消融(自评):去掉 RL token → 吞吐砍半;去掉 chunk(单步)→ 难稳定匹配基策略;去掉 BC 正则(β=0)→ 单项最大跌幅;去掉 pass-through → 训练期更慢、更多失败。
5. 局限与争议
- 全为自评:全部数字来自 PI 自有真机任务,无第三方统一复现;任务集与对照复现的充分性由作者把握。
- 训练期需人工介入:RLT 依赖人工提供奖励信号、纠正干预,并在「关键阶段 RL」与「基策略」之间切换。论文承认部分可用奖励模型 / 进度预测自动化,但目前未自动化,是未来工作。
- 只精炼关键阶段、非全任务自治:RL 仅用于任务的关键(精度苛刻)阶段,而非端到端全程自治。
- 未提开源:论文未给出代码 / 权重发布信息;PI 体系实现多为闭源。
6. 在 VLA 谱系中的位置
- 与 Knowledge Insulation、π0.6 的 RECAP 同台对照。RLT 自我定位为 RECAP(π0.6 的整模型离线 RL 配方)的轻量替身:RECAP 在长程任务上「吞吐翻倍以上」但要迭代式离线更新;RLT 主打实时在线精炼、冻结主干。两者代表「整模型离线 RL」与「冻结模型 + 轻量在线 RL」两条后训练路。
- 与 SimpleVLA-RL / πRL 的对比。后者是整模型 RL;RLT 用冻结主干 + 读出瓶颈规避其算力 / 样本开销。
- 与 GR-RL / DSRL 的对比。GR-RL、DSRL 走隐空间 steering;RLT 不同 —— 它在动作块上、显式条件参考动作做精炼,而非隐式调制扩散。(注:GR-RL 本站尚未单列。)
- 「第四类数据 / 真机 RL」主题。它和 具身数据全景 §6.5 讲的「真机 RL 经验突破模仿上限」一脉相承,是该主题下「最轻量、最快上手」的一个代表。
一句话:RLT 把强化学习从「重训整模型」降维成「在冻结 VLA 的紧凑读出上、对其参考动作块做局部精炼」,用数分钟到数小时真机练习定向补强精度苛刻任务;代价是训练期仍需人工介入、且全为 PI 自评数字,但它给出了「不牺牲泛化的轻量在线 RL」一条很实用的配方。
来源
- 论文:RL Token: Bootstrapping Online RL with Vision-Language-Action Models. arXiv:2604.23073(v1 2026-04-24,Physical Intelligence)。https://arxiv.org/abs/2604.23073 · 全文 https://arxiv.org/html/2604.23073v1
- 基座:π0.6 细读 · 相关:知识隔离 · 具身数据全景 §6.5 真机 RL
说明:第 4 节全部数字为作者自评(PI 自有真机任务),非独立第三方复现;RLT 训练期仍需人工介入,引用请保留这些限定。
