AtomicVLA:技能引导 MoE + 动作空间「思考-执行」的可持续学习 VLA
arXiv: 2603.07648(v1 2026-03-08,标注 CVPR 2026 接收) 机构: 中山大学 + 鹏城实验室 + 引望智能(Yinwang;华为车 BU 系)· 作者含 Likui Zhang, Tao Tang, …, Hang Xu, Liang Lin, Xiaodan Liang · 项目页 zhanglk9.github.io/atomicvla-web路线: 端到端 VLA;统一「思考-执行」 + 技能引导混合专家(SG-MoE) + 可扩展路由的持续学习;基座 π0
TL;DR
AtomicVLA 针对主流 VLA「单体动作解码器(monolithic decoder)」的三个痛点开方:可扩展性差、混合技能相互干扰、持续学习时灾难性遗忘。它的两件核心武器:
- 统一「思考-执行」框架:引入
[think]与[act]两个特殊 token,模型自行决定输出模态 —— 思考模式产出任务链、当前进度 与原子技能抽象 (在任务起点 / 技能切换时激活);执行模式据最近的 + 本体状态产出低层动作块 。 - 技能引导混合专家(SG-MoE):把每个原子技能抽象映射到一个标量噪声级
、再嵌成高维向量 ;架构是1 个共享专家(保住 π0 基底能力)+ K 个专属技能专家,路由器据 算分、稀疏激活 top 专家,加权合成 。
由此带来第三个亮点——可扩展路由的持续学习:新增技能时,复制已有路由权重 + 小随机初始化一个新路由分支,只训练新专家 + 扩展的路由参数,既有专家全程冻结,从机制上避免遗忘。配套还有一个基于主轴运动学 + 夹爪状态的轨迹自动分段、用 InternVideo2.5 精修标签的数据生成法,产出结构化推理链。
作者自评(⚠️):LIBERO 平均 96.6%(+2.4% vs π0)、LIBERO-LONG 95.2%(vs π0 85.2%);真机长程 56.7/63.3% vs π0 36.7%;持续学习场景里 π0.5 退化约 -15%,AtomicVLA* 仅 -1.3%、五任务整体 +21%。
⚠️ 可信度提示:全部数字为作者自评;CVPR 2026 接收目前据 arXiv 论文头标注(尚无 proceedings 链接可终校)。代码开源状态本次未确认(仅有项目页)。
1. 要解决的问题
主流 VLA 用单体动作解码器在聚合数据上训练,带来三个结构性问题:
- 可扩展性差 + 技能相互干扰:把多种技能混进一个解码器,彼此打架;
- 灾难性遗忘:持续学习(增量学新技能)时,旧技能性能塌;
- 规划与执行错配:解耦的两段式(planner + controller)决策易错位,而无技能专精的统一模型又在多技能 / 终身学习上吃力。
AtomicVLA 的主张:以「原子技能」为中轴,既统一规划与执行(一个模型自适应在「想」和「做」之间切换),又用技能专精的专家隔离干扰、支撑模块化的终身扩展。
2. 方法与架构
2.1 统一「思考-执行」(think-act)
两个特殊 token [think] / [act],模型自主选模态:
- 思考模式:产出任务链
、当前进度 、原子技能抽象 (任务初始化 / 技能切换时激活); - 执行模式:据最近
+ 本体状态产出低层动作块 。
2.2 技能引导混合专家(SG-MoE)
- 原子技能嵌入:技能抽象 → 标量噪声级
→(归一化对数函数)嵌成高维向量 ; - 架构:共享专家
(保住 π0 基底能力)+ K 个专属技能专家 ; - 稀疏路由:
,只激活得分最高的专家; - 加权合成:
—— 每个专家专精一类「通用且精确」的原子技能。
关键区别:路由是条件于语义化的原子技能,而非 token-level 或 timestep-level(消融见 §4)。
2.3 可扩展路由 → 持续学习
新增技能时:复制现有路由权重,新路由分支用小随机值初始化;只训练新专家 + 扩展路由参数,既有专家保持不变 —— 模块化的「技能-专家」机制从结构上避免灾难性遗忘。
2.4 任务规划数据生成
用主轴运动学分析按平移 / 旋转主导 + 夹爪状态切换分段轨迹(识别「pick」= z 下降 + 夹爪闭合、「turn」= 旋转 + 闭合夹爪 等),再用 InternVideo2.5 精修标签,构造把「原子序列 ↔ 高层计划」连起来的结构化推理链,降低人工标注负担。
3. 关键设计与创新点
- 端到端 think-act 统一:用双 token 自适应在「规划」与「执行」间切换,不再两段式错配。
- 技能抽象引导的 MoE:路由条件于语义原子技能(而非 token / timestep),这是它在多技能上胜过普通 MoE / MoDE 的关键(§4 消融)。
- 可扩展路由 → 无遗忘持续学习:只训新专家、冻结旧专家,模块化扩展,实测几乎不退化。
- 物理先验的轨迹自动分段:主轴 + 夹爪状态分段,减轻原子技能标注负担。
4. 实验与关键结果
⚠️ 全部为作者自评。AtomicVLA / AtomicVLA* 为两种配置(后者更强)。
LIBERO:AtomicVLA 平均 96.6%(+2.4% vs π0);LIBERO-LONG 95.2%(vs π0 85.2%,+10%);AtomicVLA* 平均 97.8%、LIBERO-LONG 96.2%。
CALVIN ABC→D:AtomicVLA 平均任务长 4.09(+0.22 vs π0);AtomicVLA* 4.27(+0.25 vs π0.5)。
真机 Franka 长程:AtomicVLA / AtomicVLA* 达 56.7% / 63.3%,vs π0 的 36.7%(+20.0% / +18.3%)。
持续学习(四基础任务 + 新增「open」技能):π0.5 整体退化约 -15%(stack 任务 -20%);AtomicVLA* 几乎不退,平均仅 -1.3%,五任务整体 +21%。
消融(LIBERO-LONG):π0 基线 85.2% → +MoE(token 级)88.6% → +MoDE(timestep 条件)89.5% → +SG-MoE(技能条件)95.2%(比 token-MoE +6.6%、比 MoDE +5.7%)—— 印证「技能条件路由」是涨点关键。
5. 局限与争议
- 全为自评 + CVPR 待终校:数字均作者自评;CVPR 2026 接收据论文头标注,proceedings 未出。
- 依赖 VLM 的技能抽象质量:性能受限于 VLM 的推理 / 规划保真度——技能抽象不准则路由失准。
- 新任务仍需大量演示:获取新技能仍要可观的人类示范做模仿学习;作者指出 RL 类进展(π0.6* / SimpleVLA-RL / VLA-RL)或可进一步增强持续学习。
- 开源未确认:仅见项目页,代码 / 权重释放状态本次未确认(许可 CC BY 4.0)。
6. 在 VLA 谱系中的位置
- 以 π0 为基底、对 π0.5 做持续学习对照。AtomicVLA 共享专家保住 π0 能力,再加技能专家;持续学习实验直接拿 π0.5 当退化对照,凸显「单体解码器」在终身学习上的脆弱。
- 「动作空间推理 / 动作 CoT」一族。它的
[think]→σ→[act]与 [ecot]同潮:都把「推理」显式接进动作生成;但 AtomicVLA 的推理落在原子技能抽象 + 专家路由上,而非纯文本 CoT。与同期智元 ACoT-VLA(动作 CoT,本站待收录)是这一方向的两个代表。 - MoE 用于 VLA 的明确样本。相对 token-level MoE / timestep-level MoDE,它给出「技能条件 MoE」这一更语义化的路由设计,并用它换来持续学习能力。
- 与 SimpleVLA-RL 互补。AtomicVLA 解「持续学习 + 技能干扰」,RL 类解「突破模仿上限」,作者自陈两者可叠加。
一句话:AtomicVLA 用「统一 think-act + 技能引导 MoE + 可扩展路由」,把 VLA 从「单体解码器」改造成「按原子技能分专家、可终身增量扩展」的结构,自评在 LIBERO/CALVIN/真机长程与持续学习上稳超 π0/π0.5;代价是依赖 VLM 技能抽象质量、新任务仍需大量演示、且为作者自评 + CVPR 待终校。
来源
- 论文:AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots. arXiv:2603.07648(v1 2026-03-08,标注 CVPR 2026 接收)。中山大学 + 鹏城实验室 + 引望智能。https://arxiv.org/abs/2603.07648 · 全文 https://arxiv.org/html/2603.07648v1
- 项目页:https://zhanglk9.github.io/atomicvla-web/
- 基底 / 对照:π0 · π0.5 · ECoT · SimpleVLA-RL
说明:第 4 节数字为作者自评;CVPR 2026 接收据 arXiv 论文头标注、proceedings 未出,均按本站 ⚠️/待核 体例处理。
