具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

AtomicVLA:技能引导 MoE + 动作空间「思考-执行」的可持续学习 VLA

arXiv: 2603.07648(v1 2026-03-08,标注 CVPR 2026 接收) 机构: 中山大学 + 鹏城实验室 + 引望智能(Yinwang;华为车 BU 系)· 作者含 Likui Zhang, Tao Tang, …, Hang Xu, Liang Lin, Xiaodan Liang · 项目页 zhanglk9.github.io/atomicvla-web路线: 端到端 VLA;统一「思考-执行」 + 技能引导混合专家(SG-MoE) + 可扩展路由的持续学习;基座 π0

← 返回主报告


TL;DR

AtomicVLA 针对主流 VLA「单体动作解码器(monolithic decoder)」的三个痛点开方:可扩展性差、混合技能相互干扰、持续学习时灾难性遗忘。它的两件核心武器:

  1. 统一「思考-执行」框架:引入 [think][act] 两个特殊 token,模型自行决定输出模态 —— 思考模式产出任务链 C0:k、当前进度 Ct原子技能抽象 σ(在任务起点 / 技能切换时激活);执行模式据最近的 σ + 本体状态产出低层动作块 At
  2. 技能引导混合专家(SG-MoE):把每个原子技能抽象映射到一个标量噪声级 σ[0,100]、再嵌成高维向量 Zσ;架构是1 个共享专家(保住 π0 基底能力)+ K 个专属技能专家,路由器据 Zσ 算分、稀疏激活 top 专家,加权合成 Fout=(1wk)Fshare(xt)+wkFk(xt)

由此带来第三个亮点——可扩展路由的持续学习:新增技能时,复制已有路由权重 + 小随机初始化一个新路由分支,只训练新专家 + 扩展的路由参数,既有专家全程冻结,从机制上避免遗忘。配套还有一个基于主轴运动学 + 夹爪状态的轨迹自动分段、用 InternVideo2.5 精修标签的数据生成法,产出结构化推理链。

作者自评(⚠️):LIBERO 平均 96.6%(+2.4% vs π0)、LIBERO-LONG 95.2%(vs π0 85.2%);真机长程 56.7/63.3% vs π0 36.7%;持续学习场景里 π0.5 退化约 -15%,AtomicVLA* 仅 -1.3%、五任务整体 +21%

⚠️ 可信度提示:全部数字为作者自评;CVPR 2026 接收目前据 arXiv 论文头标注(尚无 proceedings 链接可终校)。代码开源状态本次未确认(仅有项目页)。


1. 要解决的问题

主流 VLA 用单体动作解码器在聚合数据上训练,带来三个结构性问题:

  • 可扩展性差 + 技能相互干扰:把多种技能混进一个解码器,彼此打架;
  • 灾难性遗忘:持续学习(增量学新技能)时,旧技能性能塌;
  • 规划与执行错配:解耦的两段式(planner + controller)决策易错位,而无技能专精的统一模型又在多技能 / 终身学习上吃力。

AtomicVLA 的主张:以「原子技能」为中轴,既统一规划与执行(一个模型自适应在「想」和「做」之间切换),又用技能专精的专家隔离干扰、支撑模块化的终身扩展


2. 方法与架构

2.1 统一「思考-执行」(think-act)

两个特殊 token [think] / [act],模型自主选模态:

  • 思考模式:产出任务链 C0:k、当前进度 Ct原子技能抽象 σ(任务初始化 / 技能切换时激活);
  • 执行模式:据最近 σ + 本体状态产出低层动作块 At

2.2 技能引导混合专家(SG-MoE)

  • 原子技能嵌入:技能抽象 → 标量噪声级 σ[0,100] →(归一化对数函数)嵌成高维向量 Zσ;
  • 架构:共享专家 Fshare(保住 π0 基底能力)+ K 个专属技能专家 Fk;
  • 稀疏路由:wk=Router(Zσ),只激活得分最高的专家;
  • 加权合成:Fout=(1wk)Fshare(xt)+wkFk(xt) —— 每个专家专精一类「通用且精确」的原子技能。

关键区别:路由是条件于语义化的原子技能,而非 token-level 或 timestep-level(消融见 §4)。

2.3 可扩展路由 → 持续学习

新增技能时:复制现有路由权重,新路由分支用小随机值初始化;只训练新专家 + 扩展路由参数,既有专家保持不变 —— 模块化的「技能-专家」机制从结构上避免灾难性遗忘。

2.4 任务规划数据生成

主轴运动学分析按平移 / 旋转主导 + 夹爪状态切换分段轨迹(识别「pick」= z 下降 + 夹爪闭合、「turn」= 旋转 + 闭合夹爪 等),再用 InternVideo2.5 精修标签,构造把「原子序列 ↔ 高层计划」连起来的结构化推理链,降低人工标注负担。


3. 关键设计与创新点

  1. 端到端 think-act 统一:用双 token 自适应在「规划」与「执行」间切换,不再两段式错配。
  2. 技能抽象引导的 MoE:路由条件于语义原子技能(而非 token / timestep),这是它在多技能上胜过普通 MoE / MoDE 的关键(§4 消融)。
  3. 可扩展路由 → 无遗忘持续学习:只训新专家、冻结旧专家,模块化扩展,实测几乎不退化。
  4. 物理先验的轨迹自动分段:主轴 + 夹爪状态分段,减轻原子技能标注负担。

4. 实验与关键结果

⚠️ 全部为作者自评。AtomicVLA / AtomicVLA* 为两种配置(后者更强)。

LIBERO:AtomicVLA 平均 96.6%(+2.4% vs π0);LIBERO-LONG 95.2%(vs π0 85.2%,+10%);AtomicVLA* 平均 97.8%、LIBERO-LONG 96.2%。

CALVIN ABC→D:AtomicVLA 平均任务长 4.09(+0.22 vs π0);AtomicVLA* 4.27(+0.25 vs π0.5)。

真机 Franka 长程:AtomicVLA / AtomicVLA* 达 56.7% / 63.3%,vs π0 的 36.7%(+20.0% / +18.3%)。

持续学习(四基础任务 + 新增「open」技能):π0.5 整体退化约 -15%(stack 任务 -20%);AtomicVLA* 几乎不退,平均仅 -1.3%,五任务整体 +21%

消融(LIBERO-LONG):π0 基线 85.2% → +MoE(token 级)88.6% → +MoDE(timestep 条件)89.5% → +SG-MoE(技能条件)95.2%(比 token-MoE +6.6%、比 MoDE +5.7%)—— 印证「技能条件路由」是涨点关键。


5. 局限与争议

  1. 全为自评 + CVPR 待终校:数字均作者自评;CVPR 2026 接收据论文头标注,proceedings 未出。
  2. 依赖 VLM 的技能抽象质量:性能受限于 VLM 的推理 / 规划保真度——技能抽象不准则路由失准。
  3. 新任务仍需大量演示:获取新技能仍要可观的人类示范做模仿学习;作者指出 RL 类进展(π0.6* / SimpleVLA-RL / VLA-RL)或可进一步增强持续学习。
  4. 开源未确认:仅见项目页,代码 / 权重释放状态本次未确认(许可 CC BY 4.0)。

6. 在 VLA 谱系中的位置

  • π0 为基底、对 π0.5 做持续学习对照。AtomicVLA 共享专家保住 π0 能力,再加技能专家;持续学习实验直接拿 π0.5 当退化对照,凸显「单体解码器」在终身学习上的脆弱。
  • 「动作空间推理 / 动作 CoT」一族。它的 [think]→σ→[act][ecot]同潮:都把「推理」显式接进动作生成;但 AtomicVLA 的推理落在原子技能抽象 + 专家路由上,而非纯文本 CoT。与同期智元 ACoT-VLA(动作 CoT,本站待收录)是这一方向的两个代表。
  • MoE 用于 VLA 的明确样本。相对 token-level MoE / timestep-level MoDE,它给出「技能条件 MoE」这一更语义化的路由设计,并用它换来持续学习能力。
  • SimpleVLA-RL 互补。AtomicVLA 解「持续学习 + 技能干扰」,RL 类解「突破模仿上限」,作者自陈两者可叠加。

一句话:AtomicVLA 用「统一 think-act + 技能引导 MoE + 可扩展路由」,把 VLA 从「单体解码器」改造成「按原子技能分专家、可终身增量扩展」的结构,自评在 LIBERO/CALVIN/真机长程与持续学习上稳超 π0/π0.5;代价是依赖 VLM 技能抽象质量、新任务仍需大量演示、且为作者自评 + CVPR 待终校。


来源

说明:第 4 节数字为作者自评;CVPR 2026 接收据 arXiv 论文头标注、proceedings 未出,均按本站 ⚠️/待核 体例处理。

已读 0/124