π0.5(pi-0.5):面向开放世界泛化的视觉-语言-动作模型
arXiv: 2504.16054 (v1) 机构: Physical Intelligence 时间: 2025.04 路线: 混合范式 —— 高层用自回归离散 token(FAST tokenizer)预测自然语言子任务,底层用流匹配(flow matching)action expert 输出连续关节动作块
TL;DR
π0.5 是 Physical Intelligence 在 π0 基础上的扩展,核心目标只有一个词:开放世界泛化(open-world generalization)。它的标志性结果是——首次让一个端到端学习的机器人,在训练数据中从未出现过的全新真实住宅里,完成 10–15 分钟、多阶段的长程灵巧操作任务(如打扫整个厨房、整理卧室:收拾餐具、把物品放进抽屉、擦拭洒漏、关橱柜、铺床、把衣物放进洗衣篮等)。
实现这一点的两条主线:
- 异构数据协同训练(co-training):把多机器人移动操作数据、多环境静态机器人数据、π0 原始跨本体数据、多模态网络数据(视觉问答 / 字幕 / 目标检测)、口头分步指令演示、以及带边界框标注的高层语义子任务预测混在一起联合训练,让机器人从"语义知识"和"物理技能"两个层面同时获得迁移。
- 分层两级推理(两条路合一):高层用自回归离散 token(FAST tokenizer)生成自然语言子任务(如"拿起盘子");底层用流匹配 action expert,根据该子任务输出 50 步(约 1 秒)的连续关节动作块。
规模化结论:在约 100 个训练环境(约 400 小时移动操作数据,采集地点从 3 处扩展到 104 处)训练后,π0.5 在 3 个全新真实住宅上的表现逼近了"直接在测试住宅里采数训练"的基线——即用泛化逼近了"作弊"上界。
⚠️ 可信度提示:本文的真机评测与全部消融均为 Physical Intelligence 实验室自评;训练数据与模型权重未开源;"全新住宅"虽确实不在训练集中,但其难度边界(室内布局/物体类别仍属常见家居分布)需读者自行斟酌。
1. 要解决的问题
VLA 已能在受控环境里完成不少操作任务,但真正的家用机器人面对的是开放世界:每个家庭的厨房布局、物体外观、橱柜结构、光照背景都不一样。π0.5 要回答三个递进的问题:
- 开放世界泛化:能否让机器人在完全没见过的真实住宅里干活,而不是只在采过数据的实验室/房间里表现良好?这要求模型对新物体、新背景、新布局鲁棒。
- 长程任务:打扫厨房不是单个抓取动作,而是一长串多阶段子任务(10–15 分钟级别)。模型既要会"高层规划下一步做什么",又要会"底层精细地把它做出来",并且能从错误中恢复、持续推进。
- 知识从何而来:机器人演示数据稀缺且昂贵,单靠机器人数据无法覆盖开放世界的语义多样性。泛化所需的"常识/语义知识"应当从哪些数据源迁移进来? π0.5 的核心假设是:把网络多模态数据、跨本体机器人数据、高层语义标注等异构来源协同训练,才能撑起开放世界的泛化。
π0.5 的定位,是把 π0 从"会做灵巧操作"推进到"在没见过的家里也会做灵巧操作"。
2. 方法与架构
π0.5 在 π0 之上扩展:继承"VLM 主干 + 独立 action expert 输出连续动作块"的双流结构,再叠加两项关键设计——(a) 把离散自回归高层与连续流匹配底层合进同一个 VLA 主干,实现分层两级推理;(b) 用两阶段训练配方,先以纯离散 token 吃下海量异构数据,再上流匹配底层把控制精度补回来。下面分三小节展开:2.1 分层两级推理(单模型内的离散+连续合并),2.2 两阶段训练配方,2.3 co-training 异构数据混合。

图注(译自原文 Figure 3,Model overview):π0.5 分两阶段训练。预训练阶段把所有不同数据源混合,产出一个使用离散 token 的初始 VLA;该阶段使用来自多种机器人平台的数据、高层语义动作预测、以及网络数据;其中机器人动作用 FAST 动作 tokenizer 表示为离散 token。后训练阶段则把模型专门化到移动操作的高层与底层推理上,并引入流匹配 action expert 输出连续动作。
2.1 分层两级推理:离散高层 + 连续底层,合进同一个模型
2.1.1 概率分解:一个模型,两级条件
π0.5 把"想做什么(高层语义子任务)"和"怎么做(底层关节动作)"拆成两级,但用同一组参数 θ 的同一个 transformer 主干同时表达。给定观测
关键点是底层动作分布只依赖高层产出的子任务
2.1.2 高层(High-Level)—— 自回归离散 token
给定观测 + 总体指令,主干先用标准自回归 next-token 解码生成一段自然语言子任务
2.1.3 底层(Low-Level)—— 流匹配 action expert
拿到
2.1.4 单 transformer 内如何把两路串起来
主干是一个能吃混合 token 的 transformer:每个输入
于是 π0.5 把 VLA 领域的两条主要技术路线合并到一个模型:高层吃"语义、可解释、能蹭网络数据"的离散自回归路线,底层吃"高频、连续、灵巧"的流匹配路线。
2.2 两阶段训练配方:先离散统一,再上连续
π0.5 的模型权重从一个标准 web VLM 初始化,随后分两阶段训练。两阶段共享同一个组合损失(原文 Eq.1):
其中第一项是文本与预测 logits(含 FAST 编码的离散动作 token)的交叉熵,第二项是 action expert 的流匹配损失,
- ① 预训练阶段(离散统一,
):整个模型当作一个标准自回归 VLM 来训,对文本、物体位置(边界框)、FAST 离散化的动作 token 一律做 next-token prediction。此时动作也被映射成文本 token,于是机器人动作、网络 QA/字幕、高层子任务预测、边界框定位共用同一个 next-token 目标——这正是"先借离散统一吃下海量异构数据"的关键:用同一种监督形式把六类异构数据(见 2.3)灌进同一个模型,训练简单、可扩展、稳定。预训练跑约 280k 梯度步。动作数据细节:区分目标关节位姿 / 末端执行器位姿(prompt 里加 <control_mode>joint/end effector<control_mode>标记),按每维 1%/99% 分位数归一化到,并对低维本体零填充到统一动作维度。 - ② 后训练 / 专门化阶段(加上流匹配,
):在预训练好的离散 VLA 上,新增一个随机初始化的 action expert,目标函数仍是 Eq.1 但 ,联合做 next-token prediction(保留文本/语义能力)与流匹配(获得连续动作)。再跑约 80k 步,把模型专门化到家庭移动操作。
为什么分两阶段? 论文的逻辑是:离散 token 训练简单、可扩展、训练快,适合把多源异构数据(尤其网络数据与跨本体数据)统一吃进来建立"广度知识与语言跟随";但离散表示在实时高频控制上解码昂贵、精度受限。于是先用离散把广度打满,再在后训练阶段引入流匹配 action expert 把底层连续控制的精度与推理效率补回来。作者发现该流程能带来稳定的预训练与很强的语言跟随能力。
2.3 co-training:六类异构数据各自的作用

图注(译自原文 Figure 4):π0.5 在以下数据上预训练——移动操作机器人数据(MM)、多样环境中的非移动机器人数据(ME)、实验室条件下采集的跨本体数据(CE),以及高层子任务预测(HL)和多模态网络数据(WD);在后训练阶段额外加入口头分步指令(VI),并去掉实验室跨本体数据(CE),以聚焦于移动操作与多样环境。
co-training 的核心假设:机器人演示数据稀缺,开放世界泛化所需的语义广度必须从异构来源迁移进来。π0.5 把以下六类数据用同一种(预训练阶段的)离散 next-token 目标混合训练:
- 多机器人移动操作数据(MM):约 400 小时移动操作演示,覆盖约 100 个不同家庭环境,机器人为双臂 + 移动底座 + 升降躯干平台。这是最直接对应评测任务(在全新住宅里打扫整理)的数据切片。
- 多环境静态机器人数据(ME):非移动单臂/双臂机器人在多样家庭环境采集。这些臂更轻、易搬运,因而能在更广的家庭里采到更多样的数据,主要贡献环境/场景多样性;但它来自与移动机器人不同的本体。
- 跨本体实验室数据(CE):实验室桌面环境下、多种机器人类型(单臂/双臂、静态/移动底座)做多任务(收拾桌子、叠衬衫等),含开源 OXE 数据集,是 π0 所用数据集的扩展版。贡献任务/技能多样性;后训练阶段被剔除以聚焦移动操作。
- 高层语义子任务预测(HL):把"打扫卧室"等长指令人工标注拆成短子任务("整理毯子""捡起枕头"),对 MM/ME/CE 中的多子任务数据训练模型联合预测子任务文本 + (以子任务为条件的)动作;并标注当前观测里相关物体的边界框,要求模型先预测边界框再预测子任务。这一项直接造就了"同一个模型既能当高层策略输出子任务、又能当底层策略执行动作"。
- 多模态网络数据(WD):图像字幕(CapsFusion、COCO)、视觉问答(Cambrian-7M、PixMo、VQAv2)、物体定位(并用室内场景/家居物体的边界框数据扩充)。把互联网级语义常识注入 VLA,主要影响物体层面的泛化。
- 口头分步指令演示(VI, Verbal Instructions):后训练阶段加入。专家用户用语言"遥操作"——对一个已训练好的底层策略,实时逐步选择恰当的子任务指令驱动机器人完成移动操作,等于在示范"好的高层子任务输出长什么样",强化高层规划与语言跟随。
直觉上:MM/ME/CE 撑"会做各种任务、适应各种环境"的物理技能多样性;WD/HL/VI 撑"理解语义、规划子任务、跟随语言"的语义泛化。两者协同,端到端模型才能在新家里既"看得懂"又"做得来"。
消融结论(以原文为准,详见第 4 节):去掉跨本体数据(ME 或 CE)→ 性能大幅退化,两者皆去时退化最严重,说明跨本体/多环境数据是泛化支柱;网络数据(WD)主要影响物体层面的泛化(尤其对训练中未见过物体类别 OOD 的语言跟随),对主任务成功率影响较小。
2.3.1 开放世界泛化机制:为什么语义广度带来对新家的泛化
π0.5 的泛化不是靠"在目标住宅多采数据",而是靠 co-training 的语义广度 + 环境数量规模化。约 100 个训练环境(约 400 小时移动操作,采集地点从 3 处扩展到 104 处)训练后,模型在 3 个完全没见过的真实住宅里完成 10–15 分钟长程家务,逼近了"把测试住宅也放进训练集"的"作弊"上界。机制上:ME/CE 让模型见过足够多的布局/家具/物体几何,WD/HL 让模型把新物体、新场景对接到已有语义常识与子任务规划上——于是面对新家具、新布局时,高层能基于语义常识规划出合理子任务,底层能把跨环境学到的技能迁移过去,而不依赖在该住宅采过数据(评测全部在训练中未出现的环境进行)。
2.4 机器人系统
原文 Figure 5:使用两种移动操作平台,每台配 4 个相机(前、后、双腕),两条 6-DoF 机械臂 + 平行夹爪,一个移动底座(2D 线速度 + 1D 角速度)和一个躯干升降机构(1D 或 2D)。π0.5 同时控制双臂关节与夹爪、底座速度、升降位置,状态/动作空间约 18–19 DoF。高层推理用全部 4 个相机,底层推理用腕部 + 前向相机;模型以 50 Hz 直接下发目标位姿/底座速度,由简单 PD 控制器跟踪,无轨迹规划或碰撞检测。
3. 关键设计与创新点
- 把"离散高层 + 连续底层"合并成单一 VLA:高层自回归离散 token 负责可解释、可蹭网络常识的语义子任务规划;底层流匹配 action expert 负责高频连续灵巧控制。一个模型同时占住 VLA 的两条技术路线。
- 异构数据协同训练作为泛化引擎:不靠"在目标环境多采数据",而靠把语义类(网络/HL/VI)与物理类(MM/ME/CE)数据混合,用迁移撑起开放世界泛化。这是 π0.5 与"只用机器人数据"路线最本质的区别。
- 两阶段训练配方:预训练先用全量异构数据 + 离散 token 建立通用 VLA;后训练再专门化到移动操作(加入 VI、去掉 CE、接上流匹配底层)。让"广度知识"和"任务专精"分阶段获得。
- 语言子任务作为语义中介:高层输出自然语言子任务,既让长程任务可分解、可解释、可干预,又把网络数据的语义直接对接到行为规划上。
- 面向真实住宅的长程评测:不在采过数据的房间里刷分,而是搬进全新真实住宅做 10–15 分钟级别的多阶段任务,直接把"开放世界泛化"作为第一性的评测目标。
4. 实验与关键结果
速览表
⚠️ 总口径提示:π0.5 论文中真机评测、规模化曲线、全部消融均为 Physical Intelligence 实验室自评,数据/权重未开源、无第三方独立复现。论文核心结果以**任务进度(task progress)**这类质性/相对指标度量,未给出可横比的逐任务成功率绝对数,故下表多数定量格填「待核」。唯一有确切第三方可比绝对数的是 RoboCasa 1.0 multitask 一栏(来自 RoboCasa 官方维护方,非 PI 自评)。
表 4-1:π0.5 论文内主要实验(均为 PI 自评 ⚠️)
| 实验 | 设定 / 口径 | 指标 | 结果 | 来源 |
|---|---|---|---|---|
| 开放世界泛化(核心) | 3 个训练中未出现的真实住宅;10–15 分钟长程家务(餐具入水槽 / 物品入抽屉 / 衣物入篮 / 铺床) | 任务进度 + 质性完成 | 能完成多阶段长程任务;逼近"把测试住宅放进训练集"的作弊上界(具体百分比 待核) | 本文 §4(1)、§2.3.1 ⚠️ |
| 规模化(环境数量) | 训练地点 3 → 104(约 100 训练环境,约 400 小时移动操作数据);4 个测试任务 | 任务进度 / 语言跟随率 / 抓放成功率 | 随训练地点数单调上升;对 in-dist 与 OOD 物体类别均改善(绝对数 待核) | 本文 §4(2),原文 Fig.8/9 ⚠️ |
| 消融:去跨本体(ME/CE) | 移除多样环境数据(ME)或实验室跨本体数据(CE) | 任务表现退化幅度 | 显著退化;两者皆去时退化最严重(退化百分点 待核) | 本文 §4(3),原文 Fig.10/11/16 ⚠️ |
| 消融:去网络数据(WD) | 移除多模态网络数据 | 主任务成功率 / OOD 物体语言跟随 | 主任务成功率影响小;OOD(未见物体类别)语言跟随显著受损(绝对数 待核) | 本文 §4(3),原文 Fig.11/16 ⚠️ |
| 消融:高层推理 / VI | 完整双级 vs implicit-HL vs 去 VI / 去 WD / 零样本 prompting | 相对优劣 | 完整"高层+底层"最优;去 VI 或去 WD 显著掉点;零样本 prompting 高层基线明显更差(绝对数 待核) | 本文 §4(3),原文 Fig.13 ⚠️ |
| 与 π0 / π0-FAST 对比 | mock home 测试环境 | 任务表现 / 语言跟随 | 完整 π0.5 显著优于 π0 与 π0-FAST(+Flow)(绝对数 待核) | 本文 §4(4),原文 Fig.12/15 ⚠️ |
表 4-2:π0.5 在 RoboCasa 1.0 multitask 的第三方可比成绩(同口径横比,非 PI 自评)
口径:RoboCasa 官方文档,300 任务(65 atomic + 235 composite),100 demos/task,pretrain scenes;openpi 实现,由基准维护方统一训练评测。
| 模型 | Avg | Atomic-Seen | Composite-Seen | Composite-Unseen | 来源 |
|---|---|---|---|---|---|
| GR00T N1.5 | 20.0% | 43.0% | 9.6% | 4.4% | benchmarks.md / robocasa.ai 官方文档 |
| π0.5 (openpi) | 16.9% | 39.6% | 7.1% | 1.2% | benchmarks.md / robocasa.ai 官方文档 |
| π0 (openpi) | 14.8% | 34.6% | 6.1% | 1.1% | benchmarks.md / robocasa.ai 官方文档 |
| Diffusion Policy | 6.1% | 15.7% | 0.2% | 1.25% | benchmarks.md / robocasa.ai 官方文档 |
📌 同口径排名:GR00T N1.5 > π0.5 > π0 > Diffusion Policy。此表与论文主线"全新真实住宅长程泛化"不是同一评测,RoboCasa 是仿真厨房多任务基准,仅作可比定量锚点参考;π0.5 在此口径领先 π0(+2.1pt avg),但落后 GR00T N1.5。 ⚠️ 不可与论文真机结果或其他 RoboCasa 口径(30-demo 低数据档、24-atomic single-task 等)横比,详见 benchmarks.md §4。
下面是各实验的要点解读(质性结论为主):
(1) 全新真实住宅的开放世界泛化(核心结果) π0.5 被搬进 3 个完全没在训练中出现过的真实住宅(新厨房 / 新卧室,含新物体、新背景、新布局),完成"把物品放进抽屉""把餐具放进水槽""把衣物放进洗衣篮""铺床"等任务。模型一边预测高层子任务(原文图中以蓝字标注在每帧下方),一边输出底层动作,完成 10–15 分钟的多阶段流程。论文同时用一组仿真/模拟房间(mock rooms)做可复现的定量对比,并发现其表现能代表真实住宅中的表现(原文 Figure 6/7)。
(2) 泛化随场景数量的规模化(原文 Figure 8/9) 随训练环境数量增加(地点从 3 扩展到 104,约 100 个训练环境、约 400 小时移动操作数据),四个测试任务("dishes in sink""items in drawer""laundry basket""make bed")的进度持续提升。最关键的对照:论文设了一个把测试住宅也放进训练集的"作弊"基线(图中绿色虚线/绿条);π0.5 在不见任何测试住宅数据的情况下,性能逼近该基线——即用纯泛化逼近了"在目标环境训练"的上界。语言跟随率与抓取-放置成功率也随训练地点数稳步上升,且对 in-distribution 与 out-of-distribution 物体类别都有改善。
(3) 协同训练配方消融(原文 Figure 10/11/16)
- 去掉跨本体数据 → 大幅退化:无论是去掉多样环境数据(ME)、还是去掉实验室跨本体数据(CE),性能都显著下降;两者皆去时退化最严重。说明跨本体/多环境数据是泛化的支柱。
- 网络数据(WD)影响物体泛化:在主任务成功率上 WD 影响不明显,但在物体层面的泛化、尤其是 OOD(未见物体类别)的语言跟随上,WD 贡献显著(Figure 11/16)。
- 高层推理与 VI/WD 的作用(Figure 13):完整的"高层 + 底层"双级推理结果最好;即便只用底层("implicit HL"),训练中包含高层子任务样本也有帮助;而去掉口头指令(VI)或网络数据(WD)会显著掉点,零样本 prompting 的高层基线则明显更差。
(4) 与其他 VLA 的对比(原文 Figure 12/15) 在 mock home 测试环境中,完整 π0.5 显著优于 π0 与 π0-FAST(+Flow);在语言跟随能力上 π0.5 也优于 π0 与 π0-FAST+Flow。这印证了"分层 + 协同训练"相对单一 π0/π0-FAST 的增量价值。
5. 局限与争议
- 全为实验室自评:真机评测、规模化曲线、所有消融均由 Physical Intelligence 自行完成,无独立第三方复现;mock room 与真实住宅的对应关系也由作者给出。
- 数据与权重闭源:训练数据(尤其约 400 小时移动操作数据、网络数据混合配方的细节)与模型权重未公开,外界难以复现或在其上做二次研究。
- "全新住宅"的难度边界:住宅确实不在训练集中,但仍属常见家居分布(厨房、卧室、常见物体类别),与"任意开放世界"之间仍有距离;泛化声明的强度应结合这一点理解。物体类别的 OOD 范围、布局的极端程度等都会影响结论可迁移性。
- 依赖大规模异构数据:其泛化能力建立在约 100 个环境、多源异构数据之上,数据采集成本高;在数据规模受限时方法收益如何尚不清楚(规模化曲线显示性能对环境数量较敏感)。
- 长程任务仍非 100% 可靠:10–15 分钟多阶段任务以"任务进度(task progress)"度量,而非纯二元成功率,意味着部分任务并未完全做完——开放世界长程灵巧操作离"稳定可用"仍有差距。
6. 在 VLA 谱系中的位置
- 承 π0:π0.5 直接在 π0 的"VLM 主干 + 流匹配 action expert 输出连续动作块"之上扩展,把目标从"会灵巧操作"推进到"在没见过的家里也会灵巧操作"。底层连续控制路线一脉相承。
- 承 π0-FAST:高层的"自回归离散 token + FAST tokenizer"来自 π0-FAST。π0.5 的创新在于不把离散与连续二选一,而是分层合并——离散管语义高层、流匹配管连续底层。
- 把两条路线合并的混合范式:VLA 长期存在"离散 token 自回归"(RT-2、OpenVLA)与"连续流匹配/扩散"↗两条主线;π0.5 用分层架构把两者各取所长地装进一个模型,代表了一种范式融合。
- 与分层前沿并列:在"高层语义规划 + 底层连续控制"的分层思路上,π0.5 与 GR00T N1、Figure 的 Helix 同属当前 VLA 的分层前沿;不同点在于 π0.5 把重点压在异构数据协同训练驱动的开放世界泛化,并以"全新真实住宅长程任务"作为第一性的验证目标。
一句话:π0.5 是 π0 系列从"灵巧"走向"泛化"的关键一步——它用分层架构(离散高层 + 流匹配底层)统一了 VLA 的两条技术路线,并用异构数据协同训练把开放世界泛化推到了"在全新真实住宅完成长程家务"的高度,代价是高昂的数据需求与尚未开源、尚待第三方验证的自评结论。
来源
- 论文:π0.5: a Vision-Language-Action Model with Open-World Generalization. arXiv:2504.16054 (Physical Intelligence, 2025.04). https://arxiv.org/abs/2504.16054
- HTML 全文(图 3/4 来源):https://arxiv.org/html/2504.16054v1
- 官方博客:https://www.physicalintelligence.company/blog/pi05
- 架构图:本仓库
images/pi05_arch.webp(原文 Figure 3 Model overview,源文件x2.png) - 数据混合图:本仓库
images/pi05_data.webp(原文 Figure 4 预训练/后训练任务示例,源文件x3.png)
说明:第 4–5 节中的全部真机数字、规模化曲线与消融结论均为 Physical Intelligence 实验室自评,训练数据与权重未开源,引用时请注明其自评属性。
