具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

← 返回主报告

主要信源 / 参考文献聚合页

本页汇总全站一手信源(论文原文 / 官方一手页面),去重后按主题整理为可检索的参考文献表。 来源:主报告附录、各 细读 子文档、具身数据专题第八节

说明:

  • ⚠️ = 提出方 / 厂商自评数据,非独立第三方复现,引用时请谨慎。
  • 「关联细读」列指向本站已有的逐篇细读文档;无细读的条目仅给一手 URL。
  • 日期 2026-05-30,领域演进极快,多数信源为 2024–2026 预印本 / 官方页面;部分 arXiv 编号落在 2026,极新、社区尚未充分审视。

0. 目录速览(主题导航)

#主题条数一句话
1奠基模型9RT 系列、OctoOpenVLA(-OFT)、π0(-FAST)、Diffusion Policy
2前沿模型11GR00T N1.x、Gemini RoboticsWALL-OSSQwen-VLARynnVLAπ0.5/π*0.6CogACTHelix
3基准6SimplerEnv、LIBERO、CALVIN、MemoryVLA、VOTE、3D Diffuser Actor、GR-1
4数据集16OXE、BridgeData V2、DROID、AgiBot World、Ego4D、Cosmos …
5采集范式11ALOHA 系列、UMI、AirExo、DexCap、MimicGen、DreamGen、Genie/LAPA
6综述/方法6首篇 VLA 综述、Action Tokenization、知识隔离、Scaling Laws …

1. 奠基模型

标题 / 缩写团队·年份arXiv / 官网 URL关联细读备注
RT-1 (Robotics Transformer 1)Google 2022arxiv.org/abs/2212.06817📄 rt1EfficientNet + Transformer,离散动作 256 bin,验证"规模换泛化"
RT-2 (VLA 分水岭)Google DeepMind 2023arxiv.org/abs/2307.15818 · ar5iv.org/abs/2307.15818📄 rt2动作=文本 token,首证网络知识可迁移到机器人控制(PaLI-X / PaLM-E)
OctoUC Berkeley 2024arxiv.org/abs/2405.12213📄 octo开源通用机器人策略,OXE 上预训练
OpenVLAStanford/Berkeley 2024arxiv.org/abs/2406.09246📄 openvla7B 开源 VLA,Prismatic VLM 基座
OpenVLA-OFT2025 (RSS 2025)arxiv.org/abs/2502.19645 · openvla-oft.github.io📄 openvla-oft离散-vs-连续动作的关键定量证据来源
Diffusion PolicyColumbia/Stanford/Toyota 2023arxiv.org/abs/2303.04137 · github.com/real-stanford/diffusion_policy📄 diffusion-policy扩散模型生成动作序列,视觉运动策略奠基
π0 (pi-zero)Physical Intelligence 2024arxiv.org/abs/2410.24164📄 pi0流匹配动作专家 + VLM 主干
π0-FASTPhysical Intelligence 2025arxiv.org/abs/2501.09747 · pi.website/research/fast📄 pi0-fastFAST 频域离散动作分词 ⚠️
OXE (Open X-Embodiment)跨机构 2023arxiv.org/abs/2310.08864 · robotics-transformer-x.github.io既是数据集又是奠基性跨本体训练基础(见 §4)

2. 前沿模型(2024–2026)

标题 / 缩写团队·年份arXiv / 官网 URL关联细读备注
GR00T N1NVIDIA GEAR 2025arxiv.org/abs/2503.14734📄 groot-n1人形通用基座,双系统架构
GR00T N1.5 / N1.6 / N1.7NVIDIA GEAR 2025research.nvidia.com/labs/gear/gr00t-n1_5/ · …/gr00t-n1_6/ · huggingface.co/blog/nvidia/gr00t-n1-7 · github.com/NVIDIA/Isaac-GR00T📄 groot-n1迭代版本(官方页面,⚠️ 自评)
Gemini RoboticsGoogle DeepMind 2025arxiv.org/abs/2503.20020📄 gemini-roboticsGemini 2.0 基座的 VLA
CogACTMicrosoft 2024arxiv.org/abs/2411.19650 · github.com/microsoft/CogACT · huggingface.co/CogACT📄 cogact认知-动作组件化 VLA
WALL-OSSX-Square Robot 2025arxiv.org/abs/2509.11766 · github.com/X-Square-Robot/wall-x · huggingface.co/x-square-robot📄 wall-oss端到端具身基座,Qwen2.5-VL MoE ~4B,流匹配 + FAST 双分支 ⚠️
X-TokenizerX Square Robot / CityU / Tsinghua 2026arxiv.org/abs/2606.14752 · x-square-robot.github.io/X-Tokenizer_projectPage/ · github.com/X-Square-Robot/X-Tokenizer · huggingface.co/x-square-robot/X-Tokenizer📄 x-tokenizer动作分词器/语义接口,SRQ(q0 意图 + q1-q3 残差),Apache-2.0 权重 ⚠️
Qwen-VLAQwen 团队 2026arxiv.org/abs/2605.30280 · github.com/QwenLM/Qwen-VLA📄 qwen-vla⚠️ arXiv 编号落在 2026,极新
Qwen-RobotManipQwen 团队 2026arxiv.org/abs/2606.17846 · github.com/QwenLM/Qwen-RobotManip📄 qwen-robotmanip操作 VLA,多本体 state-action 对齐 + 38,100h 语料 ⚠️
Qwen-RobotNavQwen 团队 2026arxiv.org/abs/2606.18112 · github.com/QwenLM/Qwen-RobotNav📄 qwen-robotnav导航基础模型,可重配置 observation context ⚠️
Qwen-RobotWorldQwen 团队 2026arxiv.org/abs/2606.17030 · qwen.ai/blog?id=qwen-robotworld📄 qwen-robotworld语言条件视频世界模型,归 WAM ⚠️
RynnVLA-001达摩院 + 湖畔 2025 (ICRA 2026)arxiv.org/abs/2509.15212 · huggingface.co/Alibaba-DAMO-Academy/RynnVLA-001-7B-Base📄 rynnvla7B,视频生成预训练→动作"第三条路" ⚠️
π0.5 (pi-zero-five)Physical Intelligence 2025arxiv.org/abs/2504.16054 · pi.website/blog/pi05📄 pi05开放世界泛化
π*0.6 (pi-star-0.6 / RECAP)Physical Intelligence 2025.11arxiv.org/abs/2511.14759 · pi.website/blog/pistar06 · website.pi-asset.com/pi06star/PI06_model_card.pdf📄 pi06真机 RL 改进,最难任务吞吐翻倍、失败率约减半 ⚠️
Figure HelixFigure AI 2025figure.ai/news/helix仅官方新闻页(无论文) ⚠️

3. 基准 Benchmark

标题 / 缩写团队·年份arXiv / 官网 URL关联细读备注
SimplerEnv2024arxiv.org/abs/2405.05941 · github.com/simpler-env/SimplerEnv仿真评测桥接真机
LIBERONeurIPS 2023 (Liu & Zhu)github.com/Lifelong-Robot-Learning/LIBERO终身机器人学习基准
CALVIN2021arxiv.org/abs/2112.03227 · github.com/mees/calvin长程语言条件操作基准
MemoryVLA2025arxiv.org/abs/2508.19236横评数据源(记忆机制)
VOTE2025arxiv.org/abs/2507.05116横评数据源
3D Diffuser Actor2024arxiv.org/abs/2402.10885CALVIN/横评对照
GR-1ICLR 2024gr1-manipulation.github.io视频预训练操作策略,横评对照

4. 数据集

真机数据集

标题 / 缩写团队·年份arXiv / 官网 URL关联细读备注
OXE (Open X-Embodiment)跨机构 2023arxiv.org/abs/2310.08864 · robotics-transformer-x.github.io📄 embodied-data跨本体聚合数据集
BridgeData V2UC Berkeley 2023arxiv.org/abs/2308.12952 · rail-berkeley.github.io/bridgedata📄 embodied-data
DROID跨机构 2024arxiv.org/abs/2403.12945 · droid-dataset.github.io📄 embodied-data
RH20T2023arxiv.org/abs/2307.00595📄 embodied-data
RoboSet2023arxiv.org/abs/2309.01918 · robopen.github.io/roboset📄 embodied-data官方 28,500 条(网传 98,500 有误)
AgiBot World智元 OpenDriveLab 2025arxiv.org/abs/2503.06669 · opendrivelab.com/AgiBot-World📄 embodied-data
RoboMIND2024arxiv.org/abs/2412.13877📄 embodied-data
Language-TableGoogle 2022arxiv.org/abs/2210.06407📄 embodied-data
BC-ZGoogle 2022arxiv.org/abs/2202.02005📄 embodied-data

人类视频与第一视角

标题 / 缩写团队·年份arXiv / 官网 URL关联细读备注
Ego4D跨机构 2021arxiv.org/abs/2110.07058📄 embodied-data
Ego-Exo4D跨机构 2023arxiv.org/abs/2311.18259📄 embodied-data
EPIC-Kitchens2018arxiv.org/abs/1804.02748📄 embodied-data
Something-Something V22017arxiv.org/abs/1706.04261📄 embodied-data
EgoDexApple 2025arxiv.org/abs/2505.11709 · github.com/apple/ml-egodex📄 embodied-data

仿真与合成 / 世界模型

标题 / 缩写团队·年份arXiv / 官网 URL关联细读备注
MimicGenNVIDIA 2023arxiv.org/abs/2310.17596📄 embodied-data
RoboCasa2024arxiv.org/abs/2406.02523📄 embodied-data
ManiSkill2UCSD/Hao Su 2023arxiv.org/abs/2302.04659📄 embodied-data
ManiSkill3UCSD/Hao Su 2024arxiv.org/abs/2410.00425📄 embodied-data30,000+ FPS,比同类快 10–1000× ⚠️
Isaac Sim / LabNVIDIA 2023–25arxiv.org/abs/2511.04831📄 embodied-datasim-to-real / 域随机化主力框架
DreamGenNVIDIA GEAR 2025arxiv.org/abs/2505.12705📄 embodied-dataRoboCasa 上最高 333× 放大 ⚠️,已有真机仍 +8.8% ⚠️
Cosmos (世界基础模型)NVIDIA 2025–26arxiv.org/abs/2501.03575📄 embodied-dataopen-weight CC-BY-4.0,约 1 亿级片段,4B–14B

5. 采集范式与数据生成

标题 / 缩写团队·年份arXiv / 官网 URL关联细读备注
ALOHAStanford 2023arxiv.org/abs/2304.13705📄 embodied-data低成本双臂遥操作
Mobile ALOHAStanford 2024arxiv.org/abs/2401.02117📄 embodied-data移动底盘版
ALOHA 2Google DeepMind 2024arxiv.org/abs/2405.02292📄 embodied-data
UMI (Universal Manipulation Interface)Stanford 2024arxiv.org/abs/2402.10329📄 embodied-data手持夹爪采集
FastUMI-100K2025arxiv.org/html/2510.08022v1📄 embodied-data
AirExo2023arxiv.org/abs/2309.14975📄 embodied-data外骨骼采集
AirExo-22025arxiv.org/abs/2503.03081📄 embodied-data
DexCapStanford 2024arxiv.org/abs/2403.07788📄 embodied-data灵巧手动作捕捉
Genie (生成式交互环境)DeepMind 2024arxiv.org/abs/2402.15391📄 embodied-data
LAPA (潜动作预训练)2024arxiv.org/abs/2410.11758📄 embodied-data
EgoMimic2024arxiv.org/abs/2410.24221📄 embodied-data第一视角模仿

6. 综述 / 方法 / Scaling

标题 / 缩写团队·年份arXiv / 官网 URL关联细读备注
首篇 VLA 综述2024.05arxiv.org/abs/2405.14093📄 主报告 §综述视角① VLA 组件 ② 控制策略 ③ 高层任务规划器
Action Tokenization 综述2025arxiv.org/abs/2507.01925📄 主报告8 类动作 token 分类
VLA 三阶段时间线综述2025arxiv.org/abs/2505.04769📄 主报告基础融合→具身推理→泛化与安全部署
Knowledge Insulation(知识隔离)Physical Intelligence 2025arxiv.org/abs/2505.23705 · pi.website/research/knowledge_insulation📄 pi06隔离预训练 VLM 主干,连续专家梯度不回传
Data Scaling Laws (机器人)2024arxiv.org/abs/2410.18647📄 embodied-data
Re-Mix(数据配比)2024arxiv.org/abs/2408.14037📄 embodied-data
Sim-and-Real Co-Training2025arxiv.org/abs/2503.24361📄 embodied-data仿真-真机协同训练

附:按 arXiv 编号速查表

arXiv ID名称主题
1706.04261Something-Something V2数据集
1804.02748EPIC-Kitchens数据集
2110.07058Ego4D数据集
2112.03227CALVIN基准
2202.02005BC-Z数据集
2210.06407Language-Table数据集
2212.06817RT-1奠基模型
2302.04659ManiSkill2数据集
2303.04137Diffusion Policy奠基模型
2304.13705ALOHA采集范式
2307.00595RH20T数据集
2307.15818RT-2奠基模型
2308.12952BridgeData V2数据集
2309.01918RoboSet数据集
2309.14975AirExo采集范式
2310.08864OXE奠基/数据集
2310.17596MimicGen采集范式
2311.18259Ego-Exo4D数据集
2401.02117Mobile ALOHA采集范式
2402.10329UMI采集范式
2402.108853D Diffuser Actor基准
2402.15391Genie采集范式
2403.07788DexCap采集范式
2403.12945DROID数据集
2405.02292ALOHA 2采集范式
2405.05941SimplerEnv基准
2405.12213Octo奠基模型
2405.14093首篇 VLA 综述综述
2406.02523RoboCasa数据集
2406.09246OpenVLA奠基模型
2408.14037Re-Mix方法
2410.00425ManiSkill3数据集
2410.11758LAPA采集范式
2410.18647Data Scaling Laws方法
2410.24164π0奠基模型
2410.24221EgoMimic采集范式
2411.19650CogACT前沿模型
2412.13877RoboMIND数据集
2501.03575Cosmos数据集
2501.09747π0-FAST奠基模型
2502.19645OpenVLA-OFT奠基模型
2503.03081AirExo-2采集范式
2503.06669AgiBot World数据集
2503.14734GR00T N1前沿模型
2503.20020Gemini Robotics前沿模型
2503.24361Sim-and-Real Co-Training方法
2504.16054π0.5前沿模型
2505.04769VLA 三阶段时间线综述综述
2505.11709EgoDex数据集
2505.12705DreamGen数据集
2505.23705Knowledge Insulation方法
2507.01925Action Tokenization 综述综述
2507.05116VOTE基准
2508.19236MemoryVLA基准
2509.11766WALL-OSS前沿模型
2509.15212RynnVLA-001前沿模型
2510.08022FastUMI-100K采集范式
2511.04831Isaac Lab数据集
2511.14759π*0.6前沿模型
2605.30280 ⚠️Qwen-VLA前沿模型
2606.17030 ⚠️Qwen-RobotWorldWAM / 世界模型
2606.17846 ⚠️Qwen-RobotManip前沿模型
2606.18112 ⚠️Qwen-RobotNav导航模型

本页为《VLA 发展深度调研报告》信源聚合,综合主报告附录 + 近期细读 + 具身数据专题第八节,去重整理。⚠️ 标记处为提出方/厂商自评数据。

已读 0/124