具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

具身数据论文索引

← 返回主报告 · 具身数据全景 · 具身数据处理 · 评测基准全景

本页不是新的长篇综述,而是一个论文入口页:把本站已经分散在「具身数据全景」「数据处理」「WAM 数据引擎」「基准评测」里的数据相关论文按用途收拢。读数据方向时,建议先用本页定位,再跳到专题页或细读页。

一、怎么读

你关心的问题优先读读完应得到什么
数据从哪里来具身数据全景真机、网络视觉语言、人类视频、仿真/合成数据四层金字塔
原始轨迹怎么变训练样本具身数据处理清洗、标注、动作归一化、分块、伪标签、采样配比、格式
哪些数据集最重要本页 §二 + 具身数据全景 §二OXE、DROID、AgiBot、BridgeData 等的规模、模态、开源性
合成数据能不能用本页 §四 + RoboDream + Supervise What Survives生成数据适合做什么、不适合伪造什么
怎么筛掉低质量轨迹本页 §五 + World Value Modelsvalue / quality / influence 作为数据筛选信号的边界
用什么基准验证数据效果评测基准全景SimplerEnv、LIBERO、CALVIN、RoboCasa、RoboArena 等口径差异

二、真机遥操作与跨本体数据集

这组论文决定了 VLA 的公共训练底座。重点不是只看规模,而是看本体、模态、采集方式、许可证和是否能跨本体复用。

论文 / 数据集类型站内位置一句话
RT-1单本体真机遥操作RT-1 细读 · 数据全景Google EDR 单臂,早期大规模语言条件真机操作数据
BC-Z语言/视频条件真机数据数据全景Google/Berkeley/Stanford,连接语言、视频条件与机器人控制
Language-Table桌面推动与语言交互数据全景近 60 万语言标注轨迹,常作为 OXE 子集与语言条件操作基底
BridgeData V2WidowX 桌面操作数据全景60,096 条轨迹,低成本真实场景采集代表
RH20T多臂多模态遥操作数据全景RGB-D、力觉、音频并存,适合看多模态采集复杂度
RoboSetFranka 厨房技能数据全景真实厨房技能集,注意规模口径与网传数字差异
DROIDin-the-wild 真机数据数据全景 · 数据处理 §2.67.6 万轨迹 / 350h / 13 机构,也是很多 2026 数据合成工作的底座
RoboMIND多本体 + 失败示范数据全景 · 数据处理 §2.1107k 轨迹、4 本体、失败原因标注,适合看质量控制
AgiBot World百万级人形/双臂数据数据全景 · GO-1约 100 万轨迹 / 2976.4h,代表厂商工厂化采集路线
OXE / RT-X跨机构跨本体聚合数据全景 · RT-2 · OpenVLA · Octo22 本体、60 个已有数据集聚合,VLA 公共底座

读表提醒:OXE 是聚合集,不要把它和 RT-1、BridgeData V2 等子集重复计数;episode、trajectory、hour 也不能直接横比。

三、人类视频与第一视角数据

人类视频的价值是便宜、海量、语义丰富,但问题是没有机器人动作标签。因此这一类论文通常要和潜动作、逆动力学、手部关键点或 retarget 方法一起看。

论文 / 数据集类型站内位置一句话
Ego4D大规模第一视角视频数据全景 §三3670 小时第一视角视频,适合作为人类动态先验
Ego-Exo4Dego + exo 同步视频数据全景 §三同步多视角能缓解第一视角到第三视角的观测 gap
EPIC-Kitchens厨房第一视角数据全景 §三操作语义丰富,但仍需动作翻译
Something-Something V2细粒度手物动作数据全景 §三强时序动作语义,常用于操作相关表征预训练
EgoDex眼镜/手部姿态采集数据全景 §三代表“人类视频 + 3D 姿态”的新采集趋势
EgoMimic人类到机器人模仿数据全景 §三关注 human-to-robot transfer 和本体差异
LAPA潜动作预训练WAM: LAPA把无动作视频转成可学习的 latent action,是人类视频进入策略训练的关键桥
Gen2Act人类视频到动作WAM: Gen2Act级联路线:先从人类视频生成/规划,再转动作

四、仿真、合成数据与世界模型数据引擎

这一类工作最容易被过度宣传。本站目前的基本口径是:合成数据有价值,但要区分它在提供几何/视觉/覆盖率,还是在伪造动作标签

论文 / 系统类型站内位置一句话
MimicGen仿真轨迹生成数据全景 §四从少量人类演示批量生成任务轨迹,仿真数据扩量代表
RoboCasa厨房仿真与合成基准评测基准 §四 · 数据全景 §四既是基准,也是合成数据和 sim-real co-training 的主要舞台
ManiSkill2 / 3仿真平台数据全景 §四 · 评测基准 §五程序化任务、特权状态和可复现实验环境
DreamGen视频世界模型生成数据数据全景 §四生成机器人视频并回收伪动作,需要警惕动作噪声
Cosmos世界模型基座Cosmos 3被多个机器人数据合成/仿真工作当作基础生成模型
RoboDream数据合成引擎RoboDream以 robot-only 运动作锚,生成场景/物体,更像离线数据扩增器而非 policy
Qwen-RobotWorld语言条件视频世界模型Qwen-RobotWorld用 EWK 数据生成未来视觉轨迹,服务合成数据、评测和规划
Supervise What Survives生成视频几何监督Supervise What Survives只监督生成视频里可靠保留下来的几何信号,不硬造动作标签
GE-Sim 2.0动作条件神经仿真GE-Sim 2.0更接近“给动作,预测未来帧”的闭环仿真器

五、数据清洗、配比、筛选与 scaling

这组论文不一定“发一个新数据集”,但决定数据能不能真正变成策略能力。

主题站内位置代表论文 / 方法重点问题
清洗与失败标注数据处理 §二RoboMIND, AgiBot World技术伪影要删,语义失败要标注和分流
标定治理数据处理 §2.6DROID recalibration多相机外参漂移会污染 3D/几何学习
语言与子任务标注数据处理 §三VLM 自动标注 + 人工复核指令、子目标、奖励和动作片段如何对齐
动作归一化与分词数据处理 §四OXE, OpenVLA, π0, FAST先统一量纲与动作维度,再离散化或连续生成
伪标签生成数据处理 §六IDM, latent action, hand keypoints无动作视频如何获得可训练监督
数据配比数据处理 §七n^0.43, Re-Mix多源数据怎么采样,避免大源压死小源
scaling laws数据全景 §六Data Scaling Laws, GR00T scaling数据量、多样性、质量和本体覆盖如何共同决定收益
价值/质量筛选World Value ModelsWorld Value Models, Suboptimal-Value-Bench用世界模型理解任务进展,筛掉次优/失败/卡住轨迹
知识隔离Knowledge InsulationKI, co-training防止动作数据训练破坏 VLM 的互联网语义能力

六、基准与评测也属于数据问题

很多 benchmark 本身就是“数据集 + 协议”。读论文时要把训练数据、评测数据、协议口径分开。

基准 / 数据类型站内位置最容易踩的坑
SimplerEnvreal-to-sim 操作评测评测基准 §一Visual Matching 和 Variant Aggregation 口径不可混
LIBERO终身学习 / 组合泛化评测基准 §二高分不等于真机泛化
CALVIN长程链式语言操作评测基准 §三ABCD 划分、5-step 平均长度等口径要标清
RoboCasa厨房仿真 / 合成数据评测基准 §四官方 300-task、30-demo、24-atomic、repo 25-task 四种口径不能横比
RoboTwin双臂/多本体仿真评测基准 §六1.0 / 2.0、仿真 / 真机挑战赛不是同一口径
RoboArena真机众包双盲评测评测基准 §七真机 ranking 依赖任务池、本体和统计协议
DreamGen Bench / WorldModelBench世界模型视频评测Qwen-RobotWorld · 评测基准 §附视觉生成分数不能直接当机器人成功率

七、当前缺口

本站已有“数据全景”和“数据处理”,但还可以继续补三类内容:

  1. 单篇数据集细读:DROID、AgiBot World、RoboMIND、OXE 都值得拆成独立细读页,现在主要集中在专题表格里。
  2. 数据筛选方法细读:DemInf、QoQ、CUPID、Re-Mix、Data Scaling Laws 还没有逐篇细读。
  3. 合成数据可信度对照:RoboDream、Qwen-RobotWorld、DreamGen、Supervise What Survives 可以进一步做“哪些监督可信”的横向表。

八、站内阅读顺序

  1. 先读 具身数据全景:建立数据来源地图。
  2. 再读 具身数据处理:理解数据如何变成训练 batch。
  3. 然后按本页分类跳到 RoboDreamQwen-RobotWorldSupervise What SurvivesWorld Value Models
  4. 最后读 评测基准全景:检查这些数据是否真的带来可比的下游收益。
已读 0/124