数据集与仿真环境图鉴
定位:本图鉴是 具身数据全景梳理的可交互视图,把分散在 embodied-data.md 各章节的真机/人类视频/仿真数据集,收敛成一张可筛选 / 排序 / 按类型分组的统一目录。embodied-data.md 保持权威 prose(数据金字塔 / 采集范式 / 配比方法论),本图鉴是"给急着找数据的人"的快速通道。
覆盖:真机遥操作数据集(10 个代表性,含 OXE 聚合集)+ 人类视频数据集(3 个代表性)+ 仿真环境/合成工具(7 个主流)。
未纳入:小规模实验室数据集(OXE 聚合但未单独主流引用)、非英文/无公开链接的区域数据集、纯方法论论文(无数据集产出)。
可信度标注:⚠️ 自评 / ✅ 已核 / 待核 / 细读为出处,与 embodied-data.md 同源。每条带回链到对应章节。
数据源:手工策展自 embodied-data.md(转录日期 2026-07-01),共 20 条 entry。带
sourceSection回链,便于核对与漂移溯源。
交互图鉴
细读为出处一手论文/项目页已核实⚠️ 自评提出方/厂商自报,未独立复现✅ 已核经对抗式核查确认待核一手来源未给出
| 类型 | 名称 | 机构 | 本体 | 规模 | 许可 | 可信度 | 年份 | 链接 |
|---|---|---|---|---|---|---|---|---|
| 真机 | AgiBot World ↗ | 智元 AgiBot / 上海AI Lab | 双臂人形 + 灵巧手 + 视触觉 | 约 100万条轨迹(1,001,552)/ 2976.4h,100台真机 | ✅ CC BY-NC-SA | ⚠️ 自评 | 2025 | ↗ 章节 ℹ️ |
| 人类视频 | RynnVLA 人类视频集 | 阿里达摩院 | 人类第一视角 | 约 1200万 片段 | 未公开 | ⚠️ 自评 | 2025 | ↗ 章节 ℹ️ |
| 合成工具 | DreamGen ↗ | NVIDIA GEAR | 依底层环境(RoboCasa 验证) | RoboCasa 上最高 333× 放大 ⚠️ | arXiv(方法论),数据未开源 | ⚠️ 自评 | 2025 | ↗ 章节 ℹ️ |
| 合成工具 | Cosmos ↗ | NVIDIA | 通用(世界模型底座) | 约 1亿级片段训练,4B–14B 参数 | NVIDIA Open Model License(非 CC-BY) | ⚠️ 自评 | 2025-26 | ↗ 章节 ℹ️ |
| 真机 | DROID ↗ | 多机构(18 实验室) | 单臂(Franka Panda,统一栈) | 7.6万条轨迹 / 350h,564 场景,13 机构 | ✅ 开源 | ✅ 已核 | 2024 | ↗ 章节 ℹ️ |
| 真机 | RoboMIND ↗ | 北京人形创新中心 等 | 4本体(Franka/UR5e/AgileX双臂/天工人形) | 107k 轨迹,479 任务,含 5k 失败示范 | ✅ 开源(HF) | 细读为出处 | 2024 | ↗ 章节 ℹ️ |
| 人类视频 | EgoDex | Meta AI | 人类手部(带手部追踪) | 未公开总时长,双手 3D 位姿标注 | 研究用途 | 细读为出处 | 2024 | ↗ 章节 ℹ️ |
| 仿真环境 | RoboCasa ↗ | UT Austin / NVIDIA | 单臂/双臂(可配置) | 1,250 人工演示 + MimicGen 约 10万+ | ✅ MIT | ✅ 已核 | 2024 | ↗ 章节 ℹ️ |
| 仿真环境 | ManiSkill3 ↗ | UCSD / Hao Su | 多本体支持(单臂/双臂/移动操作/四足) | 最高 30,000+ FPS,12 领域 | ✅ Apache 2.0 | 细读为出处 | 2024 | ↗ 章节 ℹ️ |
| 真机 | BridgeData V2 ↗ | UC Berkeley (RAIL) | 单臂(WidowX 250) | 60,096 条轨迹(50,365 遥操作 + 9,731 脚本) | ✅ 开源 | ✅ 已核 | 2023 | ↗ 章节 ℹ️ |
| 真机 | RH20T ↗ | 上海交大(卢策吾组) | 多臂(Flexiv/Franka/UR5/Kuka) | 11万+ 操作序列 + 配对人类示范视频 | ✅ 开源 | ✅ 已核 | 2023 | ↗ 章节 ℹ️ |
| 真机 | RoboSet ↗ | CMU / Meta AI | 单臂(Franka,厨房) | 28,500 条(9,500 遥操作 + 19,000 示教回放) | ✅ MIT | ⚠️ 自评 | 2023 | ↗ 章节 ℹ️ |
| 真机 | Open X-Embodiment (OXE / RT-X) ↗ | Google DeepMind 牵头,21 机构 / 34 实验室 | 22 种本体(单/双臂/四足) | 约 100万+ 轨迹,527 技能,16万 tasks | ✅ 开源 | ✅ 已核 | 2023 | ↗ 章节 ℹ️ |
| 合成工具 | MimicGen ↗ | NVIDIA / UT Austin | 可配置(robosuite 生态) | 约 200 人工 → 50,000+,18 任务 | ✅ MIT | ✅ 已核 | 2023 | ↗ 章节 ℹ️ |
| 仿真环境 | Isaac Sim / Isaac Lab ↗ | NVIDIA | 全本体支持 | 基础设施(数千并行环境) | ✅ 免费(NVIDIA License) | ✅ 已核 | 2023-25 | ↗ 章节 ℹ️ |
| 真机 | RT-1 Dataset ↗ | Google / Everyday Robots | 单臂(EDR 7-DoF) | 13万+ episodes,700+ 任务,13台机17个月 | ✅ 开源(已并入 OXE) | ✅ 已核 | 2022 | ↗ 章节 ℹ️ |
| 真机 | BC-Z ↗ | Google / Berkeley / Stanford | 单臂(EDR) | 25,877 episodes,100 任务 | ✅ 开源 | ✅ 已核 | 2022 | ↗ 章节 ℹ️ |
| 真机 | Language-Table ↗ | Google Research | 桌面平面推动臂(2D) | 近 60万 语言标注轨迹(真机约 41.5万 + 仿真约 18.1万) | ✅ 开源 | ✅ 已核 | 2022 | ↗ 章节 ℹ️ |
| 人类视频 | Ego4D ↗ | Meta AI / 13 机构 | 人类第一视角(手部) | 3670 小时,9 国家,931 参与者 | ✅ MIT(数据集),研究用途 | ✅ 已核 | 2022 | ↗ 章节 ℹ️ |
当前显示 19 条 · 数据源共 19 条(转录自 embodied-data.md,日期 2026-07-01)
关联阅读
- 具身数据全景梳理 — 权威 prose:数据金字塔 / 采集范式 / 配比方法论 / 成本拐点
- 具身数据论文索引 — 80+ 篇数据相关论文分类索引
- 具身数据处理 — 清洗 / 归一化 / 配比策略
- 评测基准全景 — 评测侧
- 统一基准榜 — 四大仿真基准成绩可比排行
使用说明
数据集类型说明
- 真机遥操作:在真实机器人上通过遥操作(VR/3D 鼠标/外骨骼)采集的轨迹,带直接可用动作标签,单位成本最高。
- 人类视频:人类第一视角/手部操作视频,海量语义 + 动态先验,但无动作标签(需"翻译":IDM/手部追踪/流匹配)。
- 仿真环境:可放大数十~数百倍的仿真平台(MuJoCo/Isaac Sim/SAPIEN),存在 sim-to-real gap。
- 合成工具:程序化轨迹放大(MimicGen)或视频世界模型生成神经轨迹(DreamGen/Cosmos)。
许可注意事项
- ✅ 开源:MIT / Apache / CC-BY 等许可,可自由使用(遵守具体条款)。
- 研究用途:仅限学术研究,商业使用需额外授权。
- 未公开:论文提及但数据未公开,或许可未明确。
- NVIDIA Open Model License:open-weight 但非 CC-BY,商业使用需联系 NVIDIA。
规模口径说明
- 轨迹数 / episodes:单次任务执行序列(从初始到终止)。
- 小时数:总采集时长,注意不同任务复杂度下"小时数"含金量不同。
- 任务数 / 技能数:覆盖的任务种类,多样性比单一任务的数量更关键(见 embodied-data.md §六)。
- 聚合集规模:Open X-Embodiment 等聚合集的规模包含其子集(RT-1/BridgeData 等),勿重复计数。
维护记录
- 2026-07-01:首版上线,覆盖 10 个代表性真机数据集(含 OXE 聚合)+ 3 个人类视频数据集 + 7 个仿真环境/合成工具,共 20 条 entry。
