ManiSkill 2 / 3
20 任务族 / 12 领域
一页看清经典评测版图,再进入严格同口径成绩账本。可查不等于可混排,这里不制造跨任务、跨本体的“总冠军”。
覆盖操作、鲁棒泛化、双臂全身、真机竞技场、具身推理与导航;先读能力与口径,再决定数字能否比较。
20 任务族 / 12 领域
原始 100 任务 / 社区 18 任务
50 个 Sawyer 任务
模块化操作任务族
17 模板 / 650K 轨迹
10 仿真 + 9 真机语言任务
5 仿真 + 3 真机多阶段任务
8 任务 / 7 个泛化划分
家具装配 / 5100 demos
2 个双臂验证任务
下方只呈现已经结构化、且能锁定 split 与 protocol 的记录。
把真实机器人策略放进仿真环境,观察视觉与动力学迁移后的任务成功率。
已锁定同一 split;仍需结合输入视角、任务子集、自评属性和备注判断。
Google Robot 与 WidowX/Bridge 是不同机器人、任务族与数据分布,必须分开阅读。
仅 3 个同名模型出现在两个基准,数据不足以支撑“全能冠军”。
序号始终按记录值下界计算;切换“版本时间 / 模型名称”只改变展示顺序。
记录来源Physical Intelligence π0 arXiv:2410.24164
特殊说明⚠️ PI 口径,第三方复现见 benchmarks.md §1.5
回到 benchmarks.md 对应章节排行榜是检索入口,不是替代原论文的最终结论。
页面默认锁定一个 split。机器人、任务集、视角或输入设置改变后,记录会进入新的口径组。
例如 95.3–97.1 按 95.3 排序,图中用半透明区间补出上界,不把范围伪装成点估计。
“已核对”表示对照原表或维护方结果完成核查;“有出处”也可能仍是作者论文中的自报结果。
Variant Aggregation 样本过少,第三方复现又明确不等同官方数,暂留在评测全景中讨论。
ABCD→D 与 D→D 难度显著不同;标准样本不足时不与 ABC→D 零样本记录混排。
30-demo、24-atomic 与 Isaac-GR00T 25-task 都是不同任务集,仅保留维护方 multitask-300。
真机、双臂、人形、VQA 与 VLN 的指标轴不同,暂不生成跨域综合分或雷达图。