具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content
EVALUATION INDEX

VLA 基准索引与成绩榜

一页看清经典评测版图,再进入严格同口径成绩账本。可查不等于可混排,这里不制造跨任务、跨本体的“总冠军”。

可排名基准
4
经典索引
39
成绩记录
38
口径组
8

可排名基准

04 STRICT
  1. 01
    SimplerEnvREAL-TO-SIM
    记录
    19
    口径
    2
    指标
    0–100%
  2. 02
    LIBEROMULTI-SUITE
    记录
    7
    口径
    3
    指标
    0–100%
  3. 03
    CALVINLONG-HORIZON
    记录
    8
    口径
    2
    指标
    0–5
  4. 04
    RoboCasaKITCHEN-300
    记录
    4
    口径
    1
    指标
    0–100%
BENCHMARK ATLAS

经典与扩展基准索引

覆盖操作、鲁棒泛化、双臂全身、真机竞技场、具身推理与导航;先读能力与口径,再决定数字能否比较。

39 INDEXED
10 项
2023–24分口径读
经典操作

ManiSkill 2 / 3

20 任务族 / 12 领域

2019可扩榜
经典操作

RLBench

原始 100 任务 / 社区 18 任务

2019分口径读
经典操作

Meta-World

50 个 Sawyer 任务

2020数据 / 底座
经典操作

robosuite

模块化操作任务族

2023可扩榜
经典操作

VIMA-Bench

17 模板 / 650K 轨迹

2021分口径读
经典操作

CLIPort / Ravens

10 仿真 + 9 真机语言任务

2020数据 / 底座
经典操作

robomimic

5 仿真 + 3 真机多阶段任务

2023分口径读
经典操作

ARNOLD

8 任务 / 7 个泛化划分

2023异构指标
经典操作

FurnitureBench

家具装配 / 5100 demos

2023样本过窄
经典操作

ALOHA Sim

2 个双臂验证任务

状态只表示“进入统一榜的准备度”可扩榜分口径读异构指标数据 / 底座样本过窄
STRICT LEADERBOARD

同口径成绩榜

下方只呈现已经结构化、且能锁定 split 与 protocol 的记录。

REAL-TO-SIM · 任务成功率

SimplerEnv

把真实机器人策略放进仿真环境,观察视觉与动力学迁移后的任务成功率。

当前口径
Google Robot
记录数
10
记录跨度
11.0–85.7 %
最新版本
2025.08
RESULT SET10 / 10 条
比较口径
排序
条件可比
CURRENT SLICE

记录值分布

Google Robot · 0–100%
  1. 01RT-1(真实策略)有出处85.7 %
  2. 02MemoryVLA有出处77.7 %
  3. 03CogACT-Base已核对74.8 %
  4. 04VOTE有出处74.4 %
  5. 05SpatialVLA有出处73.8 %
条件可比均为点估计

为什么不做跨基准总分?

已锁定同一 split;仍需结合输入视角、任务子集、自评属性和备注判断。

Google Robot 与 WidowX/Bridge 是不同机器人、任务族与数据分布,必须分开阅读。

CROSS-BENCHMARK COVERAGE

仅 3 个同名模型出现在两个基准,数据不足以支撑“全能冠军”。

  • OpenVLASimplerEnv / LIBERO
  • VOTESimplerEnv / LIBERO
  • MemoryVLASimplerEnv / LIBERO
RANKED EVIDENCE

SimplerEnv · Google Robot

序号始终按记录值下界计算;切换“版本时间 / 模型名称”只改变展示顺序。

  1. 01
    RT-1(真实策略)Visual Matching · SimplerEnv arXiv:2405.05941
    有出处
    85.7%
    来源与口径备注

    记录来源SimplerEnv arXiv:2405.05941

    特殊说明真机训练策略在仿真 real-to-sim 基准

    回到 benchmarks.md 对应章节
  2. 02
    MemoryVLAVisual Matching · MemoryVLA arXiv:2508.19236
    有出处
    77.7%
    来源与口径备注

    记录来源MemoryVLA arXiv:2508.19236

    特殊说明当前数据没有额外口径备注。

    回到 benchmarks.md 对应章节
  3. 03
    CogACT-BaseVisual Matching · CogACT arXiv Table 1/7
    已核对
    74.8%
    来源与口径备注

    记录来源CogACT arXiv Table 1/7

    特殊说明✅ 核查确认(DiT-Base 动作模块)

    回到 benchmarks.md 对应章节
  4. 04
    VOTEVisual Matching · VOTE arXiv:2507.05116
    有出处
    74.4%
    来源与口径备注

    记录来源VOTE arXiv:2507.05116

    特殊说明当前数据没有额外口径备注。

    回到 benchmarks.md 对应章节
  5. 05
    SpatialVLAVisual Matching · SpatialVLA arXiv:2409.15250
    有出处
    73.8%
    来源与口径备注

    记录来源SpatialVLA arXiv:2409.15250

    特殊说明当前数据没有额外口径备注。

    回到 benchmarks.md 对应章节
  6. 06
    π0-BetaVisual Matching · Physical Intelligence π0 arXiv:2410.24164
    作者自评
    71.4%
    来源与口径备注

    记录来源Physical Intelligence π0 arXiv:2410.24164

    特殊说明⚠️ PI 口径,第三方复现见 benchmarks.md §1.5

    回到 benchmarks.md 对应章节
  7. 07
    RT-2-XVisual Matching · RT-2-X arXiv:2310.08864
    有出处
    46.3%
    来源与口径备注

    记录来源RT-2-X arXiv:2310.08864

    特殊说明3 任务子集 60.5%(口径分裂)

    回到 benchmarks.md 对应章节
  8. 08
    RT-1-XVisual Matching · Open X-Embodiment arXiv:2310.08864
    有出处
    42.4%
    来源与口径备注

    记录来源Open X-Embodiment arXiv:2310.08864

    特殊说明3 任务子集 49.4%(口径分裂)

    回到 benchmarks.md 对应章节
  9. 09
    OpenVLAVisual Matching · OpenVLA arXiv:2406.09246
    有出处
    34.3%
    来源与口径备注

    记录来源OpenVLA arXiv:2406.09246

    特殊说明社区复现(非原论文数,benchmarks.md 可信参照)

    回到 benchmarks.md 对应章节
  10. 10
    Octo-BaseVisual Matching · MemoryVLA arXiv:2508.19236
    有出处
    11%
    来源与口径备注

    记录来源MemoryVLA arXiv:2508.19236

    特殊说明当前数据没有额外口径备注。

    回到 benchmarks.md 对应章节
显示 10 条数据快照 2026-07-01总库 38 条
METHODOLOGY

读榜方法与边界

排行榜是检索入口,不是替代原论文的最终结论。

01 · COMPARABILITY

只在同一口径内排序

页面默认锁定一个 split。机器人、任务集、视角或输入设置改变后,记录会进入新的口径组。

02 · RANGE VALUES

范围值按下界排序

例如 95.3–97.1 按 95.3 排序,图中用半透明区间补出上界,不把范围伪装成点估计。

03 · RECORD STATUS

状态不等于独立复现

“已核对”表示对照原表或维护方结果完成核查;“有出处”也可能仍是作者论文中的自报结果。

RANKING BOUNDARY · 排名边界为什么索引中的基准不全部进入统一排序4 类边界

SimplerEnv

Variant Aggregation 样本过少,第三方复现又明确不等同官方数,暂留在评测全景中讨论。

CALVIN

ABCD→D 与 D→D 难度显著不同;标准样本不足时不与 ABC→D 零样本记录混排。

RoboCasa

30-demo、24-atomic 与 Isaac-GR00T 25-task 都是不同任务集,仅保留维护方 multitask-300。

其他维度

真机、双臂、人形、VQA 与 VLN 的指标轴不同,暂不生成跨域综合分或雷达图。

已读 0/124