具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

GR-Dexter:把 GR-3 的流匹配配方搬上 56-DoF 双臂灵巧手的「硬件-模型-数据」一体化

arXiv: 2512.24210(v1 2025-12-30,v2 2026-01-09,cs.RO,非同行评审 Technical Report) 机构: 字节跳动 Seed(ByteDance Seed)· 作者 26 人(arXiv 口径;一作 Ruoshi Wen)· 项目页 byte-dexter.github.io/gr-dexter路线: VLA·连续动作(flow-matching);承袭 GR-3 的 MoT(Qwen2.5-VL 主干 + 动作 DiT),从夹爪扩到 88 维灵巧手动作空间;自研本体 ByteDexter V2 灵巧手

← 返回主报告


TL;DR

GR-Dexter 回答的问题是:VLA 怎么从夹爪走向高自由度双手灵巧操作? 痛点三连:动作空间爆炸、手-物频繁遮挡、真机数据贵。它的答案不是新模型范式,而是一套硬件-模型-数据(hardware-model-data)一体化工程:

  1. 硬件:自研 ByteDexter V2 灵巧手——21-DoF、16 个主动驱动(四指各 4-DoF + 拇指 5-DoF,较 V1 拇指多 1 个自由度且整体更小),连杆传动、电机集成于掌内,指尖高密度压阻触觉阵列,219mm × 108mm,Kapandji 拇指对掌测试 10/10。双手装上两条 Franka Research 3(7-DoF×2),整机 56-DoF
  2. 数据:VR 遥操作系统(Meta Quest 头显 + Manus 手套挂 VR 追踪器 + 脚踏板启停),人手→灵巧手重定向写成约束优化、SQP 求解;数据金字塔 = 网页图文 VL 数据 + 800h+ 人手第一视角轨迹(含 3D 手指追踪,另补 Pico VR 采集)+ 跨本体数据(Fourier ActionNet ~140h / OpenLoong Baihu 100k 条 / RoboMIND 107k 条)+ 每任务 ~20h 真机遥操作。
  3. 模型:跟随 GR-3Mixture-of-Transformers,Qwen2.5-VL 主干 + flow-matching 动作 DiT,约 4B 参数;与 GR-3 学二值夹爪不同,动作是 88 维向量(双臂关节 7×2 + 末端位姿 6D×2 + 双手主动关节 16×2 + 指尖位置 3D×5 指×2)。

作者自评(⚠️):长程化妆台收纳 OOD 布局 0.89 vs 朴素 VLA 0.64(基础设定 0.97 vs 0.96);泛化抓放已见物体 0.93(vs 0.87 / 0.85),23 个未见物体 0.85、未见指令 0.83

⚠️ 可信度提示:全部数字为作者自评真机评测,无第三方复现、无公开仿真基准;这是非同行评审的 Technical Report无代码、无权重、无数据集发布(项目页仅视频 + PDF + BibTeX,本次核查截至 2026-06)。论文末尾明言:"This work is presented for research purposes only. The technology described in this paper will not be incorporated into any ByteDance product."(仅作研究用途,不会并入任何字节跳动产品)。


1. 要解决的问题

把 VLA 从平行夹爪扩到双手多指灵巧操作,有三道结构性的坎:

  • 动作空间爆炸:夹爪 1 维开合 → 单手 21-DoF、双臂整机 56-DoF,模仿学习的拟合目标维度陡增;
  • 手-物遮挡:多指包覆抓取时视觉频繁被自家手指挡住,纯视觉策略观测劣化;
  • 真机数据成本:灵巧手遥操作比夹爪难得多(人手到机械手的重定向、追踪精度),数据吞吐低、贵。

GR-Dexter 的主张:这三道坎没有单点解,要硬件(可遥操、近人手构型的灵巧手)、数据(人手轨迹 + 跨本体补量)、模型(成熟的 VLM + 流匹配配方)三端一起做——所以叫 holistic hardware-model-data framework


2. 方法与架构

2.1 硬件:ByteDexter V2 + 56-DoF 双臂平台

  • ByteDexter V2 灵巧手:21-DoF、16 个主动驱动(四指各 4-DoF、拇指 5-DoF;较 V1 拇指增加 1 个 DoF、整体进一步缩小);连杆传动 + 电机全部集成在手掌内;指尖配高密度压阻触觉阵列(测法向接触力);高 219mm、宽 108mm;Kapandji 对掌测试 10/10
  • 双臂平台:两条 Franka Research 3(7-DoF/臂)各装一只 ByteDexter V2,整机 56-DoF(2×(7+21));4 路 RGB-D 相机:1 个主第一视角 + 3 个第三视角补充(缓解手-物遮挡)。
  • 注意:触觉阵列是硬件能力,策略输入中未见使用触觉(模型条件于视觉 + 语言 + 本体状态;触觉进策略待后续工作,待核)。

2.2 数据:VR 遥操作 + 数据金字塔

  • 遥操作系统:Meta Quest VR 头显 + Manus 手套(挂 VR 追踪控制器)+ 脚踏板(启/停遥操作);人手→ByteDexter 重定向写成约束优化问题,SQP(序列二次规划)求解
  • 数据金字塔(由廉价到昂贵):
    数据规模(⚠️ 自述)作用
    网页 VL 数据图文多源未详(待核)保开放世界语义(只训 VLM 主干)
    人手轨迹800h+ 第一视角视频 + 配对 3D 手/指追踪,另补 Pico VR 采集800h+(来源管线未详,待核)灵巧操作先验;经预处理映射到与机器人数据相同的视觉/运动学表示
    跨本体数据Fourier ActionNet / OpenLoong Baihu / RoboMIND~140h / 100k 条 / 107k 条补真机数据量、提升泛化
    真机遥操作化妆台收纳、抓放(20 个训练物体)等每任务约 20h精确执行的模仿目标

2.3 模型:MoT + flow-matching,88 维动作

  • 架构:明文承袭——"GR-Dexter follows GR-3 and adopts a Mixture-of-Transformer architecture";Qwen2.5-VL 预训练主干 + flow-matching 动作 DiT,共约 4B 参数(主干具体规格论文未单列;GR-3 用的是 Qwen2.5-VL-3B-Instruct,待核)。
  • 动作表示(与 GR-3 的关键差异):GR-3 学二值离散夹爪动作,GR-Dexter 每步动作是 88 维向量 = 双臂关节(7-DoF×2)+ 双臂末端 6D 位姿×2 + 双手主动关节(16×2)+ 每指指尖 3D 位置(5 指×2 手)——关节空间与任务空间(末端/指尖)冗余并列,动作块长度 k(值未披露,待核)。
  • 训练目标:next-token-prediction 损失 + flow-matching 损失之和;VL 数据只更新 VLM 主干,机器人轨迹更新全模型。
  • 推理:生成动作过一个参数化轨迹优化器平滑后执行;控制频率、推理时延未披露(待核)。训练算力/GPU 亦未披露(待核)。

3. 关键设计与创新点

  1. 「硬件-模型-数据」一体化叙事:灵巧手 VLA 的瓶颈被拆成三端联动解,而非单改模型——这是全文的方法论主张,也是与「拿现成手 + 现成模型」工作的差异点。
  2. 为遥操作而设计的手:ByteDexter V2 的近人手尺寸、拇指 5-DoF 对掌(Kapandji 10/10)直接服务于「人手可自然映射」,SQP 重定向 + Manus 手套 + 脚踏板组成可规模化采数闭环。
  3. 88 维冗余动作表示:同时监督关节空间(臂关节、手关节)与任务空间(末端位姿、指尖位置),把「手指去哪」显式写进监督信号——夹爪 VLA 没有的设计。
  4. 跨本体 + 人手数据补灵巧手数据荒:真机每任务只采 ~20h,大头靠 800h+ 人手轨迹与三个外部跨本体数据集 co-train;消融显示跨本体数据是泛化涨点的关键(§4)。

4. 实验与关键结果

⚠️ 全部为作者自评真机评测(无仿真基准);基线为 Plain VLA(只用真机数据训练)与 GR-Dexter w/o 跨本体数据。每批评测固定物体布局、各策略同布局对比;每批次 rollout 数未披露(待核)。

长程灵巧操作——化妆台收纳(6 件不同形状尺寸物品 + 抽屉等铰接物,双臂协同,~20h 遥操数据):

设定Plain VLAGR-Dexter
Basic(分布内)0.960.97
OOD(5 个未见布局,指令顺序不变)0.640.89

工具使用(定性):吸尘器任务(四指握持桌面吸尘器、拇指按电源键/调档、清扫纸屑)与夹面包(一手食品夹取可颂、一手持盘、放面包)——作者称「reliably across time」,无量化数字,视频见项目页。

泛化抓放(20 个训练物体、~20h 数据,按自然语言指令拣放入容器):

设定Plain VLAw/o 跨本体GR-Dexter
已见物体(10 批 × 5 物体)0.870.850.93
未见物体(23 个,10 批)0.85
未见指令(5 批,混合已见/未见物体)0.83

(未见设定下的基线数字本次未核出,以原文表格为准。)

消融要点:w/o 跨本体数据在分布内略低于 Plain VLA(0.85 vs 0.87),但全量 GR-Dexter 显著超过两者——作者论点:跨本体 co-train 是泛化与稳健性的主要来源,而非分布内涨点。


5. 局限与争议

  1. 全自评 + 非同行评审:Technical Report,无第三方复现,无公开仿真基准可横向比;基线只有自家 Plain VLA 消融,没有与 π0/GR00T 等外部模型对比
  2. 无代码、无权重、无数据、无硬件开源:项目页仅视频/PDF/BibTeX;且论文明言不进字节产品、仅作研究展示——复现与落地路径双双关闭,工业参考价值主要在「配方叙事」。
  3. 触觉造而未用:指尖压阻阵列是 V2 卖点,但策略输入未见触觉——「硬件-模型一体化」在触觉这环尚未闭合。
  4. 作者自承的两条:(1)人手数据只用了几百小时,海量第一视角人类数据未开发;(2)手与臂分开控制,妨碍接触丰富行为中的手-臂紧耦合协调。
  5. 细节披露不足:主干规格、动作块长度 k、控制频率、训练算力、每批 rollout 数均未披露(本页相应处标「待核」)。

6. 在 VLA 谱系中的位置

  • GR-3 的直系续作:同配方、换本体、扩动作空间。MoT + Qwen2.5-VL + flow-matching DiT + 「网页 VL / VR 人手 / 真机」数据金字塔全部承袭自 GR-3;变化在本体(ByteMini 22-DoF 夹爪 → Franka×2 + ByteDexter V2,56-DoF)与动作表示(二值夹爪 → 88 维)。字节 Seed 由此形成「GR-3 管通用、GR-Dexter 管灵巧」的双线。
  • 灵巧手 VLA 的工业样本,与 Helix 对照。Figure Helix 用双系统(S2 7B + S1 200Hz ⚠️)驱动 35-DoF 上身/16-DoF 五指手;GR-Dexter 用单一 MoT 流匹配直出 88 维动作块 + 轨迹平滑——「分频双系统」vs「单模型 + 后置平滑」是灵巧操作控制的两条路。与 π0.5 的开放世界泛化叙事相比,GR-Dexter 把「未见物体/指令」测试搬到了灵巧手上,但规模与场景多样性小得多。
  • 人手→灵巧手数据范式的实例。800h+ 第一视角人手轨迹 + SQP 重定向,正是 数据处理 中「运动学相近(人手→灵巧手)」一格的工业级实践;跨本体混训(Fourier ActionNet / OpenLoong / RoboMIND)亦见 具身数据全景
  • 本站归位:VLA·连续(扩散/流匹配)。硬件规格对照见 实验机器人本体

一句话:GR-Dexter 没有动模型范式,而是用「自研 21-DoF 手 + VR 遥操 + 800h 人手轨迹 + 跨本体混训」把 GR-3 的流匹配配方完整搬上 56-DoF 双臂灵巧平台,自评在长程 OOD(0.89 vs 0.64)与未见物体抓放(0.85)上立住;但全自评、无代码无权重、明言不产品化,触觉造而未用、手臂分控,更像一份「灵巧手 VLA 工程配方书」而非可复现的开放成果。


来源

已读 0/124