GR-Dexter:把 GR-3 的流匹配配方搬上 56-DoF 双臂灵巧手的「硬件-模型-数据」一体化
arXiv: 2512.24210(v1 2025-12-30,v2 2026-01-09,cs.RO,非同行评审 Technical Report) 机构: 字节跳动 Seed(ByteDance Seed)· 作者 26 人(arXiv 口径;一作 Ruoshi Wen)· 项目页 byte-dexter.github.io/gr-dexter路线: VLA·连续动作(flow-matching);承袭 GR-3 的 MoT(Qwen2.5-VL 主干 + 动作 DiT),从夹爪扩到 88 维灵巧手动作空间;自研本体 ByteDexter V2 灵巧手
TL;DR
GR-Dexter 回答的问题是:VLA 怎么从夹爪走向高自由度双手灵巧操作? 痛点三连:动作空间爆炸、手-物频繁遮挡、真机数据贵。它的答案不是新模型范式,而是一套硬件-模型-数据(hardware-model-data)一体化工程:
- 硬件:自研 ByteDexter V2 灵巧手——21-DoF、16 个主动驱动(四指各 4-DoF + 拇指 5-DoF,较 V1 拇指多 1 个自由度且整体更小),连杆传动、电机集成于掌内,指尖高密度压阻触觉阵列,219mm × 108mm,Kapandji 拇指对掌测试 10/10。双手装上两条 Franka Research 3(7-DoF×2),整机 56-DoF。
- 数据:VR 遥操作系统(Meta Quest 头显 + Manus 手套挂 VR 追踪器 + 脚踏板启停),人手→灵巧手重定向写成约束优化、SQP 求解;数据金字塔 = 网页图文 VL 数据 + 800h+ 人手第一视角轨迹(含 3D 手指追踪,另补 Pico VR 采集)+ 跨本体数据(Fourier ActionNet ~140h / OpenLoong Baihu 100k 条 / RoboMIND 107k 条)+ 每任务 ~20h 真机遥操作。
- 模型:跟随 GR-3 的 Mixture-of-Transformers,Qwen2.5-VL 主干 + flow-matching 动作 DiT,约 4B 参数;与 GR-3 学二值夹爪不同,动作是 88 维向量(双臂关节 7×2 + 末端位姿 6D×2 + 双手主动关节 16×2 + 指尖位置 3D×5 指×2)。
作者自评(⚠️):长程化妆台收纳 OOD 布局 0.89 vs 朴素 VLA 0.64(基础设定 0.97 vs 0.96);泛化抓放已见物体 0.93(vs 0.87 / 0.85),23 个未见物体 0.85、未见指令 0.83。
⚠️ 可信度提示:全部数字为作者自评真机评测,无第三方复现、无公开仿真基准;这是非同行评审的 Technical Report。无代码、无权重、无数据集发布(项目页仅视频 + PDF + BibTeX,本次核查截至 2026-06)。论文末尾明言:"This work is presented for research purposes only. The technology described in this paper will not be incorporated into any ByteDance product."(仅作研究用途,不会并入任何字节跳动产品)。
1. 要解决的问题
把 VLA 从平行夹爪扩到双手多指灵巧操作,有三道结构性的坎:
- 动作空间爆炸:夹爪 1 维开合 → 单手 21-DoF、双臂整机 56-DoF,模仿学习的拟合目标维度陡增;
- 手-物遮挡:多指包覆抓取时视觉频繁被自家手指挡住,纯视觉策略观测劣化;
- 真机数据成本:灵巧手遥操作比夹爪难得多(人手到机械手的重定向、追踪精度),数据吞吐低、贵。
GR-Dexter 的主张:这三道坎没有单点解,要硬件(可遥操、近人手构型的灵巧手)、数据(人手轨迹 + 跨本体补量)、模型(成熟的 VLM + 流匹配配方)三端一起做——所以叫 holistic hardware-model-data framework。
2. 方法与架构
2.1 硬件:ByteDexter V2 + 56-DoF 双臂平台
- ByteDexter V2 灵巧手:21-DoF、16 个主动驱动(四指各 4-DoF、拇指 5-DoF;较 V1 拇指增加 1 个 DoF、整体进一步缩小);连杆传动 + 电机全部集成在手掌内;指尖配高密度压阻触觉阵列(测法向接触力);高 219mm、宽 108mm;Kapandji 对掌测试 10/10。
- 双臂平台:两条 Franka Research 3(7-DoF/臂)各装一只 ByteDexter V2,整机 56-DoF(2×(7+21));4 路 RGB-D 相机:1 个主第一视角 + 3 个第三视角补充(缓解手-物遮挡)。
- 注意:触觉阵列是硬件能力,策略输入中未见使用触觉(模型条件于视觉 + 语言 + 本体状态;触觉进策略待后续工作,待核)。
2.2 数据:VR 遥操作 + 数据金字塔
- 遥操作系统:Meta Quest VR 头显 + Manus 手套(挂 VR 追踪控制器)+ 脚踏板(启/停遥操作);人手→ByteDexter 重定向写成约束优化问题,SQP(序列二次规划)求解。
- 数据金字塔(由廉价到昂贵):
层 数据 规模(⚠️ 自述) 作用 网页 VL 数据 图文多源 未详(待核) 保开放世界语义(只训 VLM 主干) 人手轨迹 800h+ 第一视角视频 + 配对 3D 手/指追踪,另补 Pico VR 采集 800h+(来源管线未详,待核) 灵巧操作先验;经预处理映射到与机器人数据相同的视觉/运动学表示 跨本体数据 Fourier ActionNet / OpenLoong Baihu / RoboMIND ~140h / 100k 条 / 107k 条 补真机数据量、提升泛化 真机遥操作 化妆台收纳、抓放(20 个训练物体)等 每任务约 20h 精确执行的模仿目标
2.3 模型:MoT + flow-matching,88 维动作
- 架构:明文承袭——"GR-Dexter follows GR-3 and adopts a Mixture-of-Transformer architecture";Qwen2.5-VL 预训练主干 + flow-matching 动作 DiT,共约 4B 参数(主干具体规格论文未单列;GR-3 用的是 Qwen2.5-VL-3B-Instruct,待核)。
- 动作表示(与 GR-3 的关键差异):GR-3 学二值离散夹爪动作,GR-Dexter 每步动作是 88 维向量 = 双臂关节(7-DoF×2)+ 双臂末端 6D 位姿×2 + 双手主动关节(16×2)+ 每指指尖 3D 位置(5 指×2 手)——关节空间与任务空间(末端/指尖)冗余并列,动作块长度 k(值未披露,待核)。
- 训练目标:next-token-prediction 损失 + flow-matching 损失之和;VL 数据只更新 VLM 主干,机器人轨迹更新全模型。
- 推理:生成动作过一个参数化轨迹优化器平滑后执行;控制频率、推理时延未披露(待核)。训练算力/GPU 亦未披露(待核)。
3. 关键设计与创新点
- 「硬件-模型-数据」一体化叙事:灵巧手 VLA 的瓶颈被拆成三端联动解,而非单改模型——这是全文的方法论主张,也是与「拿现成手 + 现成模型」工作的差异点。
- 为遥操作而设计的手:ByteDexter V2 的近人手尺寸、拇指 5-DoF 对掌(Kapandji 10/10)直接服务于「人手可自然映射」,SQP 重定向 + Manus 手套 + 脚踏板组成可规模化采数闭环。
- 88 维冗余动作表示:同时监督关节空间(臂关节、手关节)与任务空间(末端位姿、指尖位置),把「手指去哪」显式写进监督信号——夹爪 VLA 没有的设计。
- 跨本体 + 人手数据补灵巧手数据荒:真机每任务只采 ~20h,大头靠 800h+ 人手轨迹与三个外部跨本体数据集 co-train;消融显示跨本体数据是泛化涨点的关键(§4)。
4. 实验与关键结果
⚠️ 全部为作者自评真机评测(无仿真基准);基线为 Plain VLA(只用真机数据训练)与 GR-Dexter w/o 跨本体数据。每批评测固定物体布局、各策略同布局对比;每批次 rollout 数未披露(待核)。
长程灵巧操作——化妆台收纳(6 件不同形状尺寸物品 + 抽屉等铰接物,双臂协同,~20h 遥操数据):
| 设定 | Plain VLA | GR-Dexter |
|---|---|---|
| Basic(分布内) | 0.96 | 0.97 |
| OOD(5 个未见布局,指令顺序不变) | 0.64 | 0.89 |
工具使用(定性):吸尘器任务(四指握持桌面吸尘器、拇指按电源键/调档、清扫纸屑)与夹面包(一手食品夹取可颂、一手持盘、放面包)——作者称「reliably across time」,无量化数字,视频见项目页。
泛化抓放(20 个训练物体、~20h 数据,按自然语言指令拣放入容器):
| 设定 | Plain VLA | w/o 跨本体 | GR-Dexter |
|---|---|---|---|
| 已见物体(10 批 × 5 物体) | 0.87 | 0.85 | 0.93 |
| 未见物体(23 个,10 批) | — | — | 0.85 |
| 未见指令(5 批,混合已见/未见物体) | — | — | 0.83 |
(未见设定下的基线数字本次未核出,以原文表格为准。)
消融要点:w/o 跨本体数据在分布内略低于 Plain VLA(0.85 vs 0.87),但全量 GR-Dexter 显著超过两者——作者论点:跨本体 co-train 是泛化与稳健性的主要来源,而非分布内涨点。
5. 局限与争议
- 全自评 + 非同行评审:Technical Report,无第三方复现,无公开仿真基准可横向比;基线只有自家 Plain VLA 消融,没有与 π0/GR00T 等外部模型对比。
- 无代码、无权重、无数据、无硬件开源:项目页仅视频/PDF/BibTeX;且论文明言不进字节产品、仅作研究展示——复现与落地路径双双关闭,工业参考价值主要在「配方叙事」。
- 触觉造而未用:指尖压阻阵列是 V2 卖点,但策略输入未见触觉——「硬件-模型一体化」在触觉这环尚未闭合。
- 作者自承的两条:(1)人手数据只用了几百小时,海量第一视角人类数据未开发;(2)手与臂分开控制,妨碍接触丰富行为中的手-臂紧耦合协调。
- 细节披露不足:主干规格、动作块长度 k、控制频率、训练算力、每批 rollout 数均未披露(本页相应处标「待核」)。
6. 在 VLA 谱系中的位置
- GR-3 的直系续作:同配方、换本体、扩动作空间。MoT + Qwen2.5-VL + flow-matching DiT + 「网页 VL / VR 人手 / 真机」数据金字塔全部承袭自 GR-3;变化在本体(ByteMini 22-DoF 夹爪 → Franka×2 + ByteDexter V2,56-DoF)与动作表示(二值夹爪 → 88 维)。字节 Seed 由此形成「GR-3 管通用、GR-Dexter 管灵巧」的双线。
- 灵巧手 VLA 的工业样本,与 Helix 对照。Figure Helix 用双系统(S2 7B + S1 200Hz ⚠️)驱动 35-DoF 上身/16-DoF 五指手;GR-Dexter 用单一 MoT 流匹配直出 88 维动作块 + 轨迹平滑——「分频双系统」vs「单模型 + 后置平滑」是灵巧操作控制的两条路。与 π0.5 的开放世界泛化叙事相比,GR-Dexter 把「未见物体/指令」测试搬到了灵巧手上,但规模与场景多样性小得多。
- 人手→灵巧手数据范式的实例。800h+ 第一视角人手轨迹 + SQP 重定向,正是 数据处理 中「运动学相近(人手→灵巧手)」一格的工业级实践;跨本体混训(Fourier ActionNet / OpenLoong / RoboMIND)亦见 具身数据全景。
- 本站归位:VLA·连续(扩散/流匹配)。硬件规格对照见 实验机器人本体。
一句话:GR-Dexter 没有动模型范式,而是用「自研 21-DoF 手 + VR 遥操 + 800h 人手轨迹 + 跨本体混训」把 GR-3 的流匹配配方完整搬上 56-DoF 双臂灵巧平台,自评在长程 OOD(0.89 vs 0.64)与未见物体抓放(0.85)上立住;但全自评、无代码无权重、明言不产品化,触觉造而未用、手臂分控,更像一份「灵巧手 VLA 工程配方书」而非可复现的开放成果。
来源
- 论文:GR-Dexter Technical Report. arXiv:2512.24210(v1 2025-12-30,v2 2026-01-09,cs.RO,非同行评审)。ByteDance Seed。https://arxiv.org/abs/2512.24210 · 全文 https://arxiv.org/html/2512.24210v2(ByteDexter V2 21-DoF/16 主动、56-DoF、88 维动作、SQP 重定向、800h+ 人手轨迹、跨本体三数据集、全部成绩与局限均出自此)
- 项目页:https://byte-dexter.github.io/gr-dexter(视频/图示;无代码、无权重、无数据下载,截至 2026-06 核查)
- 本站交叉:GR-3 细读(直系前作)· Helix(灵巧手对照)· π0.5(开放世界泛化对照)· 实验机器人本体 · 数据处理 · 具身数据全景
- 说明:第 4 节数字均为作者自评;论文末尾原文声明 "will not be incorporated into any ByteDance product";未披露项(主干规格/动作块长度/控制频率/算力/未见设定基线)按本站体例标「待核」。
