具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content

FASTER:用「视野感知调度」给流匹配 VLA 抢首动作时延

arXiv: 2603.19199(v1 2026-03-19) 机构: 香港大学(HKU)+ ACE Robotics(作者含 Yuxiang Lu, …, Hengshuang Zhao)· 项目页 innovator-zero.github.io/FASTER路线: VLA 推理加速方法(免训练、即插即用);针对流匹配 / flow-based VLA 的「首动作时延(Time-to-First-Action, TTFA)」

← 返回主报告


TL;DR

FASTER 解决流匹配 VLA 的一个被忽视的实时性瓶颈:首动作时延(TTFA)。现有 flow-based VLA 在整个动作块上用统一的时间步调度,意味着模型必须把多步去噪全部跑完才能派发任何一个动作——在动态任务里反应迟钝。FASTER 的核心是视野感知调度(Horizon-Aware Schedule, HAS):给近未来的动作分配激进采样(第一个动作单步去噪即可输出),给远视野的动作保留较慢去噪。它不改架构、免训练,即插即用地挂在现有流匹配 VLA 上,并以流式管线把动作逐个派发给控制器,无需等整块完成。

它把这个机制类比 LLM 的「首 token 时延(TTFT)」:动作块里早期动作其实更容易采样(去噪轨迹更「直」),所以可以更省步数。HAS 用一个 hit-time 公式 ui=(1i/(H1))αu0 给不同位置的动作分配不同完成时刻,首动作在单步采样后即定稿(u0=(N1)/N,N=10);训练时 50% 用 HAS、50% 用常规调度 以保鲁棒。

作者自评(⚠️):在 π0.5X-VLA 上把 TTFA 降低约 1.27–3.09×(取决于模型与 GPU),真机乒乓球任务完成度最佳。

⚠️ 关键澄清(别被「10×」误导):论文摘要里的「10× / tenfold」指的是把**「即时反应」那一步的去噪从 N 步压到 1 步**(N→1 的采样步数压缩),不是端到端的墙钟(wall-clock)10 倍加速。实测的首动作时延(TTFA)加速为约 1.27–3.09×(见 §4)。引用务必区分这两个口径。


1. 要解决的问题

流匹配 / 扩散式 VLA(如 π0 / π0.5)为得到一个动作块,要在整块上跑 N 步去噪,且所有位置的动作用同一时间步调度。后果是:派发第一个动作之前,必须等多步去噪全部完成 —— 这构成「首动作时延(TTFA)」的主导瓶颈,在需要快速反应的动态任务(接球、规避)里尤其致命。已有的异步执行(async)方法改善了块间动作的平滑 / 连续性,但没直接攻首动作要等多久这件事。

FASTER 把这件事形式化为一个新指标 TTFA(类比 LLM 的 TTFT),并指出一个关键观察:动作块里不同位置的采样难度不均 —— 早期(近未来)动作的去噪轨迹更「直」、更易采样,所以不该和远期动作用一样多的步数


2. 方法与架构

2.1 视野感知调度(HAS)

核心是索引相关的时间步分配。用 hit-time 公式让每个动作在不同时刻「到达」完成:

ui=(1iH1)αu0
  • 近未来动作:分配激进采样(步数少,极端情形单步即出);
  • 远视野动作:保留较慢、较多步的去噪;
  • 每个动作的局部时间步 τij=max(0, (ρjui)/(1ui))

首动作单步定稿:在 N=10 步设定下,u0=(N1)/N,使第一个动作经单次采样步即可输出 —— 这正是「10×(N→1)」的来源。

2.2 免训练 + 混合调度

  • 免训练 / 即插即用:不改架构,直接套在现有流匹配 VLA 上;
  • 混合调度训练(如做微调):50% 概率用 HAS、50% 用常规调度,以保留鲁棒性;
  • 流式派发:动作逐个派发给控制器,机器人不必等整块完成;
  • 早停:执行视野内的动作一旦定稿,跳过剩余采样。

2.3 与动作分块条件的协同

HAS 天然与训练时的 RTC(Real-Time Chunking)前缀条件对齐——既加速首动作,又借前缀条件维持块间连贯。


3. 关键设计与创新点

  1. 首次把「响应性 / TTFA」作为优化目标:此前 VLA 推理加速多盯轨迹平滑(异步执行),FASTER 明确攻「第一个动作要等多久」,并给出 TTFA 这一可量化指标。
  2. 非均匀采样难度的实证:pilot study 用「直度(straightness)」量化——早期动作需更少去噪步,为「按视野分配步数」提供依据。
  3. 视野感知调度本身:索引相关的 hit-time 时间步分配,近激进 / 远保守,首动作单步定稿。
  4. 免训练 + 正交性:不改架构、即插即用,且与压缩 / 量化 / 剪枝 / 缩模型等正交(它优化的是采样调度,不是参数或结构)。

4. 实验与关键结果

⚠️ 均为作者自评。注意区分「TTFA 加速倍数(实测)」与「10×(首动作 N→1 步压缩)」两个口径。

TTFA 加速(vs 异步基线,自评)

模型GPUTTFA 加速反应时间增益
π0.5RTX 40901.29×1.16×
π0.5RTX 40601.27×1.26×
X-VLARTX 40902.54×2.31×
X-VLARTX 40603.09×2.62×

真机(乒乓球):在 RTX 4090 / 4060 上完成度最佳,击球时刻拍位更准(定性)。

仿真(LIBERO / CALVIN):有边际退化——X-VLA 在 LIBERO Goal 套件 70.2% → 63.7%(承认长程精度的取舍)。作者论点:激进采样在离线长程基准上略损精度,但在真机具身设置下反而提升任务表现(反应更快更重要)。


5. 局限与争议

  1. 长程精度取舍:论文自承「加速采样可能略损动作预测」,离线长程基准(LIBERO Goal)上可见退化。
  2. 仿真 vs 真机口径分裂:同一方法在离线基准上掉点、在真机上反升,说明其增益高度依赖「反应速度重要」的动态任务设定,外推需谨慎。
  3. 仅验证流匹配 VLA:只在 flow-based(π0.5、X-VLA)上测;扩散 / 自回归 VLA 上未评估。
  4. 「10×」易被误读:如 TL;DR 所述,10× 是首动作去噪步压缩(N→1),非墙钟 10 倍;实测 TTFA 约 1.3–3.1×。
  5. 全为自评:无第三方复现;开源方面有项目页,代码仓库链接本次未在正文确认。

6. 在 VLA 谱系中的位置

  • 归入本站 [inference-deployment]主题。FASTER 与该专题里讨论的异步执行(async / RTC)、动作分块、实时控制是同一问题域,但切口不同:async 求块间平滑,FASTER 求首动作快,二者可叠加。
  • π0.5 为主要落地对象。直接挂在 π0.5(及 X-VLA)这类流匹配 VLA 上,不改其架构——是「给现成流匹配 VLA 免训练提速」的代表。
  • π0-FAST 的「快」不是一回事。π0-FAST 用 DCT+BPE 动作 tokenizer 让自回归 VLA 出动作更快(改的是动作表示);FASTER 改的是流匹配的采样时间步调度,两者「快」的层面正交。
  • 「按难度 / 视野分配算力」思路。和「早期动作更易采样、该少花步数」一脉,属于近期一批「自适应计算 / 推理加速」工作(本站候选中的 DySL-VLA 走「按动作重要性跳层」,FASTER 走「按视野调度去噪步」)的一员。
  • X-VLA 说明:其主要对照基座之一 X-VLA(流匹配 VLA,ICLR 2026)本站尚未单列,引用时注意。

一句话:FASTER 用「视野感知的时间步调度」给流匹配 VLA 的首动作抢时延——近未来动作单步去噪即出、远期保留慢去噪,免训练即插即用;实测 TTFA 约 1.3–3.1×(注意「10×」只是首动作 N→1 的步数压缩,非墙钟),代价是长程精度边际退化、只验证了流匹配一类。


来源

说明:第 4 节数字为作者自评,无第三方复现;「10×」为首动作去噪步压缩(N→1)口径、非墙钟加速,实测 TTFA 约 1.3–3.1×,引用请保留该区分。

已读 0/124