FASTER:用「视野感知调度」给流匹配 VLA 抢首动作时延
arXiv: 2603.19199(v1 2026-03-19) 机构: 香港大学(HKU)+ ACE Robotics(作者含 Yuxiang Lu, …, Hengshuang Zhao)· 项目页 innovator-zero.github.io/FASTER路线: VLA 推理加速方法(免训练、即插即用);针对流匹配 / flow-based VLA 的「首动作时延(Time-to-First-Action, TTFA)」
TL;DR
FASTER 解决流匹配 VLA 的一个被忽视的实时性瓶颈:首动作时延(TTFA)。现有 flow-based VLA 在整个动作块上用统一的时间步调度,意味着模型必须把多步去噪全部跑完才能派发任何一个动作——在动态任务里反应迟钝。FASTER 的核心是视野感知调度(Horizon-Aware Schedule, HAS):给近未来的动作分配激进采样(第一个动作单步去噪即可输出),给远视野的动作保留较慢去噪。它不改架构、免训练,即插即用地挂在现有流匹配 VLA 上,并以流式管线把动作逐个派发给控制器,无需等整块完成。
它把这个机制类比 LLM 的「首 token 时延(TTFT)」:动作块里早期动作其实更容易采样(去噪轨迹更「直」),所以可以更省步数。HAS 用一个 hit-time 公式
作者自评(⚠️):在 π0.5 与 X-VLA 上把 TTFA 降低约 1.27–3.09×(取决于模型与 GPU),真机乒乓球任务完成度最佳。
⚠️ 关键澄清(别被「10×」误导):论文摘要里的「10× / tenfold」指的是把**「即时反应」那一步的去噪从 N 步压到 1 步**(N→1 的采样步数压缩),不是端到端的墙钟(wall-clock)10 倍加速。实测的首动作时延(TTFA)加速为约 1.27–3.09×(见 §4)。引用务必区分这两个口径。
1. 要解决的问题
流匹配 / 扩散式 VLA(如 π0 / π0.5)为得到一个动作块,要在整块上跑 N 步去噪,且所有位置的动作用同一时间步调度。后果是:派发第一个动作之前,必须等多步去噪全部完成 —— 这构成「首动作时延(TTFA)」的主导瓶颈,在需要快速反应的动态任务(接球、规避)里尤其致命。已有的异步执行(async)方法改善了块间动作的平滑 / 连续性,但没直接攻首动作要等多久这件事。
FASTER 把这件事形式化为一个新指标 TTFA(类比 LLM 的 TTFT),并指出一个关键观察:动作块里不同位置的采样难度不均 —— 早期(近未来)动作的去噪轨迹更「直」、更易采样,所以不该和远期动作用一样多的步数。
2. 方法与架构
2.1 视野感知调度(HAS)
核心是索引相关的时间步分配。用 hit-time 公式让每个动作在不同时刻「到达」完成:
- 近未来动作:分配激进采样(步数少,极端情形单步即出);
- 远视野动作:保留较慢、较多步的去噪;
- 每个动作的局部时间步
。
首动作单步定稿:在 N=10 步设定下,
2.2 免训练 + 混合调度
- 免训练 / 即插即用:不改架构,直接套在现有流匹配 VLA 上;
- 混合调度训练(如做微调):50% 概率用 HAS、50% 用常规调度,以保留鲁棒性;
- 流式派发:动作逐个派发给控制器,机器人不必等整块完成;
- 早停:执行视野内的动作一旦定稿,跳过剩余采样。
2.3 与动作分块条件的协同
HAS 天然与训练时的 RTC(Real-Time Chunking)前缀条件对齐——既加速首动作,又借前缀条件维持块间连贯。
3. 关键设计与创新点
- 首次把「响应性 / TTFA」作为优化目标:此前 VLA 推理加速多盯轨迹平滑(异步执行),FASTER 明确攻「第一个动作要等多久」,并给出 TTFA 这一可量化指标。
- 非均匀采样难度的实证:pilot study 用「直度(straightness)」量化——早期动作需更少去噪步,为「按视野分配步数」提供依据。
- 视野感知调度本身:索引相关的 hit-time 时间步分配,近激进 / 远保守,首动作单步定稿。
- 免训练 + 正交性:不改架构、即插即用,且与压缩 / 量化 / 剪枝 / 缩模型等正交(它优化的是采样调度,不是参数或结构)。
4. 实验与关键结果
⚠️ 均为作者自评。注意区分「TTFA 加速倍数(实测)」与「10×(首动作 N→1 步压缩)」两个口径。
TTFA 加速(vs 异步基线,自评)
| 模型 | GPU | TTFA 加速 | 反应时间增益 |
|---|---|---|---|
| π0.5 | RTX 4090 | 1.29× | 1.16× |
| π0.5 | RTX 4060 | 1.27× | 1.26× |
| X-VLA | RTX 4090 | 2.54× | 2.31× |
| X-VLA | RTX 4060 | 3.09× | 2.62× |
真机(乒乓球):在 RTX 4090 / 4060 上完成度最佳,击球时刻拍位更准(定性)。
仿真(LIBERO / CALVIN):有边际退化——X-VLA 在 LIBERO Goal 套件 70.2% → 63.7%(承认长程精度的取舍)。作者论点:激进采样在离线长程基准上略损精度,但在真机具身设置下反而提升任务表现(反应更快更重要)。
5. 局限与争议
- 长程精度取舍:论文自承「加速采样可能略损动作预测」,离线长程基准(LIBERO Goal)上可见退化。
- 仿真 vs 真机口径分裂:同一方法在离线基准上掉点、在真机上反升,说明其增益高度依赖「反应速度重要」的动态任务设定,外推需谨慎。
- 仅验证流匹配 VLA:只在 flow-based(π0.5、X-VLA)上测;扩散 / 自回归 VLA 上未评估。
- 「10×」易被误读:如 TL;DR 所述,10× 是首动作去噪步压缩(N→1),非墙钟 10 倍;实测 TTFA 约 1.3–3.1×。
- 全为自评:无第三方复现;开源方面有项目页,代码仓库链接本次未在正文确认。
6. 在 VLA 谱系中的位置
- 归入本站 [inference-deployment]主题。FASTER 与该专题里讨论的异步执行(async / RTC)、动作分块、实时控制是同一问题域,但切口不同:async 求块间平滑,FASTER 求首动作快,二者可叠加。
- 以 π0.5 为主要落地对象。直接挂在 π0.5(及 X-VLA)这类流匹配 VLA 上,不改其架构——是「给现成流匹配 VLA 免训练提速」的代表。
- 与 π0-FAST 的「快」不是一回事。π0-FAST 用 DCT+BPE 动作 tokenizer 让自回归 VLA 出动作更快(改的是动作表示);FASTER 改的是流匹配的采样时间步调度,两者「快」的层面正交。
- 「按难度 / 视野分配算力」思路。和「早期动作更易采样、该少花步数」一脉,属于近期一批「自适应计算 / 推理加速」工作(本站候选中的 DySL-VLA 走「按动作重要性跳层」,FASTER 走「按视野调度去噪步」)的一员。
- X-VLA 说明:其主要对照基座之一 X-VLA(流匹配 VLA,ICLR 2026)本站尚未单列,引用时注意。
一句话:FASTER 用「视野感知的时间步调度」给流匹配 VLA 的首动作抢时延——近未来动作单步去噪即出、远期保留慢去噪,免训练即插即用;实测 TTFA 约 1.3–3.1×(注意「10×」只是首动作 N→1 的步数压缩,非墙钟),代价是长程精度边际退化、只验证了流匹配一类。
来源
- 论文:FASTER: Rethinking Real-Time Flow VLAs. arXiv:2603.19199(v1 2026-03-19,HKU + ACE Robotics)。https://arxiv.org/abs/2603.19199 · 全文 https://arxiv.org/html/2603.19199v1
- 项目页:https://innovator-zero.github.io/FASTER
- 相关:推理与部署 · π0.5 · π0-FAST
说明:第 4 节数字为作者自评,无第三方复现;「10×」为首动作去噪步压缩(N→1)口径、非墙钟加速,实测 TTFA 约 1.3–3.1×,引用请保留该区分。
