告别卡顿:
世界动作模型实时部署的实战经验与总结
概要
World Action Models(WAMs)的推理延迟长达秒级,直接部署会导致机器人在每个动作边界卡顿,无法实时响应环境变化。本文系统地评估了六种部署策略。核心结论表明:
- 做好时序对齐后,简单的输出层融合(async+blend)即可作为有效基线,同时也是其他所有融合方法的基础;
- 速度场引导(infer)因仅改变去噪方向,无法保证 WAMs 的动作连续性;
- 直接修改动作(simple)虽能提升动作平滑性,却会损失精度,这一点在精细操作中十分明显;
- 训练阶段注入前缀条件(train),能够让模型学会自然衔接前序动作,在动态、精细与长程三类任务中兼顾流畅性与准确性,综合表现优于其他策略。
问题
为什么 WAMs 在实机上部署难?
WAMs 以 flow matching 为生成骨干,每次推理通过迭代去噪生成一段固定长度的动作序列(action chunk)。传统同步执行(sync)的策略是:执行完推理得到的完整 action chunk 后再开启新的推理。由于 WAM 在生成过程存在不可忽略的端到端延迟,每个 action chunk 执行完机器人都会停顿等待,这带来两个问题:
- 机器人运动不连贯;
- 无法应对场景中的移动目标或突发障碍物。
异步推理(async)的思路是:在当前 action chunk 执行到第 s 帧时就提前发起下一次推理,让计算与执行并行。但新旧两个 action chunk 基于不同时刻的观测,预测的动作在重叠区域会有出入。这就引出了一个核心问题:如何在异步切换中兼顾流畅性与准确性?
时序结构
在介绍具体方法之前,我们先建立统一的时序描述框架。
设 chunk n 执行到第 s 帧时触发下一次推理。真实推理耗时记为 d 帧;部署时无法预先获知 d,因此控制器使用估计值 d_est 决定新 chunk 的切换位置。chunk n 与 chunk n+1 的时序关系如下:
新 chunk 被分为三个区域:
切换点的选择:控制器在新 chunk 的第 d_est 帧处切换,该帧应对应机器人当前的实时状态。
异步部署要正常工作,必须同时满足两个条件:
- 基于时间戳的时序对齐:每一帧命令都必须与正确的观测时刻对应。我们通过硬件时间戳实现了这一点。若缺少对齐,模型将接收“错位”的状态,生成的动作从根本上就是错误的,任何平滑方法都难以补救。
- 准确的延迟估计 d_est:我们将 d_est 设为测量到的端到端延迟中位数——这只是一个粗略近似,并非精确估计。若真实延迟 d > d_est,切换将落在错误的帧上,产生不可恢复的位置跳变。准确的在线延迟估计目前仍是一个未解问题。
技术方法
如下表所示,我们将现有方法归纳为五个类别,共实现六种策略。sync 和 async 是基本的调度模式,基于 async 之上有四种不同的融合方法。
1. sync:同步执行(基线)
等待推理完成再切换,不做任何融合。精度无损失,但每个边界都会停顿,动态任务完全失效。
2. async:纯异步切换
提前触发推理,到达后在 d_est 处硬切换,不进行融合。这消除了等待停顿,但没有解决不同 chunk 的偏差问题。同时,它也是所有后续融合方法的基础。
3. async+blend:异步 + 加权
该方法与 SmolVLA [1] 中异步推理框架采用的 chunk fusion 思路相对应:在模型完成推理后,直接对新旧 chunk 的重叠区域进行加权融合。
本文采用的融合形式为:
权重 w(t) 在延迟区域为 1,向末端衰减到 0。不修改模型,不需要重训。这是在做好时序对齐后,最简单直接的方案。
4. simple:去噪过程中加权融合
该方法来自 HoloBrain-0 Technical Report,论文中称为 SimpleRTC [2],本文将其记为 simple。在去噪过程的每一步,将旧 chunk 的动作作为约束融合进新 chunk 的预测中,权重函数与 async+blend 相同。比后处理更激进,平滑效果更强,但引入了精度与平滑之间的 trade-off。
5. infer:推理时 RTC
该方法来自 Real-Time Execution of Action Chunking Flow Policies [3],本文将其记为 infer。它不直接修改动作,而是修改去噪的速度场(velocity field)——在每一步去噪时,将速度方向向旧 chunk 的延迟区域“拉”。理论上更优雅(不强行覆盖预测),但在 WAM 上实测发现,它无法保证动作的连续性。
6. train:前缀条件化方法
该方法来自 Training-Time Action Conditioning for Efficient Real-Time Chunking [4],本文将其记为 train。在训练时,将旧 chunk 的延迟区域作为干净的条件信号注入,让模型学会从给定的前缀自然地延续。权重采用阶跃函数:延迟区域内为 1,之后为 0——强约束前缀,释放剩余部分让模型自由预测。
该方法需要重新训练,但推理时零额外开销。
实验
离线实验
在上真机之前,我们先进行离线开环评测:从训练数据中采样间隔 s 帧的两个观测,分别送入模型得到两个 chunk,然后计算重叠区域的位置误差。
误差分两个指标:MAE(反映整体轨迹质量)和 max error(单次大的跳变可能使机器人进入异常状态,更贴近任务关键性)。
分别报告四个分量:arm(位置误差,m)、torso(位置误差,m)、head(关节角度误差,rad)、gripper(0–100)。
关键发现
- infer 在延迟区域的约束失效:速度场引导是一种软约束,只改变去噪方向,而不直接约束输出动作。延迟区域的 MAE 和 max error 均显著高于 simple 和 train,chunk 边界的跳变不可避免。
- simple 和 train 都能将延迟区域误差压到接近零。二者的差异体现在剩余 overlap 区域:simple 的激进融合使误差全程保持在较低水平;train 仅约束前缀,之后误差随步数增长——但这正是它保留模型原始预测精度所付出的代价。
- 延迟区域内外呈现明显差异:simple 和 train 在延迟区域内具有较强约束;进入剩余 overlap 后,误差随预测步数逐渐累积,反映了相邻 chunk 在长时预测上的分歧。
真机实验
我们选取了三个有代表性的真实场景进行评测,同时选取了三个指标:completion score, completion time 以及 jerk。我们在真实双臂机器人上,每个方法×任务都组合运行 5 次,针对不同的指标取平均值。
以下视频均为原速(1×)播放,未经加速或慢放。
结果与分析
动态任务:传送带取物
sync 得分为 20,这很好理解,毕竟推理等待时间内无法追踪移动目标。async 同样为 20 分——虽有响应,但硬切换带来的 jerk 极高,无法完成抓取。async+blend 得分为 40,说明时序对齐加上最简单的融合,已经能提高任务完成度了。train 以 96 分领先,兼顾了响应性与平滑度。
精细操作:插块入槽
simple 在该任务得分仅为 27.5——由于该任务对精度要求极高,说明了激进的动作融合会导致精度的下降。sync(72.5)和 train(70)都保持了高精度;train 耗时更短(12.1s vs 19.4s)且 jerk 更低。
长时序:食物放入微波炉
train 和 sync 均达到 96 分,区别在于耗时:sync 因每个边界的停顿累计耗时 85.2s;train 仅需 68.9s,异步方法普遍在 60–66s 内完成。
结论
- 做好时间戳对齐后,简单的 async+blend 即可作为一个值得参考的基线。
通过时间戳建立观测与模型输出 action chunk 的准确对应,并进一步对齐不同 action chunk,只需在动作输出端进行加权融合,无需修改模型或训练流程,即可显著降低 jerk。准确的异步对齐也是跨 chunk 融合方法正常工作的前提。 - velocity-level guidance(infer)在 WAM 上无法保证动作连续性。
我们将 RTC 的速度场引导迁移至世界模型部署,但实验发现,这类软约束只影响去噪方向,并不能很好地约束最终输出的动作,因此 chunk 边界处仍可能出现位置跳变。离线分析与真机实验均验证了这一结论。 - 直接修改动作的方式存在精度—平滑 tradeoff。
simple 在动态任务上表现优异,但在精细操作任务中得分大幅下降,说明直接平滑动作会降低最终的精度。 - 训练时注入前缀的方式在三类任务上全面领先,是 WAM 上效果最好的异步融合策略。
train 通过在训练阶段注入前缀条件绕开了上述权衡,使模型学会自然延续已有动作,无需在推理阶段折中精度与平滑性,并在三类任务上均取得最佳表现。
局限与展望
突发环境变化下的响应性。当前所有方法都假设旧 chunk 能提供有用的引导。一旦出现突发障碍物,新 chunk 必须大幅偏离旧轨迹,此时前缀约束反而会成为干扰。
如何在保持平滑的同时,对突发环境变化保持足够的响应性,是我们下一步希望探索的方向。
引用
- [1] Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, Simon Alibert, Matthieu Cord, Thomas Wolf, and Remi Cadene. SmolVLA: A vision-language-action model for affordable and efficient robotics, 2025
- [2] Xuewu Lin, Yun Du, Hongyu Xie, et al. HoloBrain-0 technical report. arXiv:2602.12062, 2026.
- [3] Kevin Black, Manuel Y Galliker, and Sergey Levine. Real-time execution of action chunking flow policies. arXiv:2506.07339, 2025.
- [4] Kevin Black, Allen Z. Ren, Michael Equi, and Sergey Levine. Training-time action conditioning for efficient real-time chunking, 2025.
引用
@misc{motubrainteam2026worldactionmodelsreal,
title={World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment},
author={Motubrain Team},
year={2026},
eprint={2608.01880},
archivePrefix={arXiv},
primaryClass={cs.RO},
url={https://arxiv.org/abs/2608.01880},
}