告别卡顿:
世界动作模型实时部署的实战经验与总结

概要

World Action Models(WAMs)的推理延迟长达秒级,直接部署会导致机器人在每个动作边界卡顿,无法实时响应环境变化。本文系统地评估了六种部署策略。核心结论表明:

  • 做好时序对齐后,简单的输出层融合(async+blend)即可作为有效基线,同时也是其他所有融合方法的基础;
  • 速度场引导(infer)因仅改变去噪方向,无法保证 WAMs 的动作连续性;
  • 直接修改动作(simple)虽能提升动作平滑性,却会损失精度,这一点在精细操作中十分明显;
  • 训练阶段注入前缀条件(train),能够让模型学会自然衔接前序动作,在动态、精细与长程三类任务中兼顾流畅性与准确性,综合表现优于其他策略。

问题

为什么 WAMs 在实机上部署难?

WAMs 以 flow matching 为生成骨干,每次推理通过迭代去噪生成一段固定长度的动作序列(action chunk)。传统同步执行(sync)的策略是:执行完推理得到的完整 action chunk 后再开启新的推理。由于 WAM 在生成过程存在不可忽略的端到端延迟,每个 action chunk 执行完机器人都会停顿等待,这带来两个问题:

  • 机器人运动不连贯;
  • 无法应对场景中的移动目标或突发障碍物。

异步推理(async)的思路是:在当前 action chunk 执行到第 s 帧时就提前发起下一次推理,让计算与执行并行。但新旧两个 action chunk 基于不同时刻的观测,预测的动作在重叠区域会有出入。这就引出了一个核心问题:如何在异步切换中兼顾流畅性与准确性?

时序结构

在介绍具体方法之前,我们先建立统一的时序描述框架。

设 chunk n 执行到第 s 帧时触发下一次推理。真实推理耗时记为 d 帧;部署时无法预先获知 d,因此控制器使用估计值 d_est 决定新 chunk 的切换位置。chunk n 与 chunk n+1 的时序关系如下:

同步、异步模式下 chunk 执行的时序图
Figure 1 同步、异步模式下 chunk 执行的时序图,异步模式下新 chunk 被分为延迟区域(黄)、剩余重叠区域(绿)和非重叠区域(蓝)。

新 chunk 被分为三个区域:

不同 chunk 区域定义
Table 1 不同 chunk 区域定义

切换点的选择:控制器在新 chunk 的第 d_est 帧处切换,该帧应对应机器人当前的实时状态。

异步部署要正常工作,必须同时满足两个条件:

  • 基于时间戳的时序对齐:每一帧命令都必须与正确的观测时刻对应。我们通过硬件时间戳实现了这一点。若缺少对齐,模型将接收“错位”的状态,生成的动作从根本上就是错误的,任何平滑方法都难以补救。
  • 准确的延迟估计 d_est:我们将 d_est 设为测量到的端到端延迟中位数——这只是一个粗略近似,并非精确估计。若真实延迟 d > d_est,切换将落在错误的帧上,产生不可恢复的位置跳变。准确的在线延迟估计目前仍是一个未解问题。

技术方法

如下表所示,我们将现有方法归纳为五个类别,共实现六种策略。sync 和 async 是基本的调度模式,基于 async 之上有四种不同的融合方法。

不同方法分类以及核心机制
Table 2 不同方法分类以及核心机制

1. sync:同步执行(基线)

等待推理完成再切换,不做任何融合。精度无损失,但每个边界都会停顿,动态任务完全失效。

2. async:纯异步切换

提前触发推理,到达后在 d_est 处硬切换,不进行融合。这消除了等待停顿,但没有解决不同 chunk 的偏差问题。同时,它也是所有后续融合方法的基础。

3. async+blend:异步 + 加权

该方法与 SmolVLA [1] 中异步推理框架采用的 chunk fusion 思路相对应:在模型完成推理后,直接对新旧 chunk 的重叠区域进行加权融合。

本文采用的融合形式为:

融合公式

权重 w(t) 在延迟区域为 1,向末端衰减到 0。不修改模型,不需要重训。这是在做好时序对齐后,最简单直接的方案

4. simple:去噪过程中加权融合

该方法来自 HoloBrain-0 Technical Report,论文中称为 SimpleRTC [2],本文将其记为 simple。在去噪过程的每一步,将旧 chunk 的动作作为约束融合进新 chunk 的预测中,权重函数与 async+blend 相同。比后处理更激进,平滑效果更强,但引入了精度与平滑之间的 trade-off。

5. infer:推理时 RTC

该方法来自 Real-Time Execution of Action Chunking Flow Policies [3],本文将其记为 infer。它不直接修改动作,而是修改去噪的速度场(velocity field)——在每一步去噪时,将速度方向向旧 chunk 的延迟区域“拉”。理论上更优雅(不强行覆盖预测),但在 WAM 上实测发现,它无法保证动作的连续性。

6. train:前缀条件化方法

该方法来自 Training-Time Action Conditioning for Efficient Real-Time Chunking [4],本文将其记为 train。在训练时,将旧 chunk 的延迟区域作为干净的条件信号注入,让模型学会从给定的前缀自然地延续。权重采用阶跃函数:延迟区域内为 1,之后为 0——强约束前缀,释放剩余部分让模型自由预测。

该方法需要重新训练,但推理时零额外开销。

异步调度模式下不同的 action chunk 融合方法
Figure 2 异步调度模式下不同的 action chunk 融合方法

实验

离线实验

在上真机之前,我们先进行离线开环评测:从训练数据中采样间隔 s 帧的两个观测,分别送入模型得到两个 chunk,然后计算重叠区域的位置误差。

误差分两个指标:MAE(反映整体轨迹质量)和 max error(单次大的跳变可能使机器人进入异常状态,更贴近任务关键性)。

分别报告四个分量:arm(位置误差,m)、torso(位置误差,m)、head(关节角度误差,rad)、gripper(0–100)。

各分量平均绝对误差(MAE)随 overlap 步数变化
Figure 3 各分量平均绝对误差(MAE)随 overlap 步数变化,误差越低说明该方法对动作的约束能力越强
各分量最大绝对误差随 overlap 步数变化
Figure 4 各分量最大绝对误差随 overlap 步数变化,误差越低说明该方法对动作的约束能力越强

关键发现

  • infer 在延迟区域的约束失效:速度场引导是一种软约束,只改变去噪方向,而不直接约束输出动作。延迟区域的 MAE 和 max error 均显著高于 simple 和 train,chunk 边界的跳变不可避免。
  • simple 和 train 都能将延迟区域误差压到接近零。二者的差异体现在剩余 overlap 区域:simple 的激进融合使误差全程保持在较低水平;train 仅约束前缀,之后误差随步数增长——但这正是它保留模型原始预测精度所付出的代价。
  • 延迟区域内外呈现明显差异:simple 和 train 在延迟区域内具有较强约束;进入剩余 overlap 后,误差随预测步数逐渐累积,反映了相邻 chunk 在长时预测上的分歧。

真机实验

我们选取了三个有代表性的真实场景进行评测,同时选取了三个指标:completion score, completion time 以及 jerk。我们在真实双臂机器人上,每个方法×任务都组合运行 5 次,针对不同的指标取平均值。

三种任务场景介绍
Table 3 三种任务场景介绍

以下视频均为原速(1×)播放,未经加速或慢放。

传送带取物
插块入槽
食物放入微波炉

结果与分析

六种方法在三种任务下的完成得分、完成时间和 jerk
Figure 5 六种方法在三种任务下的完成得分、完成时间和 jerk
动态任务:传送带取物

sync 得分为 20,这很好理解,毕竟推理等待时间内无法追踪移动目标。async 同样为 20 分——虽有响应,但硬切换带来的 jerk 极高,无法完成抓取。async+blend 得分为 40,说明时序对齐加上最简单的融合,已经能提高任务完成度了。train 以 96 分领先,兼顾了响应性与平滑度。

精细操作:插块入槽

simple 在该任务得分仅为 27.5——由于该任务对精度要求极高,说明了激进的动作融合会导致精度的下降。sync(72.5)和 train(70)都保持了高精度;train 耗时更短(12.1s vs 19.4s)且 jerk 更低。

长时序:食物放入微波炉

train 和 sync 均达到 96 分,区别在于耗时:sync 因每个边界的停顿累计耗时 85.2s;train 仅需 68.9s,异步方法普遍在 60–66s 内完成。

结论

  1. 做好时间戳对齐后,简单的 async+blend 即可作为一个值得参考的基线。
    通过时间戳建立观测与模型输出 action chunk 的准确对应,并进一步对齐不同 action chunk,只需在动作输出端进行加权融合,无需修改模型或训练流程,即可显著降低 jerk。准确的异步对齐也是跨 chunk 融合方法正常工作的前提。
  2. velocity-level guidance(infer)在 WAM 上无法保证动作连续性。
    我们将 RTC 的速度场引导迁移至世界模型部署,但实验发现,这类软约束只影响去噪方向,并不能很好地约束最终输出的动作,因此 chunk 边界处仍可能出现位置跳变。离线分析与真机实验均验证了这一结论。
  3. 直接修改动作的方式存在精度—平滑 tradeoff。
    simple 在动态任务上表现优异,但在精细操作任务中得分大幅下降,说明直接平滑动作会降低最终的精度。
  4. 训练时注入前缀的方式在三类任务上全面领先,是 WAM 上效果最好的异步融合策略。
    train 通过在训练阶段注入前缀条件绕开了上述权衡,使模型学会自然延续已有动作,无需在推理阶段折中精度与平滑性,并在三类任务上均取得最佳表现。

局限与展望

突发环境变化下的响应性。当前所有方法都假设旧 chunk 能提供有用的引导。一旦出现突发障碍物,新 chunk 必须大幅偏离旧轨迹,此时前缀约束反而会成为干扰。

突发障碍物场景
Figure 6 突发障碍物场景:新 chunk 必须偏离旧轨迹,前缀约束此时变为干扰

如何在保持平滑的同时,对突发环境变化保持足够的响应性,是我们下一步希望探索的方向。

引用

  • [1] Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, Simon Alibert, Matthieu Cord, Thomas Wolf, and Remi Cadene. SmolVLA: A vision-language-action model for affordable and efficient robotics, 2025
  • [2] Xuewu Lin, Yun Du, Hongyu Xie, et al. HoloBrain-0 technical report. arXiv:2602.12062, 2026.
  • [3] Kevin Black, Manuel Y Galliker, and Sergey Levine. Real-time execution of action chunking flow policies. arXiv:2506.07339, 2025.
  • [4] Kevin Black, Allen Z. Ren, Michael Equi, and Sergey Levine. Training-time action conditioning for efficient real-time chunking, 2025.

引用

@misc{motubrainteam2026worldactionmodelsreal,
  title={World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment},
  author={Motubrain Team},
  year={2026},
  eprint={2608.01880},
  archivePrefix={arXiv},
  primaryClass={cs.RO},
  url={https://arxiv.org/abs/2608.01880},
}