# VLA换动作块不再卡顿

VLA换动作块不再卡顿

完整文章：https://haiguangboy.com/posts/learning_native_continuation_for_action_chunking_flow_policies

## 核心方法

衔接不该是补丁，得是策略自己去噪动力学里原生的一部分
↳ 诊断实验先讲清楚这件事：只在去噪起点做一次性前缀引导，重叠区域动作会随多步去噪逐渐漂离参考值——证明引导必须每一步都重新施加，只做一次不够
↳ Legato的做法：定义一个横跨动作块时程的连续性向量（块开头强引导、逐渐坡降到零），据此重塑flow-matching的速度场本身，让"逐步引导"变成去噪动力学内生的一部分，不是套在标准速度场外面的推理时约束
↳ 调度由延迟、执行步幅、坡降长度三个参数刻画，训练时随机化并作为显式条件喂给策略，一个模型就能适应不同延迟波动

## 关键结果

· 真机五项操作任务全面优于RTC：完成时间更短、多项平滑度指标更好、任务完成分数也更高——平滑度提升没有拿成功率去换
· 跟同期的"训练时RTC"（同样在训练阶段引入约束，但只是加一道硬性前缀约束，底层动力学不变）比也全面胜出
· 方法不绑定骨干：π0、π0.5、GR00T N1.6，甚至基于UNet的仿真策略都验证有效

## 相关路线对比

- 相反路线 · [An_Open_Foundation_Model_Towards](https://haiguangboy.com/posts/an_open_foundation_model_towards) `an_open_foundation_model_towards_2026_07`：核心路线判断:块间衔接应该是策略自身学到的去噪动力学里的原生属性,不该是套在标准速度场外面、靠推理时或训练时硬约束打补丁的外部机制——这是Legato区别于RTC和训练时RTC的根本立场 contradicts 训练时RTC：遮掩前d个动作token使模型学会平滑续接
- 同路线 · [PointWorld:点流统一状态动作](https://haiguangboy.com/posts/pointworld_scaling_3d_world_models_for_in_the_wild_robotic_manipulation) `pointworld_scaling_3d_world_models_for_in_the_wild_robotic_manipulation_2026_08`：PointWorld:点流统一状态动作
- 同路线 · [RL 该在哪一层介入](https://haiguangboy.com/posts/zprl) `beyond_action_residuals_real_world_robot_policy_steering_via_bottleneck_latent_r_2026_08`：跟同期出现的'训练时RTC'(也在训练阶段引入衔接约束,但只是给重叠动作段加一个硬性前缀约束、不改变底层flow动力学本身)对比,Legato在任务分数、完成时间、平滑度上全面胜出——说明真正重要的是重塑策略本身的去噪动力学,不是单纯加一个训练时硬约束 validates 问题重述:RL 后训练的关键不只是「改多少」,更是「在哪一层介入」
- 同路线 · [千寻智能韩峰涛：具身智能进入“拼速度”阶段](https://haiguangboy.com/posts/qianxun-general-brain-data-loop) `wx_中国财富_20260719_2026_07`：论文作者在千寻智能(Spirit AI)实习期间完成此工作(团队负责人为高阳),被机器人顶会RSS 2026接收;Legato得名于音乐术语「连音」——音符间平滑过渡、毫无间断 validates ★团队组合：产业老兵+Abbeel门生，高阳师承直连Physical Intelligence/Covariant创始人
- 同路线 · [把RGB、3D几何、物体语义揉进同一个表征——这才是它比π0.5、Fast-WAM更准的根本原因](https://haiguangboy.com/posts/flex_pi_a_multi_stream_world_action_model_with_compute_flexibility) `flex_pi_a_multi_stream_world_action_model_with_compute_flexibility_2026_08`：FLEX-π:更全面的联合表征
- 同路线 · [未来预测越准，机器人反而越迟滞](https://haiguangboy.com/posts/omega-0) `omega_0_a_latent_predictive_world_action_model_for_concurrent_humanoid_loco_mani_2026_08`：动作分块(chunking)是VLA部署的标配,能摊薄推理成本、支持高频控制,但推理延迟加上flow策略内在的多模态性,导致相邻两个动作块衔接处经常不平滑,表现为犹豫和突兀转向,拖长任务完成时间 validates 部署:单次前向约 0.14 秒(超过 7Hz),预测 25 步动作块只执行前 8 步,RTC 式热启动加重叠混合平滑衔接

## 边界

· 衡量全轨迹高阶平滑度的NLDLJ指标没有全部任务都显著提升——改善集中在块边界附近，不代表整条轨迹处处都更平滑
· 对部署延迟的鲁棒性是有前提的：训练时随机化范围没覆盖到的延迟值（尤其缺了"零延迟"这种极端情形），性能可能严重退化甚至接近完全失败
· 验证范围局限在flow-matching这类连续动作分块策略，离散动作表示的VLA架构没有涉及

## 作者判断(非论文内容,跨论文综合观点)

"训练时把部署期会变化的麻烦参数随机化、让策略自己适应"这个手法，和已解读过的PointWorld同源——PointWorld随机化相机数量、这篇随机化推理延迟，结果都是模型对该参数的各种取值反而最鲁棒。调度消融里步幅和坡降长度的权衡，也和PAVE的预测锚点数量非单调发现是同一个模式：给系统更多约束或参数不是无条件的好事，关键在找到那个恰好的权衡点。
