# SmoothRL:只对真正执行的动作算账

SmoothRL:只对真正执行的动作算账

完整文章：https://haiguangboy.com/posts/smoothrl_online_reinforcement_learning_during_asynchronous_execution

## 核心方法

策略生成的动作和机器人真正执行的动作，在异步执行下是两回事——只对真正执行的那段算梯度
↳ 每个动作块按执行状态分三段：已提交段（早被上一个块覆盖，永远不会触达环境）、执行段（唯一真正发给机器人、直接决定轨迹结果的部分）、丢弃段（还没执行就被下一个块取代）。用固定延迟预算把这三段边界变成由帧序号唯一确定的常量
↳ 价值梯度只对执行段计算——因为这段动作同时是当前策略的真实输出、也是机器人实际执行的动作，这个恒等关系让梯度对策略参数良定义。但critic的输入仍是完整动作块，用来保证无偏的跨块自举、并建模"上一个块还在飞行中"这个并发决策过程
↳ 异步循环在训练rollout时就照常运行，不是只在部署时才用——回放数据因此记录的是和目标函数完全一致的时序下真正执行过的动作，策略永远不会在部署时不会遇到的条件下被优化

## 关键结果

· 真机三项任务，250轮在线RL后大幅提升：动态投掷39%→94%，套笔帽8%→83%，开箱30%→90%——修正的都是系统性固定偏差（刀片持续左偏、释放速度没跟距离联动），不是随机噪声
· 原始动作空间让人类干预不用转换就能直接当训练数据：残差式干预（保留基座速度轮廓、只纠偏）在最难配置上成功率约80%，远超直接接管式的约30%
· 平滑性不是自动保证的——一旦价值目标开始推高Q值，必须把速度/加速度/加加速度约束重新显式加回优化目标

## 相关路线对比

- 相反路线 · [RL 不该从零学，该做后训练](https://haiguangboy.com/posts/rl-100) `rl_100_performant_robotic_manipulation_with_real_world_reinforcement_learning_2026_08`：真机三项任务,250轮rollout在线强化学习后相对冻结基座策略均大幅提升:动态投掷39%到94%,套笔帽8%到83%,开箱30%到90%;基座策略的失败是系统性的固定偏差(不是随机误差),在线RL主要在修正这些系统性偏差 contradicts 真机八任务 1000/1000 次试验 100% 成功;离线 RL 阶段贡献了大部分提升,在线阶段只清理残余…
- 相反路线 · [RL 该在哪一层介入](https://haiguangboy.com/posts/zprl) `beyond_action_residuals_real_world_robot_policy_steering_via_bottleneck_latent_r_2026_08`：预训练策略的平滑性来自示范数据,一旦价值目标开始在执行段上推高Q值,这个平滑性保证就不再自动成立——必须把平滑性重新作为显式约束(逐帧速度/加速度/加加速度的边界惩罚项)加回优化目标 contradicts 机制解释:引导是在重映射状态-动作关联,而不是发明新动作
- 相反路线 · [触觉当预测目标而非观测输入](https://haiguangboy.com/posts/n_0_vtla_scaling_vision_tactile_language_action_model_with_latent_tactile_tokens) `n_0_vtla_scaling_vision_tactile_language_action_model_with_latent_tactile_tokens_2026_07`：触觉当预测目标而非观测输入
- 同路线 · [An_Open_Foundation_Model_Towards](https://haiguangboy.com/posts/an_open_foundation_model_towards) `an_open_foundation_model_towards_2026_07`：异步推理循环在训练时的rollout过程里就实际运行,不是只在部署阶段才用——这样回放数据里记录的是机器人在和目标函数完全一致的时序和执行调度下真正执行过的动作,确保策略永远不会在部署时不会遇到的动力学条件下被优化 validates 训练时RTC：遮掩前d个动作token使模型学会平滑续接
- 同路线 · [N0-Foundation:开启触觉新时代](https://haiguangboy.com/posts/mathcaln_0_foundation_towards_the_age_of_tactile_intelligence) `mathcaln_0_foundation_towards_the_age_of_tactile_intelligence_2026_09`：N0-Foundation:开启触觉新时代
- 同路线 · [VLA换动作块不再卡顿](https://haiguangboy.com/posts/learning_native_continuation_for_action_chunking_flow_policies) `learning_native_continuation_for_action_chunking_flow_policies_2026_09`：VLA换动作块不再卡顿

## 边界

· 依赖固定的推理延迟预算，实际波动一旦超出预算，整条异步循环的时序会被打乱
· RL模块的表达能力被冻结基座双重锁死：感知上限受VLA内部表征信息量约束，修正幅度又被限定在参考动作附近的局部邻域内
· 真机评测规模较小（10-18个配置各跑一次，人工判定成功率），刻画的是这套具体设置下的结果，不是大规模统计结论

## 作者判断(非论文内容,跨论文综合观点)

这篇和已经解读过的RL-100形成一个值得记的分歧：RL-100自己的发现是离线RL阶段贡献了大部分提升，在线阶段只是清理残余失败；这篇却把在线RL当成修正系统性偏差（不是残余噪声）的核心手段。两边对"在线RL到底该扛多重的活"给出不同答案，可能取决于预训练阶段本身把策略带到了多接近成功。另外，这篇"训练时把异步循环也跑起来，让优化目标和部署时的真实时序对齐"这个原则，和刚解读过的Legato是同一个方向——两篇论文都在强调，训练阶段绝不能对部署时会遇到的时序结构视而不见。
