# RL 不该从零学，该做后训练

RL 不该从零学，该做后训练

完整文章：https://haiguangboy.com/posts/rl-100

## 核心方法

模仿学习打底，给一个物理可行的行为先验；迭代式离线 RL 在保守更新下配合数据渐进扩充，榨取大部分性能；简短在线微调只负责清理稀有的残余失败。三阶段共用同一个裁剪 PPO 目标，离线到在线不用换学习原语。

关键设计：把扩散去噪建成两级 MDP，同一个环境级 advantage 在全部去噪步骤间共享，解决只对最终动作打分导致的弱信用分配。离线阶段还有个门控——候选策略只有被保守预测为确有改进才推进，否则拒绝，防止性能突然崩溃。

## 关键结果

八个真机任务、1000 次试验，100% 成功。离线 RL 阶段贡献了从模仿基线到 91.8% 均值的大部分提升，在线阶段只清残余。数据预算上，人类演示平均每任务只要 1.8 小时，占总采集预算不到 13%，其余全是策略自主 rollout。部署时蒸馏成一步一致性策略，378Hz 推理，仅 3.9M 参数。

Push-T 上单位时间完成次数超过专家遥操作员 1.18 倍、新手 1.54 倍。

## 边界

榨汁任务里按压那一步是运觉示教录的固定轨迹、部署时直接重放，不是学出来的——严格说"八任务"里有一小段是脚本。作者自己承认自主复位仍是未解决的瓶颈，列进了未来工作。摘要也写明在线探索阶段有"温和的人类引导"，不是完全自主。
