# RL 该在哪一层介入

RL 该在哪一层介入

完整文章：https://haiguangboy.com/posts/zprl

## 核心方法

离线给基座挂一个变分信息瓶颈模块，抽出紧凑的任务相关潜变量；在线冻结基座，RL 只学作用在该潜变量上的残差扰动，经冻结解码器变成新条件，再由冻结策略生成动作。

还有个易忽略的设计：critic 定义在扰动后的潜变量上而非残差本身——同一残差加到不同潜变量会诱导不同动作分布，脱离基底无法定价。

## 关键结果

真机四任务，数小时在线交互后平均成功率提升 33.7%，插纸币从 20% 提到 77.5%。副产物是在线探索期间动作仍平滑，动作残差法则越训越震荡。

## 边界

性能被基座支撑域限制——离线演示从 100 条减到 25 条，在线表现明显退化。鲁棒性只在中等扰动下成立，均值 69%，可变形的纸币任务受扰后更差，每个用例只有 10 次试验。成本也不低：真机在线交互时间是离线采集的三到四倍，扰动尺度还得按任务人工标定（0.1 到 1.5）。
