# 机器人 RL 的瓶颈是采样不是算法

机器人 RL 的瓶颈是采样不是算法

完整文章：https://haiguangboy.com/posts/pi-rl-chelsea-finn-talk

## 核心方法

· RL loop 被专门改造过：由人介入提前终止或改向已经走死的 rollout；value function 跨 prompt 和任务摊销，而不是每次尝试重新估计。
· 控制接口仍是结构化的：模型输出目标关节位置加 3D 夹爪位置，交给 PD 控制器，没有端到端到原始力矩。她把这说成刻意的权衡，不是核心限制。

## 关键结果

· RL loop 被专门改造过：由人介入提前终止或改向已经走死的 rollout；value function 跨 prompt 和任务摊销，而不是每次尝试重新估计。
· 控制接口仍是结构化的：模型输出目标关节位置加 3D 夹爪位置，交给 PD 控制器，没有端到端到原始力矩。她把这说成刻意的权衡，不是核心限制。

## 边界

发帖人是现场听众，不是 π 的人，内容为二手转述。700 robot-days、50 万 token、10–15 分钟窗口都只能当作"据称的演讲口径"，不是 π 官方发布的参数。
