# 切换逻辑不该让策略去学

切换逻辑不该让策略去学

完整文章：https://haiguangboy.com/posts/dr-lfd

## 核心方法

↳ ① 按接触复杂度分三类：pick/place 用等变网络学开环基元；擦拭、翻转、折叠这类接触密集的用视觉运动策略，两端预测关键位姿；不涉及接触的直接走规划轨迹。
↳ ② VLM 只做语义 grounding，不决定切分点。切在哪由接触距离阈值判定——两个接触变化事件之间就是一段。
↳ ③ 执行不是一次算完就开环走。全局骨架算一次，但每个动作前重新感知、对该子目标解局部规划、执行后用接触检测器验证，没达到预期接触就重解同一步。

## 关键结果

· 仿真 peg-in-hole：50 条演示，分布内 100%，ACT 44%、DP 54%
· 双臂任务用 100 条演示打到 70% 和 90%，而基线用 1000 条只有 45% 和 70%
· 真机分布外测试，扩散策略掉到 30%
· 代价是慢：单次完成 10.21 秒，基线 7.5–8.7 秒

## 边界

继承了 TAMP 的老账：目标仍需人工指定；搜索复杂度随符号数指数增长，阻挡物从 0 加到 3 个，规划时间从 9 秒涨到 145 秒，标准差 190 秒。受约束场景成功率明显低于分布内。物体中心基元需要标定过的深度传感器。VLM 那步输出要人工检查，还依赖无歧义的分步描述——真实任务里通常没有，是作者自己写的。开集分割也有词表限制，某个障碍物约一半试次没被认出来。
