# 1 天 1000 任务，靠的是归纳偏置

1 天 1000 任务，靠的是归纳偏置

完整文章：https://haiguangboy.com/posts/mt3-thousand-tasks

## 核心方法

↳ ① 把轨迹拆成对齐和交互两段。对齐只关心末端相对目标物的最终位姿，路径怎么走无所谓；交互才需要精确执行。
↳ ② 用检索代替行为克隆，而且是在测试时检索。这和训练前检索数据、以及全程用 RGB 检索图像动作对的做法都不同——这里是执行前用语言加几何检索一整条轨迹。

## 关键结果

受控实验 3450 次真机试验：只用 3 条演示就超过其他方法用 50 条。分解本身也有效，同一套行为克隆实现，分解版优于不分解版。

千任务评测：1000 个日常任务、400 多个物体、每任务一条演示、全部演示 24 小时内采完，2200 次试验下已见任务 78.25%、未见 68%。

## 边界

单臂、单次交互，假设被抓物体在演示和测试时于夹爪中位姿相同，且明确没有评测干扰物挡住演示轨迹的情况——开环重放会忽略障碍物并可能碰撞。只有视觉没有触觉，推断不了可变形物体的刚度弹性。检索也无法在两条已演示轨迹之间插值，只会二选一。附录里作者自曝：让大模型串接技能时，开放式长程指令会幻觉出不连贯序列，比如调鸡尾酒时没放下酒瓶就开始倒酒。
