# LAWM：为什么动作标签会成为负担

LAWM：为什么动作标签会成为负担

完整文章：https://haiguangboy.com/posts/latent_action_pretraining_through_world_modeling

## 核心方法

LAWM测出来的结果是反的。

## 关键结果

同样一批数据，一组用BridgeData的真实动作标签做监督预训练，另一组完全不给标签、只让模型预测视频的下一帧。后者赢了。而且赢它的那一组里，还有一个更极端的变体：只用人类视频——没有一条机器人能直接执行的动作——真实任务成功率从84%涨到94%。

问题出在哪？

作者的解释是：拿动作标签做预训练，等于强迫模型学一件很具体的事——**这个机器人、这段轨迹、这个任务设置下，看到这幅画面该输出什么数值**。模型会把大量容量花在拟合这套特定映射上。而预测下一帧逼模型学的是另一件事：**推一下会倒、松手会掉、这个角度够不着**。前者绑死在特定本体上，后者是物理世界本身的规律，换个机器人依然成立。

标签越准，绑得越死。

这解释了另外两个数字为什么会出现。第一个：7M参数的小模型配上这套预训练，打平了7B参数的同类方法——如果学到的是通用动力学而非特定映射，确实不需要那么大容量去死记。第二个：20个演示配预训练(77%)，超过50个演示从零训练(70.5%)——专家数据的作用被重新定位了，它不再负责"教会模型动作是什么"，只负责把已经理解物理的模型对齐到具体动作空间，这件事不需要那么多样本。

## 边界

作者自己列了三条没解决的：像素重建这个训练目标会奖励"画面像"而不是"任务相关动态"，模型可能学到背景捷径；只用了单视角，没有本体感知和夹爪状态；最关键的是，当前只用了数据集的10%，成功率已经出现平台期——继续加数据能不能突破，论文明说了不知道。真实验证也只有单臂5个任务。
