# 预测误差更低，表征却已经塌了

世界模型会预测未来，不等于会控制——给动作能预测后果，给后果能反推动作，只用 0.47B

完整文章：https://haiguangboy.com/posts/slim-05b

## 核心方法

↳ ① 换掉建模单位。过去世界模型建的是"当前状态怎么变成未来状态"，SLIM 改成"状态—动作—状态"三元组：动作不再是预测未来时顺带的条件，而是判断表征够不够格用于控制的核心变量。它不是第一个把动作喂进世界模型的，但把"动作可识别性"写成了表征的显式判据。
↳ ② 目标因此必须双向。掩掉动作，就得从前后观测反推出它；掩掉未来潜变量，就得从当前观测加动作预测出它。前向和逆向不是两个拼起来的 loss，是同一个控制关系的两个方向。
↳ ③ 未来预测只当训练信号，不当输出。Stage 2 把未来潜变量从输入和监督里整个撤掉，只留被塑形过的预测 slot 供动作流读，推理时不生成未来。

## 关键结果

· 0.47B：LIBERO 97.5%，零样本 LIBERO-Plus 77.45%，CALVIN ABC→D 4.556。
· 单次推理 60.6ms / 每动作块 490 GFLOPs，π0.5 是 193.1ms / 4715。注意两者用各自原生配置（SLIM 8 步块 4 次采样，π0.5 是 10 和 10），不是严格同配置对比。
· 真机五任务，标称、干扰物、光照三档平均 progress 均最高。

## 边界

Stage 1 混入了 LIBERO-90，Stage 2 才只用四个目标套件——所以 Stage 1 的收益不能全记在双向掩码头上，论文没做数据量匹配消融。另外背景变化那档它是输的：49 对 π0.5 的 54，而它恰恰批评过像素预测浪费容量在背景纹理上。真机每格只跑 10 次，报的是部分分不是成功率。
