# 世界模型：推理时到底要不要想象

SLIM、JEPA-WAM都说别在推理时干活——这篇消融显示：去掉那一步，精化器反而比不精化还差

完整文章：https://haiguangboy.com/posts/omega-eva

## 核心方法

让策略先出一个动作提案，回灌给冻结的世界模型得到想象后果，用当前状态、想象后果、原始提案三者训一个精化器改写动作。只做一次潜空间前向，不解码画面，不做多步rollout。
三阶段：Stage1学动作条件的世界模型，顺带产出一个跟动作解耦的当前表征——专家、零、随机、打乱四种动作喂进去，输出数值完全相同（差值0.000，余弦相似度1.000）。Stage2在这个表征上出初始提案。Stage3冻结前两阶段，只用策略自己的提案训精化器，训练和推理用同一条数据流。

## 关键结果

0.8B、零机器人预训练，LIBERO 97.9%，加精化到98.6%，超过多个更大且有预训练的模型。
拆解消融最说明问题：去掉想象未来分支，掉到97.2%——比不精化基线97.9%还低。去掉提案分支（能看到未来但不知道是哪个动作导致的），掉到96.0%。两个分支都不是装饰。
1步去噪和5步相当（98.8对98.4），耗时从45ms砍到25ms。

## 边界

增益真实但温和不均匀：LIBERO-Plus零样本下Language、Light两项反而略降。精化后潜变量保真度只涨了SSIM 0.0042、降FID 0.01，作者自己说不足以证明因果，具体机制留给后续研究。当前只在动作块边界精化一次，块内没有闭环，作者列为未来方向。
