# 未来预测越准，机器人反而越迟滞

未来预测越准，机器人反而越迟滞

完整文章：https://haiguangboy.com/posts/omega-0

## 核心方法

未来预测不当视频生成目标，而是重建无关的紧凑预测信号：给当前观测和语言指令，预测紧凑的未来观测嵌入，不需要大型视频生成器也不需要测试时把视频逆推回动作。关键是让代表未来的query反过来去attend代表动作的query，把预测的未来视觉动态注入动作表征——促使动作分支去考虑自己动作引发的未来观测。

三阶段训练：先微调VLM学会用离散动作token表达全身动作语义；再冻结骨干联合训练视频-动作预测器，人类演示数据通过仿真回放转成机器人可执行的动作标签解决表示空间不兼容问题；最后真机微调加训练时的滚动窗口一致性约束。

## 关键结果

单一多任务策略（不是逐任务专用）在11个真机家庭任务上全面超过ACT、DP、GR00T-N1.7等基线，尤其在铰接物体交互、双手协调、长距离移动的任务上差距更明显。多视角版本比纯第一人称版本更好，第三人称观测只在训练时用，不影响部署。

## 边界

每任务只有10次试验，单次成败就是10个百分点。推理刚过7Hz，明显低于同类做过延迟优化的世界模型。跨物体、跨场景、人类数据迁移三项泛化测试都只有定性描述，没给量化成功率。
