# JEPA-WAM：世界模型在特征空间预测状态转移

不靠堆数据 世界模型创新方法 竟让π0.5真机成功率最高提升12.8个百分点

完整文章：https://haiguangboy.com/posts/jepa-wam

## 核心方法

不在策略旁边挂预测模块，而是让 Qwen2.5-0.5B 一个预测器同时干两件事：一次前向，视觉 token 位置的输出去预测转移，动作条件从专用 token 读出。两路走同一套权重，转移监督更新的就是生成动作的那套参数

预测的目标则是：冻结的 V-JEPA 2.1 把当前帧和 δ 步后的帧一起编码成一个联合目标，预测器去逼近它，损失是逐 patch 余弦距离，全程不生成画面

四个设计选择，各有消融兜底：
1️⃣ 目标用当前与未来的联合表示，不是孤立的未来——只预测未来低1.9%
2️⃣ 保留密集patch之间的空间对应——混合相邻patch低4.5%
3️⃣ 监督打在共享主干的最终输出——只打中间层低2.7%
4️⃣ 动作只读专用action token，隔离世界预测对控制的干扰——读全部预测隐状态低6.1%
部署时直接删掉预测头，不增加推理负担

## 关键结果

📚 仅换用V-JEPA 2.1，LIBERO-Plus便从73.2%升至77.0%；加入完整转移学习机制后达到79.2%

🧲 与LeapBot-WA的对比更说明问题：两者都用V-JEPA 2.1，但后者靠独立Anchor DiT学动态知识再蒸馏给Action DiT，JEPA-WAM让转移预测直接监督共享动作主干。同一零样本榜单79.2%对73.1%，高出6.1个百分点——收益不能只归因于视觉编码器，世界知识进入策略的方式同样关键！

接入π0.5后LIBERO-Plus从84.5%升至86.3%，证明能迁移到成熟VLA。五项真机双臂任务：ID从77.5%升至90.3%（+12.8个百分点），OOD从72.5%升至84.7%（+12.2个百分点）——转移知识最终兑现成了真实成功率

## 边界


