# 预测式特征不能直接喂扩散模型

预测式特征不能直接喂扩散模型

完整文章：https://haiguangboy.com/posts/leapbot-wa

## 核心方法

↳ ① 中间加一层各向同性语义自编码器，把 JEPA 特征压到 96 维。除重建和 KL 外，关键是切片各向同性正则——作者明说高度结构化的语义空间里单靠 KL 防不住维度坍缩。
↳ ② 世界模型分支只看意图不看动作：条件化在语言指令和本体感受上，不给它逐步的低层电机指令，防止语义表征塌成控制捷径。
↳ ③ 非对称掩码让世界模型分支看不到动作 token，动作分支却能读语义 token。训练时前者当特权专家，部署时整支剪掉，只留一次性算好的语义缓存。

## 关键结果

· 那层正则的消融最说明问题：潜空间秩 38.1→92.3，梯度方差 1.25→0.18；成功率从基础编码器 42.5%、未正则化适配器 58.2%，到 71.3%
· RoboTwin 2.0 均值 91.46%、随机化 92.34%；LIBERO 97.3%；LIBERO-Plus 零样本 73.1%——且没用大规模机器人轨迹预训练

## 边界

"零开销"只说推理。训练要 24 张 H200、两个 30 层 DiT 同时跑，还必须三阶段渐进训练防坍缩。作者在局限里写明性能被底层预测基础模型的表征质量锁死。真机只有单台 UR5 取放果蔬，正文没给成功率也没有基线对比。
