# 异构数据的问题不是量，是监督格式不统一

异构数据的问题不是量，是监督格式不统一

完整文章：https://haiguangboy.com/posts/joyai-ra-dual-alignment

## 核心方法

按数据本身实际拥有的监督类型路由，而不是强行统一格式。无标签视频走隐式对齐：训一个跨人类/仿真/机器人共享的潜在动作模型，用视觉转移自己推出转移级的动力学监督。有可靠标签的轨迹走显式对齐：统一映射进130维跨本体动作空间，末端执行器动作表示成相机坐标系下的分块相对位姿。

架构上VLM管语义、冻结的世界模型管动力学，晚期融合喂给flow-matching动作专家。三阶段训练：先预训练世界模型，冻结后联合训练VLM和动作专家，最后在目标机器人上后训练。部署后还有内外双环强化学习，边缘端快速适配当前任务，中心端持续改进基座再同步回来。

## 关键结果

真机已见任务均分92.0，对照的VLA基线74.0，差距随任务难度增大而扩大。消融很干脆：两种对齐都去掉，未见任务分数崩到29.8；只去隐式对齐，未见分单独掉到46.8，已见分相对保住。人类视频规模化到全量语料，已见未见分数都在涨，且早期阶段未见任务的涨幅明显更大。

## 边界

真机评测每任务只有20次已见、10次未见试验。对比只做了一个VLA基线，没有更广的方法谱系对照。内外环强化学习被称作自我改进系统，但作者自己承认外环同步频率被刻意压低，高频同步会训练不稳定，这个还没解决。
