# 潜在动作:光流是负资产

潜在动作:光流是负资产

完整文章：https://haiguangboy.com/posts/what_matters_for_latent_actions_in_robot_learning

## 核心方法

↳ 41种设计选择跑了个遍,七种建模范式里最简单的LAPO(不做任何预处理,直接训练在原始数据上)综合得分最高(0.7327);光流方法持续垫底,连像素差分基线都打不过,给LAPO加光流约束效果反而更差
↳ 原因:光流把画面变化转成显式像素位移,这种"以运动为中心"的归纳偏置丢了接触、遮挡、局部形变这些和转移动力学相关的线索,还把估计误差带进表示——更结构化的先验不等于更好的表示
↳ 用预训练DINO特征做语义差分,效果逼近甚至反超LAPO:一个强的语义先验本身就是有效归纳偏置,不需要额外的运动结构

## 关键结果

· 正则化方法类型影响有限,强度才关键:VAE推荐10⁻⁷、Sparsity推荐10⁻⁵、SIGReg推荐10⁻³、VQ-VAE取1
· 潜在动作维度32是单臂/双臂通用最佳点;正则化选对后,不做归一化反而更好(28/33组合更优)
· 真机验证:潜在动作微调过的VLM骨干在Franka Panda上成功率从64.75%到79.25%,收敛快4倍

## 相关路线对比

- 相反路线 · [PointWorld:点流统一状态动作](https://haiguangboy.com/posts/pointworld_scaling_3d_world_models_for_in_the_wild_robotic_manipulation) `pointworld_scaling_3d_world_models_for_in_the_wild_robotic_manipulation_2026_08`：PointWorld:点流统一状态动作
- 同路线 · [LAWM：为什么动作标签会成为负担](https://haiguangboy.com/posts/latent_action_pretraining_through_world_modeling) `latent_action_pretraining_through_world_modeling_2026_07`：LAWM：为什么动作标签会成为负担
- 同路线 · [RL 该在哪一层介入](https://haiguangboy.com/posts/zprl) `beyond_action_residuals_real_world_robot_policy_steering_via_bottleneck_latent_r_2026_08`：用预训练DINO特征算语义差分(DeltaDINO)效果逼近甚至反超LAPO,在LIBERO上是全场最佳 validates 核心主张:介入点的选择本身就是关键设计变量,而非实现细节
- 同路线 · [不是"要不要世界模型"，是"它吐出来的东西有没有结构"](https://haiguangboy.com/posts/robointer15_a_holistic_intermediate_representation_suite_for_embodied_world_mode) `robointer15_a_holistic_intermediate_representation_suite_for_embodied_world_mode_2026_07`：不是"要不要世界模型"，是"它吐出来的东西有没有结构"
- 同路线 · [世界模型不听话，是潜在动作被污染了](https://haiguangboy.com/posts/cd-lam) `causally_debiased_latent_action_model_for_embodied_action_conditioned_world_mode_2026_07`：所有代理指标(包括论文自己认为最可靠的FDM重建指标)都只能做粗筛,不能替代真实下游任务评测——这是对整个LAM研究方法论的一次警示 validates 评测只在 EgoDex/AgiBot 各 300 clip 的离线 rollout 上,没有闭环任务成功率;训练需 96 张 H100
- 同路线 · [世界模型：推理时到底要不要想象](https://haiguangboy.com/posts/omega-eva) `omega_eva_envision_verify_and_act_with_latent_interactive_world_models_2026_08`：核心设计原则:潜在动作不该只当预训练阶段的辅助监督信号,必须在下游策略学习全程都保持参与,才能发挥最大价值 validates 问题拆解:现有世界模型用法分三类,没有一类让候选动作真正被自己的想象结果检验并修正

## 边界

不代表这些排名是实际部署最优——评测只用前视角、不给关节状态和数据增强,是排除混杂因素的洁净室设置;双臂14自由度的发现(如维度32)只在仿真验证过,没有真机数据支撑;潜在动作目前还只是微调阶段的任务特定信号,没被提升成基础级表示

## 作者判断(非论文内容,跨论文综合观点)

这篇最锋利的判断是:所有代理指标都只能做粗筛,排不出精细名次,不能替代真实下游评测。这条判断和之前解读过的两篇论文遥相呼应——Omega-0发现离线重建质量更高的模型,换到真机反而执行更迟滞;CDLAM也得出过同样结论,像素级重建指标排不出潜在动作空间的优劣。但耐人寻味的是,这条判断和刚解读过的PointWorld直接顶牛:PointWorld特意放弃任务成功率、改用逐点L2误差当核心指标,理由正是"成功率会掩盖系统性差异"——一个说再精细的代理指标也靠不住,一个说换个更精细的指标就能看清差距,两边答案正相反,谁更站得住,还得看更多证据。
