# 英伟达的动作流：机器人动作新标准

英伟达把机器人动作定义成"动作流"——机械臂、人手、夹爪全部通用，误差直接降了90.40%

完整文章：https://haiguangboy.com/posts/hydra-0-action-flow

## 核心方法

Hydra-0不喂原生指令，把动作定义成"动作流"（action flow）——机器人表面可见点在画面里怎么移动的稀疏轨迹。机械臂、人手、夹爪用同一格式，不暴露各自的原生动作空间。
部署时：候选指令先过一遍控制器和物理仿真（英伟达自家的Isaac Lab），把结果的可见表面轨迹投影进相机画面——这就是SLAM、视觉里程计里那套经典的针孔投影公式，只是投影的是机器人自己的连杆，不是相机的运动。
训练时更省事：数据集没有机器人几何和相机标定时，直接用光流追踪器把轨迹从视频里抠出来。每步训练在四种策略里选一种：本体轨迹当动作条件、物体轨迹当任务意图、混合兜底、或不给轨迹只留文本图像。

## 关键结果

同一套接口装进英伟达自家的Cosmos 2.5和两个Wan2.2骨干都能用，不是哪个模型专属的改法。最佳配置比原生6D动作基线，机器人运动误差低90.40%，物体运动误差低60.16%。当仿真评估器也测过：五个预训练策略跑三百回合，生成成功率和真实成功率相关系数0.96，复现了五个策略排名。推理端加自回归转换和少步蒸馏，仅生成阶段62帧每秒，比双向采样快16倍。

## 边界

厘米级抓取还是不准，作者怀疑是深度感知不够，但没验证。这不是这一篇独有的毛病——只靠视觉预测、没有触觉或力反馈的世界模型，几乎全在接触精度上撞墙。评测目前也只做开环，策略不会被生成画面反过来喂，闭环留给了以后。
