# 闭的是运动学的环，不是物理的环

一段手机视频合成的数据，真机 62.5%，反超真机采集的 46.7%

完整文章：https://haiguangboy.com/posts/video2robo

## 核心方法

↳ ① 技能被重新定义成物体间的相对运动，绕开人手到夹爪的重定向。倒水、清扫的核心就在物体相对位移里，动作分段靠物体间距离低于 3cm 判定。
↳ ② 6D 追踪全靠现成模型串：CoTracker3 追像素，TRELLIS 从单视图生成物体 3DGS，再吃 3DGS 可微的性质逐帧优化位姿。生成式 3DGS 无绝对尺度，靠 VGGT 的单目深度补。
↳ ③ 四类增广逐帧施加：物体重排、桌面背景纹理、光照、虚拟相机扰动。

## 关键结果

· 单目 6D 定位 BOP AR 均值 78.41，最强基线 MegaPose 68.13。
· 生成单条演示平均 5.23 秒（SkillGen 8.88、MimicGen 17.23），成功率六任务全 100%，基线掉的点是穿模滑脱。
· 真机 Franka 六任务：只变物体位姿 62.50% vs 真机采集 46.67%；再叠纹理背景光照视角，58.33% vs 27.50%，两个仿真增广基线只剩 5.83% 和 2.50%。

## 边界

它避免穿模不是因为算得更准，是因为不做碰撞求解。耦合运动是脚本化的运动学流程，没有接触力、摩擦、质量、惯量。论文自陈只支持刚体，抓取位姿仍靠人工标注；免标定的前提也是先把相机桌面粗摆成合成布局，验证只在单臂桌面六任务上做。
