# 机器人失败，可能不是策略不够大

机器人失败，可能不是策略不够大

完整文章：https://haiguangboy.com/posts/transformer-transformer-codesign

## 核心方法

↳ ① RoboTokens 把连杆、关节、电机、状态、动作和目标末端位姿压成统一连续 token。项目页报告，11 个 Menagerie 机器人覆盖 0.65–67.5 kg、6–35 个主动关节，每个只要 28–101 个 token，比 MJCF 文本少 27–110 倍。

↳ ② 同一个 DiT 通过改变条件掩码切换角色：不固定本体时是机器人生成器；给定本体和目标运动时是跨本体控制器；给定目标运动、扩散本体和动力学 token 时是任务设计器。

↳ ③ Dynamics Self-Guidance 让模型先预测候选本体的整段状态-动作轨迹，再把用户奖励函数的梯度反传到本体 token。它不为新奖励单独训练 critic，也不依赖可微模拟器，而是用模型自己的动力学预测做引导。

## 关键结果

真实 ALOHA2 甩布最有说服力：模型生成方案加长连杆，并把双臂倒置安装到工作区后方，让动作从过顶甩动变成更省力的下手摆动。项目页自报，真机跟踪误差降低 73%，最大关节速度降低 30%，原结构打不开的布料被展开。

速度也激进：CMA-ES 要在 MuJoCo 里逐代 rollout；这个方法在 GPU 上并行采样，一次预测整段 episode。项目页报告，多轨迹双臂优化从 3 小时以上降到 1 分钟内。

## 边界

这不是开放世界 VLA。输入仍是预设末端轨迹和手写奖励，不是从语言、图像、物体状态里自动理解任务。

也不是可靠的最终验收器。设计质量依赖同一个模型做跨本体控制验证，而它和逐设计 RL oracle 的相关系数只有 0.53。证据又来自项目主页自报，真机只展示一种 ALOHA 变体和一个甩布任务。
