# T-Rex：触觉为何要单独建模

T-Rex：触觉为何要单独建模

完整文章：https://haiguangboy.com/posts/t_rex_tactile_reactive_dexterous_manipulation

## 核心方法

T-Rex给出的答案是：很可能不行。触觉不是另一张图片。

## 关键结果

视觉主要处理“物体是什么、目标在哪里、下一步大概要做什么”；触觉处理的却是接触瞬间的压力、滑动、形变和受力变化。前者偏低频语义推理，后者要求高频、局部、近乎反射式的闭环修正。一个以视觉数据为主训练出来的模型，即使接口上能输入触觉，也不等于真正学会使用触觉——新信号可能被视觉特征淹没，甚至反过来拖累策略。

T-Rex因此没有把触觉机械塞进视觉主干，而是专门为它建了一套通路：

① 慢速视觉动作专家负责理解场景、语言指令和粗粒度动作；
② 快速触觉专家绕开慢速视觉推理链，依据高频接触反馈修正精细动作；
③ 触觉内部仍继续拆分：动态力用时序编码，表面形变用空间编码，分别回答“力怎样变化”和“接触发生在哪里”。

这不是孤立的架构偏好。知识库中另一项独立研究发现，力/触觉信号直接拼进VLA状态向量会降低性能；另一些工作也转向专用编码器和专用通路。多个团队从不同实验走向同一方向：触觉难的不是有没有数据，而是以视觉为中心的表征和时间尺度很难直接、稳定地吸收它。

T-Rex的数据配方同样体现了分工：先用2.29万小时人类第一视角视频建立视觉与动作先验，再用约100小时机器人触觉数据做grounding，最后针对技能后训练。不是所有数据从第一天就混在一起，而是不同数据分别解决“理解世界”和“对齐触觉控制”。

实测中，T-Rex在12项真实任务上平均成功率达到65%，比最强基线高出30个百分点以上，并通过消融验证了触觉编码方式的独立贡献。

## 边界

它还没有证明跨本体、家庭或产线环境的泛化；实验基于单一平台和受控环境，65%也是作者自评测，尚无第三方复现。
