# N0-Foundation:开启触觉新时代

N0-Foundation:开启触觉新时代

完整文章：https://haiguangboy.com/posts/mathcaln_0_foundation_towards_the_age_of_tactile_intelligence

## 核心方法

硬件+数据+表征+评测全套打通,作者称是迈向"触觉智能时代"的第一步
↳ 触觉传感器是视觉式的:弹性感应层受力形变,相机拍下纹理位移图像。多数工作直接拿这张图像当触觉表示,这篇多走一步:学一个逆映射还原成每个空间位置的三轴力场(2剪切力+1压力),用力场本身做统一表示——物理接地、跨传感器统一(校准过的传感器都能映射进同一空间)、空间语义丰富(保留完整分布,不摘要成一个数)
↳ 这套表示在按/拧/抓/提/持五种接触方式差异很大的技能间保持一致,因为表示空间由物理定义,不由设备或行为定义
↳ 配套手持设备N0-TacUMI贡献57%轨迹,加5个机器人平台遥操作,汇总成3万+小时、140万episode的NeoData

## 关键结果

· 真机10项任务,把力场喂给动作专家比不给触觉、比拼接原始图像都好,渐进得分38.1%升到47.5%
· 增益集中在力场幅值精度上,不是接触定位精度——这一环还有提升空间
· 仿真12项任务里,双臂持续接触的任务几乎无解(最好18%-25%);Fast-WAM真机三强,仿真12项全灭

## 相关路线对比

- 相反路线 · [PRISM:规模能否替代显式建模?](https://haiguangboy.com/posts/prism_precision_and_contact_rich_real_world_industrial_skill_dataset_with_multim) `prism_precision_and_contact_rich_real_world_industrial_skill_dataset_with_multim_2026_08`：PRISM:规模能否替代显式建模?
- 相反路线 · [触觉预测只该用来训练，不该给动作看](https://haiguangboy.com/posts/tacwam) `tacwam_anchor_guided_world_action_model_with_mechanics_aware_tactile_prediction_2026_08`：作者判断:现有策略在精细接触密集任务上的瓶颈,根本原因是纯视觉+本体感知既暴露不出接触状态、也提供不了动作执行中途纠错所需的信号——不是策略容量不够,是感知模态本身缺了这一环 contradicts 核心原则:未来触觉只做训练期监督信号,不进入部署期动作输入
- 同路线 · [JEPA-WAM：创新方法让世界模型更懂状态变化](https://haiguangboy.com/posts/jepa-wam) `jepa_wam_learning_vision_language_action_policies_with_joint_embedding_world_modeling_2026_08`：触觉集成方式消融(固定π0.5骨干):不给触觉<原始触觉图像拼接<原始触觉图像喂给动作专家<NeoForce力场喂给动作专家,平均渐进得分从38.1%升到47.5% validates 核心主张:转移监督必须直接塑造生成动作的那个主干,外挂和当上下文都不行
- 同路线 · [S1:机器人的GPT-3涌现时刻](https://haiguangboy.com/posts/skild_blog_introducing_s1_in_context_learning_20260817) `skild_blog_introducing_s1_in_context_learning_20260817_2026_08`：S1:机器人的GPT-3涌现时刻
- 同路线 · [T-Rex：触觉为何要单独建模](https://haiguangboy.com/posts/t_rex_tactile_reactive_dexterous_manipulation) `t_rex_tactile_reactive_dexterous_manipulation_2026_07`：T-Rex：触觉为何要单独建模
- 同路线 · [手套触觉读数里混着手的姿态](https://haiguangboy.com/posts/tactile-glove-pose-artifacts) `pose_aware_modeling_to_mitigate_pose_related_artifacts_in_tactile_gloves_2026_07`：触觉传感器是视觉式(camera-based visuo-tactile):弹性感应层受力形变,内置相机拍下纹理位移,再学一个逆映射把图像还原成力场,而不是直接把原始图像当触觉表示用 validates 又一次'直接拼接会更差':这次的解释是模型学错了映射方向

## 边界

· 双臂协同接触任务依然大幅落后,触觉是必要不是充分条件
· 只验证过平行夹爪视触觉手指,灵巧手和非相机式传感器是未来方向
· 手持设备采到的轨迹要靠逆运动学筛查确认可执行,不是采到就能用

## 作者判断(非论文内容,跨论文综合观点)

跟TacWAM对比最尖锐:TacWAM说未来触觉只能做训练期监督、不能进部署期动作输入,这篇消融却显示把力场喂给部署时的动作专家收益最大——两边给出相反答案;不过TacWAM那条"触觉存在结构性时间歧义、单帧不够"的诊断,这篇的力场表示专门在片段内聚合时序上下文来应对,算是间接认领了同一个问题。跟T-Rex是同一路线:触觉需要专门的异步处理、机械拼接无效,这篇没把原始触觉图像直接拼进策略,是同一判断的又一次独立印证;T-Rex真机12项任务成功率65%、比最强基线高出30个百分点,这篇量级更大,10项任务、3万+小时数据。跟N0-VTLA是同一脉络延续:两篇用同一个NeoReal基准,N0-VTLA当时47.2%对π0.5的29.4%,这篇扩到10任务、把π0.5拉到26.5%——但也继承了N0-VTLA同样的局限:评测主要在自建基准上做,强依赖自研传感器和自建数据管线。
