# VGEBench:可泛化视觉探索

VGEBench:可泛化视觉探索

完整文章：https://haiguangboy.com/posts/towards_generalizable_visually_grounded_exploration_of_household_devices

## 核心方法

968个跨26类设备的3D模型，不给手册，纯靠视觉感知+交互反馈摸索操作逻辑
↳ 每个设备实例化成一个具体状态机，精确定义哪个组件对应哪个动作、触发什么状态转移；智能体每步只能看图、选动作、看反馈，系统按坐标是否落在正确组件框内、动作类型和参数是否匹配转移条件做分层校验，判定成功看有没有按顺序达成目标状态，不限定必须走哪条路径
↳ 14953个任务episode，其中10005个是多轮交互，专门考验长时程探索推理

## 关键结果

· 最强模型Gemini-3-Flash成功率54.27%，第二名骤降到16.68%，其余全部模型不到15%
· 反例：MiMo-Embodied-7B导航效率全场最高（0.88，超过Gemini-3-Flash），任务成功率却只有1.48%——真正的瓶颈是精确定位交互组件，不是找对视角（定位误差差距63.9%，导航差距只有12.5%）
· 即便是最强模型，"一次做对"的比例只有12.94%，允许试错的成功率却高达62.86%——靠的是反复摸索，不是看一眼就懂

## 相关路线对比

- 同路线 · [1 天 1000 任务，靠的是归纳偏置](https://haiguangboy.com/posts/mt3-thousand-tasks) `learning_a_thousand_tasks_in_a_day_2026_08`：作者判断:导航探索能力和精细视觉定位能力是两种可分离的能力,前者强不代表后者也强,而这类任务的成败由后者决定 validates 感知依赖:仅视觉、单相机,无触觉,依赖准确分割
- 同路线 · [N0-Foundation:开启触觉新时代](https://haiguangboy.com/posts/mathcaln_0_foundation_towards_the_age_of_tactile_intelligence) `mathcaln_0_foundation_towards_the_age_of_tactile_intelligence_2026_09`：N0-Foundation:开启触觉新时代
- 同路线 · [Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design](https://haiguangboy.com/posts/transformer-transformer-codesign) `transformer-transformer_blog_transformer_transformer_a_unified_20260807_2026_08`：核心定位判断:无说明书的可泛化视觉引导式探索是VLM智能体现存的一个关键能力缺口,既不是传统模仿/强化学习机器人基准能覆盖的,也不是依赖显式API/说明文档的LLM工具调用范式能覆盖的 validates 输入仍是目标末端轨迹和手写奖励，不是从语言与场景直接理解任务
- 同路线 · [梁文锋四小时投资人会议实录](https://haiguangboy.com/posts/liangwenfeng-world-model) `wx_elsewhere别处发生_20260722_2026_07`：核心定位判断:无说明书的可泛化视觉引导式探索是VLM智能体现存的一个关键能力缺口,既不是传统模仿/强化学习机器人基准能覆盖的,也不是依赖显式API/说明文档的LLM工具调用范式能覆盖的 validates ★★核心判断：「世界模型跟智能上限无关」的隐含前提是「数据管道已通」——LLM通了所以是绕路，机器人没通所以是桥
- 同路线 · [潜在动作:光流是负资产](https://haiguangboy.com/posts/what_matters_for_latent_actions_in_robot_learning) `what_matters_for_latent_actions_in_robot_learning_2026_08`：潜在动作:光流是负资产
- 同路线 · [神经信号：它的价值和它的脆弱，来自同一处](https://haiguangboy.com/posts/real_time_semg_based_telecontrol_of_an_assistive_robotic_arm_using_a_1d_convolut) `real_time_semg_based_telecontrol_of_an_assistive_robotic_arm_using_a_1d_convolut_2026_07`：神经信号：它的价值和它的脆弱，来自同一处

## 边界

· 这是渲染视图+离散动作+固定视角的抽象仿真，不是真实机器人的连续控制，不完全覆盖物理部署的sim-to-real挑战
· 观测是干净的设备居中渲染图，不含真实背景/光照/遮挡，扰动测试不能完全替代真实场景
· 3D素材来自公开网站，作者自己承认无法排除闭源模型预训练时见过相关素材的可能

## 作者判断(非论文内容,跨论文综合观点)

最有意思的一条线："给系统更多信息/更长上下文不是无条件的好事"这个判断，在完全不同的领域反复被独立证实。这篇发现更长的交互历史只对强模型有用，弱模型反而在短历史下表现更好——因为弱模型分不清有用反馈和历史噪声。这和之前解读过的几篇工作是同一个方向：What Matters for Latent Actions里，更懂运动的光流表示反而拖累效果；TacWAM发现让辅助模态"可见"比缺少信息损失更大；FLEX-π强调关键机制是强制重建缺失流本身，不只是"看过更多模态"。跨语言模型、触觉表示、潜在动作、VLM智能体四个不同领域，同一个判断反复出现：接收方有没有能力筛选和整合信息，比给多少信息更重要。另外，这篇对"没手册的探索能力"的定位判断，也呼应了另一条更大的判断——世界模型在机器人领域比在语言模型领域更被需要，隐含的前提正是机器人的"数据管道"还没打通，需要额外的桥，而不是像LLM那样可以绕过去。
