# S1:机器人的GPT-3涌现时刻

S1:机器人的GPT-3涌现时刻

完整文章：https://haiguangboy.com/posts/skild_blog_introducing_s1_in_context_learning_20260817

## 核心方法

↳ 公司自报的关键对比:预训练规模只有1000小时时,上下文学习(ICL)反而输给传统语言指令+微调(43% vs 53%);堆到10万小时,ICL反超到66% vs 9%,相差7倍。这不是随数据量线性变好,是一条到了某个规模才突然翻盘的曲线——和语言模型里"小模型怎么调也学不会强上下文学习,大模型突然就会了"的GPT-3现象是同一类
↳ 驱动这个涌现的具体是数据小时数,不是架构创新——博客里没有提任何针对ICL设计的新模块,模型结构和此前一样。公司自己的解释是:预训练真正学的不是任务本身,是"如何从少量样例里学习"这项元能力,量变到了某个点才转化成质变

## 关键结果

· 一条上下文演示的价值,官方估算约等于380条传统后训练演示
· 真机演示种花、煎饼、手冲咖啡等长时程未见任务,最长10分钟、几十步操作
· 扰动测试里,一旦任务需要根本改变执行方案(比如强制换手),传统语言提示VLA的性能下降幅度最多是ICL的3倍

## 边界

不代表这些数字已被独立验证——7倍差距、380条演示当量,全部来自公司自建基准,标记为"需独立核实";也不代表规模是唯一变量,小数据量区间传统微调反而更好,涌现本身有个门槛,不是越早越好;评测里策略失败会有人工干预帮助恢复,报告的是逐步成功率,不等于整条长任务端到端一次成功的概率
