机器人也要迎来“提示词时刻”?S1看一遍视频就能干活,但别急着下结论,美国机器人初创公司Skild AI发布了机器人技术模型S1,宣称通过上下文学习,仅需观看一次人类演示,就能执行长达10分钟的复杂任务。
其成功率在部分任务上达到66%,而传统模仿学习要达到类似水平,可能需要采集50至100小时数据并专门微调。
更关键的是,S1被指可组合已学技能完成未见过的任务——例如翻煎饼动作在训练数据集中并不存在,却能从其他技能中组合出来。
如果这些结果能被独立复现,意味着机器人技能获取方式正在从“训练问题”转向“提示问题”。过去教机器人新任务,工程师需要遥控采集、清洗数据、修改模型,任务更换往往重来一遍。S1的思路更接近大语言模型:把视频演示作为“提示词”,模型输出动作序列。
但需要冷静看待。66%成功率的具体任务分布、失败模式、是否依赖结构化环境,都未充分披露。
机器人动作输出与文本生成不同,一旦出错,代价是物理损坏或安全事故。上下文学习能解决“看一遍会做”,却未必能解决“换一个厨房还会做”。煎饼翻面的技能组合是否稳定,也缺乏长期测试数据。
更大的意义在于方向:若预训练规模化后,新任务不再需要大量专用数据,机器人进入家庭和工厂的边际成本会显著下降。
但这仍是厂商单方面宣称,行业需要的是可复现的基准测试,而非一条演示视频。技术拐点可能确实在靠近,但距离“GPT时刻”还差一次独立的、跨场景的验证。
