硅谷今日最热具身模型!不用后训练,看一遍就学会
具身智能的大结果,要来了!!! 自上周Generalist发布能够学习3到12秒动作的具身大脑Gen 1.5 以来~ 刚刚,北美具身初创 Skild AI 又发布了全新机器人基础模型 S1 ,直接把机器人上下文学习的任务长度拉到了 10分钟往上 。 这次的S1主打上下文学习(in-context learning,ICL): 无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频,就能“照猫画虎”,直接完成一整套从未见过的复杂操作流程。 在官方演示里,机器人完成了煎饼、冲泡咖啡、给植物换盆,以及设备组装等长程任务。并且在未见过的任务上,把成功率干到了66%,远超基于语言提示的VLA(只有 9%)。 另外,哪怕是走传统后训练微调的路线,想追平S1只看一次演示的效果,大概也要喂进去380次左右的任务演示。 非常amazing! 可以说,最近这一波集中在 上下文学习 的工作,又给不少人重新燃起了对具身的希望。 有推特网友表示,通用机器人可能两年后就会出现,而不是七年。 还有网友表示,从Rhoda,到上周Generalist,再到现在Skild S1的10分钟任务,机器人真正的GPT时刻似乎正在出现。 因为一旦这种能力真的泛化,以后开发机器人技能,可能真的会变得像给ChatGPT 写 Prompt一样。 真有这么神吗?我们一起来看。 想要理解S1这次到底怎么个上下文学习,咱们得先看看,传统机器人是怎么学习一个新技能的。 在传统的pipeline里,机器人学习其实和大模型差不多: 先在海量数据上进行预训练,学会一些基础能力;然后到了具体场景,再针对某个任务收集数据,通过后训练,让机器人学会专有技能。 只不过问题在于, 机器人和大模型虽然流程差不多,但数据成本却完全不是一回事。 大模型的预训练数据,大量来自互联网;哪怕到了编程、Agent这些专门场景,很多后训练数据也可以在线上快速获得,甚至自动生成。 但机器人就比较惨了。预训练数据得在现实世界里采,后训练数据还是得在现实世界里采。 所以,在技术博客中,Skild AI就直接开麦了: 如果一个机器人基础模型,每学一个新任务仍然需要几十、几百小时真机数据,再重新后训练,那我请问,这个“基础模型”,基础在哪儿? 他们甚至引用已有研究指出,如果针对一个新任务的数据已经足够多,那么从零训练的模型甚至都可能追平经过预训练再微调的基础模型。 所以,具身预训练的意义到底是啥? 对此,Skild给出的答案是: 上下文学习 。 为了有一个参考坐标,Skild拉来了大模型的发展路线作为对照。 早期的BERT已经很强了,但每碰到一个新任务,往往还是得重新准备数据,再微调一遍。 真正改变游戏规则的,是后来GPT-3之后逐渐显现出来的上下文学习能力: 不用改模型权重,只要在Prompt里给几个例子,模型就能临时“学会”一个新任务。 基于此,Skild认为,机器人现在其实还困在类似的 BERT时代 ,他们真正想要的是,是让机器人也完成同样一次范式转换。 也就是说, 预训练真正的价值,不应该只是让后训练少采一点数据,而是让机器人最终获得“从上下文里直接学习”的能力。 那么,S1这次到底从上下文里学到了什么? Skild认为,真正能检验机器人上下文学习能力的,其实就两个维度: 一个是,能不能学会训练时根本没见过的新技能;另一个是,能不能把已有技能重新组合起来,完成一个很长、很复杂的新任务。 比如,机器人只需观看一段翻煎饼的视频,就能学会如何制作煎饼—— 即便这项技能此前从未出现在它的训练数据中。 与此同时,相较于上周Gen-1.5展示的秒级视频,S1这次直接把上下文学习拉到了 最长10分钟 。 在植物换盆等任务中,每个任务都需要连续完成几十个操作步骤。在这些长程任务的演示中,机器人不仅需要做到照猫画虎,还需要知道: 我现在做到哪一步了,下一步该干嘛,技能之间怎么组合,中间搞砸了又该怎么继续。 也就是说,机器人需要真正理解视频演示里任务-动作的意图,见招拆招、随机应变,而不仅仅是行为克隆那么简单。 此外,在植物换盆任务中,从开始录演示,到机器人自己上手,只花了11分钟,直接在效率这一块,给传统后训练秒了。 最后,在整个过程中,S1没有用fine-tuning,也没上post-training,模型权重完全不变,用同一套权重,就完成了博客里展示的所有任务。 基本对齐了大模型从Bert需要特定场景微调,到GPT-3只看演示就能完成OOD任务的跨越。 唯一的不同就是,用的prompt不再是语言,而是用了能够更好对齐下游任务的动作视频。 在实验部分,Skild先在(训练数据)见过的任务和未见过的任务上,对比了ICL视频Prompt和传统的语言Prompt VLA。 测试结果表明,当训练数据只有1000小时时,语言Prompt效果更好,而随着数据规模增加,ICL开始反超。 到了10万小时,训练时见过的任务上:ICL 96%,语言Prompt 89%。 而在真正关键的OOD任务上:ICL 66%,语言Prompt只有9%,直接拉开了7倍以上的差距。 为了验证S1的泛化性,Skild又在不同的实验条件下进行测试。 结果表明,语言Prompt VLA的性能下降幅度,最高达到ICL的3倍。 也就是说,ICL学到的不是固定场景里的动作复读,而是更能跟着当前环境重新规划怎么做。 最后,在One shot learning方面。 S1在新任务上完全不做post-training,只看一条视频演示,成功率就达到66%。 相较之下,传统VLA则大概要经过 约380次演示 的后训练,才能追到同样水平。 当然,继续堆到2000次演示后,传统post-training最终能做到86%。 所以结论可能不是“以后机器人不用训练了”,而是: 以前一个新技能可能得教几百遍,现在先看一遍,就能直接做到六七十分。 这也是Skild所谓的ICL scaling law: 数据越多,模型不只是会更多技能,而是越来越会“从演示里学技能”。 Skild成立于2023年,背后站着两个CMU机器人圈的老熟人:Deepak Pathak和Abhinav Gupta。 两人都是卡内基梅隆大学机器人研究所的教授,Deepak主要研究机器人学习、强化学习和计算机视觉,Abhinav则是计算机视觉、自监督学习领域的大神。 早在2022年,两人就合作过WHIRL,让机器人通过观看人类视频进行one-shot imitation,可以说S1这条路线,也不是突然从石头缝里蹦出来的。 作为北美具身圈的明星企业,2024年Skild刚走出隐身模式,就拿下3亿美元A轮、估值15亿美元; 到了今年1月,又完成14亿美元C轮融资,估值直接干到了140亿美元以上,SoftBank领投,英伟达、贝索斯等继续上桌。两年多时间,估值接近翻了10倍。 横向对比来看,Skild在北美具身圈的定位也相当特殊。 相比于PI更像是在搞“机器人GPT”,Generalist最近强调的是one-shot learner,以及Genesis AI、Sunday最近的全栈势头,Skild一直强调的是一句话: Any robot,any task, one brain 。 它更强调跨embodiment,希望同一个Skild Brain能够跑在机械臂、四足、人形等不同身体上。 说的通俗一点,就是想成为机器人时代的安卓:一个智能层,塞进各种不同的身体里。 这也由此决定了Skild的数据策略: 全都要 。 Skild把机器人数据看成hardware proximity、diversity和scalability三个维度: 真机遥操最接近硬件,但贵;第一视角人类视频最容易规模化,但和机器人身体差得远;仿真便宜能猛造,却又有sim-to-real gap。 所以他们对于Robot Teleop、UMI、Egocentric Video、Simulation,基本上采取的就是都用的策略。 而S1的ICL,其实也是这条路线自然延伸: 2025年9月LocoFormer → 2026年2月首次In-Domain ICL → 5月第一次翻煎饼 → 8月S1发布,直接把上下文学习推到最长10分钟的OOD长程任务。 所以现在真正值得关注的问题,可能已经不是机器人还能不能学会更多技能,而是: 机器人学习一个新技能的成本,能不能真的从“教几百遍”,变成“你做一遍,它看一遍”。 如果这个scaling law还能继续成立,那所谓机器人的GPT moment,可能真的不只是又一个营销梗了。 参考链接 [1]https://www.skild.ai/blogs/s1
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
标签
新闻来源
量子位 · 2026年8月26日 18:07