首页/新闻/神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光
技术突破

神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光

量子位
2026年9月3日 09:31
2026年9月3日 09:31
访问原文

诺亚 发自 凹非寺 量子位 | 公众号 QbitAI 还记得上周具身圈流传的那个神秘10分钟一镜到底视频吗? 视频一出,网友们表示:不敢相信,仿佛天外来物…… 甚至给出了最高评价:是AI生成的吧?! 同行跑来打听到底是哪家的,听说有头部公司专门开会研究……我们的后台都被各路网友问爆了。 看完这个十分钟的一镜到底视频,大家说具身智能的ChatGPT时刻可能真来了,有人说这是具身智能的重要里程碑,也有人说这是创新的架构。因为它让人看到了: 当然,由于机器人表现得太过“科幻”,也有一些不相信的人质疑:这是不是遥操的?(虽然团队说这么小的空间真的不知道怎么遥操) 而这个神秘团队,回应质疑的方式也很特别:他们又一连甩出了另外几个demo,依旧粗糙,依旧一镜到底,仿佛想说: “智能,不管你信或不信,它真的要来了。” 因为第一篇文章,我们得以联系到神秘的模型团队,也表达了疑问——为什么不直接出来认领?得到的回应是:模型也像人,让它自己说。 我们了解到,这个神秘模型的内部代号为“MVP”,它的意思是:模型能力像真人一样(Make Veritable People),他们说可以直译为:“做个人吧”(doge)。 “做个人吧”大模型。 而这次释出的几个Demo,从表现来看,机器人“真的做了个人”,它像人类一样思考,自我决策、动作丝滑、逻辑自洽。而且听团队说, 他们马上要让机器人自己上街了,开放环境,直接给大家看。 如果你端着一瓶水,有人戳你的胳膊,你能不能瞬时反应、让水不洒? 机器人左手拿一个装着水的杯子,在人类(无礼的)木棍推搡下,它躲向另一侧,又平稳地归位,杯中的水没有洒半滴。 如果你端着一瓶水,有人戳你的胳膊,又同时推倒了你旁边的易拉罐,你能不能瞬时反应、让水不洒且保证易拉罐不倒? 人类又从右侧推了桌上的三个易拉罐,它的右手居然同时扶住了易拉罐。 机器人表现得就像一位太极宗师,既会化劲,将对手的撞击化解于无形,也知道分寸,将力道拿捏得刚刚合适。 而且仔细看,易拉罐被推动的时候,左臂端着水的动作还没有恢复,机器人又用右手扶住了易拉罐。 这一幕,别说机器人,其实已经超越许多人了,大家可以试试看能不能两只手同时完成这两个任务。(doge) 主流的VLA和WAM模型有个毛病:一旦面对遮挡、接触、形变等需要物理推理的任务场景时,就容易失效。因为它们只是在模仿动作的样子,并不理解背后的物理规律。 而“做个人吧”模型看起来给机器人装了一个“物理大脑”。正是动力学预测和长期状态的统一,才能让轨迹天然满足动力学可行性。 从动作反应速度跟丝滑程度来看,机器人的动作不再是靠死记硬背数据“猜”出来的,而是像人一样,靠着对物理规则的理解“学”出来的。 两者是“照葫芦画瓢”和“知其所以然”的区别吧。 第二个视频中,人形机器人正式接管家务。 而且“做个人吧”模型的团队说这是机器人zero-shot完成这个任务时候的视频。(如果是真的,那这泛化性也太无敌了!) 他们说,模型的zero-shot成功率已经达到了80%。 我把这个视频命名为“强迫症机器人之客厅不能乱”(doge) 只见机器人先把手里的小玩偶放回玄关置物台,主打一个“从哪儿来回哪儿去”。接着,它又把装满杂物的收纳篮拖到身边,微微下蹲,从中先后掏出黑色帽子和紫色健身环,将其稳稳挂上衣帽架。 最后,它从篮子里拿出一只硕大的花朵坐垫,显然它是可以弯腰的,但这次,它选择随手一扔,坐垫落到了沙发上。 整个过程下来,机器人的动作虽然不算麻溜,但颇有一种尽在掌控之中的感觉。 机器人对空间和物体属性的理解,已经非常像人:它知道物体在光滑的地板上可以拖拽,环状的帽子和健身环可以挂,平整的坐垫会自己展开。 甚至还会“偷懒”,能直接扔就绝不再费劲弯腰。(真是懒人驱动科学发展,懒机器人驱动智能进化啊。) 主流的模型暂时还达不到像人一样的泛化能力。VLA靠“大力出奇迹”硬算,一碰到陌生场景就容易崩盘;WAM则像拼积木一样拼接动作,学得太死板,稍微变通一下就不灵了。 装配“做个人吧”模型的机器人则看起来很稳定,把对空间和物体属性的理解以及人类的习惯融为了一体,顺利完成了一个长程任务。 小时候,长辈会经常喊我们,把新洗出来的床单抖一抖。 这个视频中,出现了两台不同型号的机器人,听说他们全部的训练都是看的人类视频,所以他们再次上演了“一脑多形”的跨本体协作,并且真的组队干活了。 只见一条似乎刚从烘干机中取出来的床单,一头的两角被一台身高较高的机器人拽着,另外一头的两角被另一台较矮的机器人牵着。 较矮的机器人一跨步,再一弯腰,床单便被扯得平整。紧接着,身高较高的机器人两手轻轻抖动了几下床单。 虽然视频中的机器人姿势仍然有些呆板,但是它们的行为逻辑也太像人了!这跟我们把刚洗好的衣服甩两下、以免出现褶皱有什么区别? 要知道,主流的模型有个致命缺陷:它们不像人类,无法真正实现自进化。VLA只能小修小补,动不了“脑回路”;WAM干活太死板,换个环境就适应不了。 而MVP模型不同,它看起来把对物理世界的理解和对人类逻辑的理解统一了。 当机器人学会思考,懂得一次把所有东西拿走归置,比来回一趟趟归置更省力,它会怎么样? 视频里,这台机器人收纳物品的操作仿佛人一样:东西再多,也尽量不跑第二趟。 它先从篮子里抽出一条黑色围巾,像店小二一样,往脖子上一搭。接着它又拎起紫色圆环,绕在小臂上,还知道抬手让其滑落到肘关节处,成功把自己改造成行走的衣架。 然后是拖鞋、耳机,一番操作下来,机器人身上已经挂满了物品,却淡定地转身离开,留下一个轻飘飘的背影。 1分钟的视频,机器人收纳了4件物品,不仅充分展现了处理长程任务的能力,还展现了对每个物品的深刻理解,并能为每件物品建立与自身能力的对应映射。 要知道,如今的主流模型做同样的任务,大概率会是一件一件单独搬运,因为模型本质上还是基于统计拟合的猜测,缺乏像人类一样对世界的理解,也没有自主意图。 如果视频中的机器人看到这一幕,它心里的OS可能是:不是吧哥们,来都来了,怎么就带这点走啊?多带点更省劲啊! “做个人吧”模型的机器人做决策时,好像不需要刻意去“想”下一步该干嘛,只需要像水往低处流一样,顺着能量下降的方向自然滑动。 在这个“下坡”的过程中,思考、探索和行动是一气呵成的。 可能这才是真正理解世界、并有自主意图的智能吧。 看完这4个demo,我终于理解了模型为什么叫“做个人吧”,机器人的一举一动,确实都太像一个人的决策过程,在长程任务、干扰环境、彼此协作中,表现出对于物理世界、人类行为逻辑、自身能力的不断学习跟进化。 机器人能像人一样理解空间和物体属性,干家务时的思维逻辑和操作习惯和人差不多,还能如同人类一般自我驱动、自主学习、持续自进化。 不仅如此,机器人还体现出这些特质: 其他特点,不一而足,但我现在真的开始相信,具身智能真正能为人所用的时刻已经快到来了。 智能,可能已经真的涌现了,在我们看不到的地方。 你对这几个新Demo怎么看?欢迎来评论区互动留言,咱们一起给点鼓励和压力,逼出技术团队现身说法,是回应也是交流~~

注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。

标签

具身智能
具身模型

新闻来源

量子位 · 2026年9月3日 09:31

查看原文

相关新闻