诺亚 发自 凹非寺
量子位 | 公众号 QbitAI
还记得上周具身圈流传的那个神秘10分钟一镜到底视频吗?
视频一出,网友们表示:这是机器人领域的“吓到瘫坐,宛如看见核爆”……
甚至给出了最高评价:是AI生成的吧?!
同行跑来打听到底是哪家的,听说有头部公司专门开会研究……我们的后台都被各路网友问爆了。
看完这个十分钟的一镜到底视频,大家说具身智能的ChatGPT时刻可能真来了,有人说这是具身智能的重要里程碑,也有人说这是创新的架构。因为它让人看到了:
机器人具有一定认知能力,而不是概率预测;
机器人理解人类行为逻辑,而非过拟合;
机器人拥有持续自进化的能力,有很多令人惊叹的瞬间。
当然,由于机器人表现得太过“科幻”,也有一些不相信的人质疑:这是不是遥操的?(虽然团队说这么小的空间真的不知道怎么遥操)
而这个神秘团队,回应质疑的方式也很特别:他们又一连甩出了另外几个demo,依旧粗糙,依旧一镜到底,仿佛想说:
“智能,不管你信或不信,它真的要来了。”
因为第一篇文章,我们得以联系到神秘的模型团队,也表达了疑问——为什么不直接出来认领?得到的回应是:模型也像人,让它自己说。
我们了解到,这个神秘模型的内部代号为“MVP”,它的意思是:模型能力像真人一样(Make Veritable People),他们说可以直译为:“做个人吧”(doge)。
“做个人吧”大模型。
而这次释出的几个Demo,从表现来看,机器人“真的做了个人”,它像人类一样思考,自我决策、动作丝滑、逻辑自洽。而且听团队说,他们马上要让机器人自己上街了,开放环境,直接给大家看。
视频1:手眼协调不分离,高超的动力学理解
如果你端着一瓶水,有人戳你的胳膊,你能不能瞬时反应、让水不洒?
机器人左手拿一个装着水的杯子,在人类(无礼的)木棍推搡下,它躲向另一侧,又平稳地归位,杯中的水没有洒半滴。
如果你端着一瓶水,有人戳你的胳膊,又同时推倒了你旁边的易拉罐,你能不能瞬时反应、让水不洒且保证易拉罐不倒?
人类又从右侧推了桌上的三个易拉罐,它的右手居然同时扶住了易拉罐。
机器人表现得就像一位太极宗师,既会化劲,将对手的撞击化解于无形,也知道分寸,将力道拿捏得刚刚合适。
而且仔细看,易拉罐被推动的时候,左臂端着水的动作还没有恢复,机器人又用右手扶住了易拉罐。
这一幕,别说机器人,其实已经超越许多人了,大家可以试试看能不能两只手同时完成这两个任务。(doge)
主流的VLA和WAM模型有个毛病:一旦面对遮挡、接触、形变等需要物理推理的任务场景时,就容易失效。因为它们只是在模仿动作的样子,并不理解背后的物理规律。
而“做个人吧”模型看起来给机器人装了一个“物理大脑”。正是动力学预测和长期状态的统一,才能让轨迹天然满足动力学可行性。
从动作反应速度跟丝滑程度来看,机器人的动作不再是靠死记硬背数据“猜”出来的,而是像人一样,靠着对物理规则的理解“学”出来的。
两者是“照葫芦画瓢”和“知其所以然”的区别吧。
视频2:对空间和物体属性的理解,以及对人类习惯的总结
第二个视频中,人形机器人正式接管家务。而且“做个人吧”模型的团队说这是机器人zero-shot完成这个任务时候的视频。(如果是真的,那这泛化性也太无敌了!)
他们说,模型的zero-shot成功率已经达到了80%。
我把这个视频命名为“强迫症机器人之客厅不能乱”(doge)
只见机器人先把手里的小玩偶放回玄关置物台,主打一个“从哪儿来回哪儿去”。接着,它又把装满杂物的收纳篮拖到身边,微微下蹲,从中先后掏出黑色帽子和紫色健身环,将其稳稳挂上衣帽架。
最后,它从篮子里拿出一只硕大的花朵坐垫,显然它是可以弯腰的,但这次,它选择随手一扔,坐垫落到了沙发上。
整个过程下来,机器人的动作虽然不算麻溜,但颇有一种尽在掌控之中的感觉。
机器人对空间和物体属性的理解,已经非常像人:它知道物体在光滑的地板上可以拖拽,环状的帽子和健身环可以挂,平整的坐垫会自己展开。
甚至还会“偷懒”,能直接扔就绝不再费劲弯腰。(真是懒人驱动科学发展,懒机器人驱动智能进化啊。)
主流的模型暂时还达不到像人一样的泛化能力。VLA靠“大力出奇迹”硬算,一碰到陌生场景就容易崩盘;WAM则像拼积木一样拼接动作,学得太死板,稍微变通一下就不灵了。
装配“做个人吧”模型的机器人则看起来很稳定,把对空间和物体属性的理解以及人类的习惯融为了一体,顺利完成了一个长程任务。
视频3:拉平床单、抖床单、放床单,机器人组队干活了
小时候,长辈会经常喊我们,把新洗出来的床单抖一抖。
这个视频中,出现了两台不同型号的机器人,听说他们全部的训练都是看的人类视频,所以他们再次上演了“一脑多形”的跨本体协作,并且真的组队干活了。
只见一条似乎刚从烘干机中取出来的床单,一头的两角被一台身高较高的机器人拽着,另外一头的两角被另一台较矮的机器人牵着。
较矮的机器人一跨步,再一弯腰,床单便被扯得平整。紧接着,身高较高的机器人两手轻轻抖动了几下床单。
虽然视频中的机器人姿势仍然有些呆板,但是它们的行为逻辑也太像人了!这跟我们把刚洗好的衣服甩两下、以免出现褶皱有什么区别?
要知道,主流的模型有个致命缺陷:它们不像人类,无法真正实现自进化。VLA只能小修小补,动不了“脑回路”;WAM干活太死板,换个环境就适应不了。
而MVP模型不同,它看起来把对物理世界的理解和对人类逻辑的理解统一了。
视频4:能量驱动,最优能量的行为解
当机器人学会思考,懂得一次把所有东西拿走归置,比来回一趟趟归置更省力,它会怎么样?
视频里,这台机器人收纳物品的操作仿佛人一样:东西再多,也尽量不跑第二趟。
它先从篮子里抽出一条黑色围巾,像店小二一样,往脖子上一搭。接着它又拎起紫色圆环,绕在小臂上,还知道抬手让其滑落到肘关节处,成功把自己改造成行走的衣架。
然后是拖鞋、耳机,一番操作下来,机器人身上已经挂满了物品,却淡定地转身离开,留下一个轻飘飘的背影。
1分钟的视频,机器人收纳了4件物品,不仅充分展现了处理长程任务的能力,还展现了对每个物品的深刻理解,并能为每件物品建立与自身能力的对应映射。
要知道,如今的主流模型做同样的任务,大概率会是一件一件单独搬运,因为模型本质上还是基于统计拟合的猜测,缺乏像人类一样对世界的理解,也没有自主意图。
如果视频中的机器人看到这一幕,它心里的OS可能是:不是吧哥们,来都来了,怎么就带这点走啊?多带点更省劲啊!
“做个人吧”模型的机器人做决策时,好像不需要刻意去“想”下一步该干嘛,只需要像水往低处流一样,顺着能量下降的方向自然滑动。
在这个“下坡”的过程中,思考、探索和行动是一气呵成的。
可能这才是真正理解世界、并有自主意图的智能吧。
总结
看完这4个demo,我终于理解了模型为什么叫“做个人吧”,机器人的一举一动,确实都太像一个人的决策过程,在长程任务、干扰环境、彼此协作中,表现出对于物理世界、人类行为逻辑、自身能力的不断学习跟进化。
机器人能像人一样理解空间和物体属性,干家务时的思维逻辑和操作习惯和人差不多,还能如同人类一般自我驱动、自主学习、持续自进化。
不仅如此,机器人还体现出这些特质:
动作一致性:机器人就像“成熟人类”——逻辑自洽、动作丝滑、懂物理、手眼协调。
思考持续性:机器人不“半途而废”且“越用越稳”,长时序环环相扣。
甚至还有个性:装载“做个人吧”大模型的机器人仿佛每个人都有自己“做事的独特调调”,好像有了性格。
其他特点,不一而足,但我现在真的开始相信,具身智能真正能为人所用的时刻已经快到来了。
智能,可能已经真的涌现了,在我们看不到的地方。
你对这几个新Demo怎么看?欢迎来评论区互动留言,咱们一起给点鼓励和压力,逼出技术团队现身说法,是回应也是交流~~