炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:澎湃新闻)
在刚刚落幕的2026世界机器人大会上,宇树科技创始人王兴兴给出了一个很有传播力的判断:如果有一天,把一台机器人带到完全陌生的环境,只需要用语言告诉它做什么,它就能在大约80%的陌生场景中完成80%的任务,那么具身智能就迎来了自己的“ChatGPT时刻”。至于这个时刻何时到来,他的预测是,最快两三年,慢则五年甚至十年。
这个论断的价值,在于给长期缺乏统一尺度的机器人产业提供了一把直观的标尺。它把人们的注意力从机器人会不会跑、能不能翻跟头、舞台表演是否惊艳,重新拉回到真正决定产业前景的问题:泛化能力。在固定产线上,机器人经过专项训练,可以把任务做到接近100%的成功率。但走进一个陌生房间,仅凭一句话就能处理从未见过的物体,需要的是另一个层级的智能。
不过,如果真把机器人的“ChatGPT时刻”与2022年大语言模型的突破相提并论,我却越来越觉得:机器人要通过的,是一场难度高得多的考试。差别首先来自它们面对的两个世界。大语言模型处理的是高度数字化的信息世界。书籍、邮件、网页、代码,都可以转换成Token(词元),模型的输出同样以Token序列呈现。在一般的信息交互中,一次错误通常还有补救空间,可以追问、纠正,也可以重新生成。
机器人面对的是真实的物理世界。这个世界连续、动态、部分可观察,而且充满偶然性。塑料袋产生形变,柜门只打开一半,光线忽然变暗,宠物从脚边经过,这些在人类看来微不足道的变化,都可能让训练有素的动作瞬间失效。所谓“泛化能力”的瓶颈,就藏在这里:机器人一旦离开熟悉的场景,面对新的物体、新的空间关系和新的干扰,原先学会的能力很难稳定迁移。
这正是机器人与大语言模型之间最深的一道鸿沟:语言世界容得下误差,物理世界会把误差变成后果。语言模型说错一句话,我们可以纠正并重新生成。机器人若把玻璃杯的位置判断错三厘米,杯子可能已经碎在地上,而碎裂的玻璃又改变了接下来的环境。具身智能因此处在一个更加严酷的闭环:观察世界—理解世界—决定行动—控制身体—改变世界—重新观察。任何一环出现偏差,都可能沿着链条传导下去,且无法像对话那样“清空重来”。
更棘手的是,现实中的任务往往是一条很长的动作链。我们对一个人说“把厨房收拾一下”,只有七个字,背后可能包含几十甚至上百个判断与操作。什么该留,什么该扔,餐具放在哪里,垃圾如何处理,物品怎样归位。机器人不仅要理解“收拾”这样含义模糊的指令,还要在执行过程中不断感知环境变化,随时调整后续行动。动作链越长,中间一次判断或操作的偏差,越可能影响整个任务。
今年发布的LongAct(用于评估长时序家务任务规划能力的测试集),恰好说明了这一点。研究人员甚至刻意拿掉了机器人最困难的低层运动控制,只考察其对长时序任务的理解与规划能力。即便如此,当前顶尖模型的目标完成率仅为59%,完整任务成功率更只有16%。换句话说,暂且送给机器人一双“完美的手和腿”,它的大脑面对复杂家务时,仍经常走不到终点。
Google DeepMind今年发布的Gemini Robotics 2,则从实际操作一端印证了同样的问题。这款模型已经能够驱动人形机器人实现行走、弯腰、伸手与操作物体,完成持续数分钟、包含多个步骤的复杂任务,进展相当明显。但DeepMind公布的数据同样耐人寻味:双指夹爪完成常规抓取放置、工具装配和精密插接任务的成功率分别约为74%、79%和90%。换成五指灵巧手之后,不同任务之间的落差却非常大:拧下灯泡的成功率达到92%,拧回去却只有36%;扎紧垃圾袋为44%,使用簸箕32%,封合密封袋40%。
这组数字很有启发。真正决定机器人能否进入家庭和工厂的,往往是那些人类毫不起眼的小动作:扎好一个垃圾袋,拿起一件皱巴巴的衣服,捡起掉在桌角的一颗药片,把不同形状的碗逐一放进洗碗机。对人来说近乎本能的动作,背后其实需要视觉、空间感知、力觉、常识判断、任务规划与实时控制的高度协同,而这正是当前机器人能力最薄弱的地方。
这也让我对王兴兴提出的“80%”多了一层疑问。80%的任务完成率,究竟是一个技术上的突破点,还是一个真正可以放心使用的门槛?聊天机器人若能答对80%的问题,已经相当有价值。家庭机器人如果平均每做五件事就有一件失败,我们很难放心让它独自照看老人与孩子。
由此,机器人产业真正要跨越的,可能是两道不同的门槛。
第一道是能力临界点。机器人进入相对陌生的环境后,能够听懂自然语言指令,自主拆解任务、规划步骤,完成相当比例的工作。王兴兴提出的“80%”,大体指向的就是这一层级。一旦跨过这道门槛,人形机器人就有机会从演示阶段,进一步走向工厂、仓库、商场等半结构化场景中的常态化应用。
第二道是更加苛刻的信任临界点。真正决定人们是否愿意把现实空间交给机器人的,还在于它的行为能否被预期。它可以偶尔犯错,但不能在犯错时失控;可以遇到不会做的事,但要知道自己的边界,并以安全的方式退出。只有当机器人的失效方式也变得可控和可解释,家庭、医院、养老院这类高风险场景才可能真正向它开放。
从80%走向99%,往往比从0走向80%更加困难。自动驾驶过去十余年的历程,已经反复证明了这一点。让车辆在绝大多数道路上自动行驶,技术上并非遥不可及。真正耗费时间的,是那些罕见、复杂、不可预测的长尾场景。机器人面对的长尾更加庞杂。世界上的厨房没有统一尺寸,杯子没有统一形状,每个家庭都有自己的物品摆放逻辑,甚至每个人对“把房间整理一下”的理解都不尽相同。
不过,长尾问题难解,并不意味着机器人的进步只能缓慢爬坡。未来几年真正值得关注的,是具身智能能否形成类似大模型的数据飞轮。视觉—语言—动作模型(VLA)、世界模型、仿真训练、真人视频以及机器人在真实环境中产生的数据,正在被逐步连接起来。机器人每获得一次真实世界经验,都可能成为下一代机器人共用的训练素材。一旦这种循环建立起来,机器人能力的提升就可能从单点突破进入持续加速的阶段。
但它未必会复制ChatGPT那种“一夜之间改变世界”的路径。ChatGPT上线后,可以借助现成的电脑、手机和云端基础设施迅速触达海量用户。机器人则必须经过制造、部署、维护和安全认证,还受到成本、续航、关节寿命和供应链约束。一个新的大语言模型可以在几个月内服务数亿人。一个新的机器人模型即使能力突然翻倍,也需要一台台机器进入工厂、商场和家庭,才能真正转化为现实生产力。也正因为如此,再看人形机器人,我已经不太关心它还能不能跑得更快、跳得更高,也不太容易被一段惊艳的演示视频说服。这个行业最容易发生的误判,就是把出货量的增长当成智能水平的增长,把一次成功表演当成长期稳定的自主作业能力。
我更愿意盯住三个数字:进入从未见过的环境,任务成功率是多少;面对长时序任务,从头到尾完整完成的比例是多少;持续运行多长时间,才需要一次人工干预。哪一天,机器人公司开始持续公布这些数据,而且逐年稳定改善,那才是真正值得关注的信号。
真正成熟的技术,最终都会从奇观中退回日常。未来机器人的“ChatGPT时刻”,或许不会诞生于一场万众瞩目的发布会,也不会由一次后空翻、一场拳击或者一段刷屏视频来宣告。它可能发生在一个极其普通的下午:我们随手指着厨房说一句“帮我收拾一下”,然后转身离开,再也没有回头看它。
(作者胡逸为数据工作者,著有《未来可期:与人工智能同行》一书)
来源:胡逸
上一篇:光模块半年报全景透视:“双雄”领跑,全产业链“整体景气、全面开花”
下一篇:上海机场:8月31日获融资买入1937.83万元,融资余额15.88亿元占流通市值比例2.74%,低于近一年50%分位水平