在未来几年里,这个行业打算制造并卖出几十万台价格不菲、但基本没啥用的机器,寄希望于未来某天能顺藤摸瓜,做出既便宜又好用的产品。
中国的人形机器人正在“超越”竞争对手。 8 月 17 日,一款名为“超人”的人形机器人跑出了每秒 12.66 米的速度,打破了尤塞恩·博尔特创下的纪录,不过随后便一头撞在了墙上。这一壮举让“超人”的制造者宇树科技名声大噪。两天后,宇树科技在上海上市,其股价暴涨了 460%。
随着人形机器人运动会在北京开幕,预计未来几天还会有更多令人惊叹的展示。然而,正如“超人”奔跑壮举以尴尬收尾所表明的那样,这项技术还有很长的路要走。今年,中国公司预计将售出 5 万台人形机器人,是去年的三倍多。他们已经基本掌握了机器背后的硬件技术,但软件方面则是另一回事。

为了创建能让机器人流畅执行各种实用任务的基础模型,现在必须收集海量的数据。驱动当前一代人形机器人的模型参数量只有几十亿;而要复制人体的功能,它们需要数千亿个参数。
这将使它们的模型规模与驱动聊天机器人的大语言模型相当。不同之处在于,聊天机器人可以通过互联网上现成的大量数字文本进行训练。而要收集数据来教会机器人识别玻璃杯、拿起来并倒满咖啡,难度要大得多。它必须理解从空间位置、玻璃杯的易碎性到杯中液体粘稠度的一切信息。这些信息必须从现实世界的经验中挖掘,或者从对这些经验的精细重现中获取。
目前,人形机器人喂入的数据杂乱无章,通常来自低质量的模拟环境。相比之下,从现实世界收集的数据要有用得多,也因此备受追捧。其中最理想的是“真机”数据,即机器人通过远程控制或自主执行任务时产生的动作数据。另一个重要来源是记录人类完成任务时的动作。这被称为“第一视角”数据,是通过让人员佩戴头显和触觉传感器手套来记录其动作而收集的信息。
得益于湖北人形机器人创新中心等培训中心的建立,中国正在迅速成为获取真机数据的领跑者。在武汉的这家庞大机构中,每天有多达 100 台机器人花数小时观察并模仿人类。在中心的数十个工位之一,柜台后的一名年轻男子正转动着戴着数字传感器手套的手,做着仿佛在往咖啡上倒热水的环形动作。在他身边,一台机器人正模仿他的动作,用一把水壶往咖啡滤漏里倒真水。机器人手腕和手指的运动方式逼真得让人有些心里发毛。距离这个临时咖啡馆几步之遥的地方,是一个看起来像药房的区域,另一对“人机组合”正在给货架补货。旁边是一家便利店,接着是一条工厂流水线,以及其他各种工作场景。(在此之前,外媒记者从未获准访问这些中心。)
咨询公司 Interact Analysis 的数据显示,武汉的这家中心是中国 53 个专为探索人类运动奥秘而建的设施之一。其中大部分建于过去两年。另有 34 个正在建设或规划中。其中一个正在上海建设的中心将可容纳 1000 台人形机器人。而沿海省份浙江的一个小城市就已经拥有了六个培训中心。
培训中心需要巨大的空间和大量的人手来运营,还需要大批前沿的人形机器人,这些机器人每台造价可能高达 10 万人民币(约合 1.5 万美元)。汇丰的科里·陈估计,这种培训模式每小时的成本为 500 到 700 元。在咖啡工位上,机器人每倒 8 个小时的咖啡,只能产生 3 个小时的有用数据。其余数据都作废了,主要是因为出现了工程师不希望机器人学会的错误。据估计,要开发出能够执行各种日常任务的机器人,需要 1 亿个小时的训练时间。
对宇树科技等中国企业来说,幸运的是,政府已经为这些中心承担了大部分费用。大约有五分之四的中心拥有政府背景。许多项目是私营企业与地方政府合作设立的,由政府购买人形机器人,再将产生的数据卖回给企业。估算数据各有不同,但在 2026 年上半年,中国制造的人形机器人中有多达 70% 销往了这些培训中心,总计约 1.3 万台。通过建立这些中心,地方官员可以提振当地所生产机器人的需求。
与此同时,中国的机器人制造商正设法从该国庞大的制造业劳动力以及许多失业青年中收集第一视角数据。一个制造相关可穿戴设备的家庭作坊式产业应运而生。一些人希望年轻人能在家中戴上这些设备,当作一份兼职工作。电商公司京东在今年早些时候表示,它已启动一个项目,出资让其 10 万名员工和另外 50 万人记录他们自己的动作。在沿海省份江苏的一家设施中(据报道获得了政府资金支持),该公司付钱让人在模拟杂货店等环境中缓慢地执行动作。在未来两年内,它计划收集 1000 万小时捕捉现实世界人类场景的数据。
人类自己产生的第一人称视角数据,用起来远不如真实的机器数据顺手。毕竟在现实世界里,人类手脚的动法跟机器关节完全是两码事。就算有些数据勉强能用,也必须先经过“标注”。这得靠人工手动给每一个动作贴标签,机器人才能搞懂这个动作对应的是哪条肢体、哪种动作。不过,中国当年在图像识别领域能抢占先机,靠的就是手握大批负责“标注图片”的劳动力。一位在机器人公司工作的工程师表示,中国完全可以故伎重演。
如何训练你的机器人
中国的人形机器人产业,和以往在这片土地上蓬勃发展的其他制造业大不相同。在未来几年里,这个行业打算制造并卖出几十万台价格不菲、但基本没啥用的机器,寄希望于未来某天能顺藤摸瓜,做出既便宜又好用的产品。相比之下,美国的竞争对手一直在寻找成本更低的训练方法。比如美国最大的人形机器人厂商特斯拉,据说直接把机器人放进自家仓库里进行实操训练,省下了专门建造测试基地的巨资。还有不少公司干脆直接用人类运动的视频来“喂”机器人。鉴于美国现在几乎找不到什么工人来穿戴设备、收集第一人称数据,一些公司便把目光投向了海外。据报道,他们花钱雇佣穷国劳工(那里的工资比中国还要低),让他们戴上头戴设备和触觉手套,一边干活一边收集数据。
话虽如此,就像当年的计算机视觉技术一样,中国在数据收集上的领先优势几乎是板上钉钉。但代价是什么呢?以目前的技术水平,再考虑到技术迭代所需的时间,人形机器人的商业化市场在未来十年内恐怕都很难成气候。投行摩根士丹利预计,到 2030 年,中国每年能生产约 45 万台人形机器人。只不过,其中很多机器人的“智商”可能依然堪忧——只能继续不断地往墙上撞。
编译自《经济学人》,原文链接:点击阅读。