
AI重点
文章重点整理:
前言:能破人类纪录的「钢铁飞人」,却可能端不好一杯水,这种体格与「大脑」的严重错位,是当下人形机器人行业最尴尬的缩影。但AI竞赛的下一阶段,能率先将智能能力大规模部署到数以百万计机器之上的才是赢家。
在北京举行的第二届世界人形机器人运动会上,机器人在400米赛跑及跳高项目屡屡写下超越人类选手的世界纪录。但隔壁的灵巧手专项赛现场,机器人做积木搭建、镊子夹豆等「指尖微操」甚至未必稳得过学龄前儿童。运动会组委会委员巩潇坦言,预赛中不少机器人遇到物体材质、软硬度或摆放角度的细微变化,自主决策仍可能出现偏差,面对真实物理世界的不确定性,是目前技术攻关的内核难点,「卡」住的恰是最内核的「大脑」之困。

Demo困境 泛化能力不足
据中国新闻周刊报导,近期的世界机器人大会(WRC)现场,一位负责人形机器人后训练的工程师说,一些人形机器人「干活」的Demo,往往只是在特定场景运行单一任务,一般只需要几百条数据微调,但从Demo到真实场景应用还存在巨大的鸿沟,是因为具身模型的泛化能力不足。
「泛化能力就是机器人今天只学习抓起苹果,明天就能抓起梨,而不是只有学过才会做。」北京人形机器人创新中心(下称「北京人形」)具身智能部负责人鞠笑竹说。昆仑行机器人联合创始人兼CTO郎咸朋以机器人拿起杯子为例,训练时机器人只见过空杯子,那么它是否能成功拿起装满水的杯子,这就是对泛化能力非常直观的一个检验。


人形机器人每次面对新的任务、场景都需要重新学习,这在很大程度上被认为受困于具身模型当前的技术路线。在具身智能领域,VLA模型(视觉—语言—动作模型)2023年兴起;2025年,国内的银河通用、智平方、自变量等企业均对外发布VLA模型,希望最终实现运行任意任务的能力。
「2025年初,大家发现VLA模型泛化能力并没有那么好。」鞠笑竹认为,限制VLA模型泛化能力的一个关键因素在于数据。「VLA模型无法使用大量视频数据训练,更多依赖真机采集数据,很难上量。」
国内企业对于具身模型的真正投入都比较有限。「多数具身模型其实就是两类来源,要么是很小的数据量套用开源框架简单训练而来,要么就是直接微调开源模型而来。」自变量CEO王潜表示。
场景任务 狂「卷」后训练
当前具身模型在部署到具体场景时都需要后训练,这也是国内人形机器人企业在跳过模型预训练,更多「卷」后训练的原因。鞠笑竹认为,针对具体场景和任务,基于VLA进行后训练,对于基础模型能力的提升意义有限,更多只是在拚落地能力与交付。



「目前来看,机器人面对具体场景和任务的表现,在数据上的差异相比模型上的差异能产生更大影响,特别是真机数据,使用1万小时的真机数据训练出的模型,可能比用10万小时仿真数据训练出的效果更好。」优必选副总裁、具身智能与人形机器人研究院院长焦继超说。
「随着数据积累,一旦突破某个点之后人形机器人能力的提升就会变得非常快。」焦继超坦言,如果人形机器人面对从未见过的快件,可能很难完成分拣,但是如果只是快件尺寸、颜色发生变化,人形机器人能展现出一定的泛化能力,并非一定需要「见过」。
「像搬运这样的场景会在今年或明年实现真正规模化落地,下一步会转向一些轻便灵巧类的任务,比如拧螺丝,以及一些长程任务。其实客户更关注机器人在工作场景中的表现,对成功率的关注高于效率。」焦继超说。
在具身模型能力有限的情况下,通过「卷」后训练落地具体场景,更多是商业化的权宜之计。
现况堪比10年前的智驾
今年以来,自变量、智元等公司相继发布世界模型。朗咸朋是智驾领域VLA路线的拥护者,坦言具身智能需要「新故事」,主题就是世界模型。世界模型之所以让人兴奋,便在于其展现的泛化能力。


「当前针对单一场景任务,基于VLA模型再进行后训练,确实能获得更好效果,世界模型生成的动作在精度上还没有达到VLA模型的水平。」郎咸朋做出这样的模拟,世界模型与VLA模型的差距有一些像智能驾驶是否依赖高精度地图的区别,如果依赖高精度地图,每到一座新的城市,就需要从采集数据做起。
「其实世界模型也分为不同的路线,比如国内比较火热的路线是基于现有视频生成模型的世界模型。」尽管鞠笑竹认为,它可能并非未来具身模型的终极答案,但是仍对其在泛化性上的表现感到兴奋。
不过,一旦涉及基础模型,特别是世界模型预训练,对机器人企业算力、数据、人才和资金等资源方面的压力都比较大。宇树科技上市后,模型研发成为最大的单一募投方向。但因技术尚未收敛,没人敢押注特定模型路线。
具身智能公司联合创始人兼CTO郎咸朋将当前具身智能所处的阶段模拟于10年前的智能驾驶,当时智驾领域也是Demo很多,但是技术并未收敛。「未来具身模型的范式可能还会经历迭代,迭代可能导致之前的努力白费,但让机器人理解物理规律一定是方向。」
因为目前机器人的运动能力与精细操作能力严重失衡。它们在跑步、跳高等单一动作上表现亮眼,但遇到材质、角度、重量等细微变化时,决策与控制仍容易失准。 因为VLA等模型的泛化能力仍有限,且无法像其他AI那样大量使用视频数据训练,主要仰赖真机数据。业界因此先针对单一场景做后训练,以提高交付与落地成功率。 世界模型被看好,是因为它更强调对物理规律与场景变化的理解,泛化潜力较大。不过它需要更多算力、数据、人才与资金,且技术路线尚未收敛,短期内仍难成为统一答案。精华 FAQ

