从样板点到规模化:具身智能卡在哪?

信息来自 21世纪经济报道 | 科技创新 | 2026-09-14 19:31:17

外滩大会三问具身智能:模型、数据、生态如何突围?

2026年,具身智能已经走出实验室的玻璃房。

行业报告预测,今年全球人形机器人出货量将达到6.25万台,同比增幅接近247%,中国厂商占据绝大多数份额。

在刚刚结束的外滩大会上,机器人不再只用来跳舞表演,药房里的分拣机器人穿梭在80厘米窄货架间完成夜间分拣;在工厂产线上,机械臂承接小件上料、纸箱拆垛;在医院场景中,康复机器人日复一日辅助病患肢体训练。资本、政策、供应链集体向这个赛道倾斜。

但热闹背后,行业还没有从样板点走向规模化复制。大量样机停留在展会演示,一次完美的Demo可以靠反复调试拿到,但换到另一家门店、另一套产线,成功率便断崖式下滑。

在外滩大会举行的“基座之上:具身智能的场景突围与协同进化”论坛上,多位具身智能领域的科学家、数据专家与企业CEO共同探讨了行业现状和卡点。

他们认为,行业热度之下,技术路线没有收敛,高质量物理数据供给不足,能够规模复制的产品形态和商业模式也还在探索中。

过去一年,VLA、WAM的路线之争占据了具身智能行业大量讨论篇幅。

一部分团队选择在成熟的视觉语言大模型之上做改造,把数字世界的能力迁移到机器人;另一部分押注世界动作模型,强调对物理环境的推演预测。两种方案都产出过不少惊艳的演示视频,但落地到真实多变的物理环境,两套路径都暴露出明显短板。

蚂蚁灵波首席科学家沈宇军在圆桌论坛上直言:“上半年大家一直在争论做VLA还是做WAM?站在现在这个时间点往回看的时候,感觉那时候之所以会有技术路线之争还是因为大家过于想走捷径。”

VLA、WAM本质上是把已有的VLM多模态模型、视频生成模型迁移到机器人任务上衍生出的概念名词。数字大模型接收的是对话式的输入,而物理世界机器人面对的是源源不断涌来的传感器数据流:视觉、力觉、空间位移等,且环境时刻发生变化,这是两套完全不同的信息范式。把现成数字模型拿来做二次微调,短期可以快速做出亮眼Demo,却绕不开物理世界独有的难题。

香港中文大学校长特聘助理教授薛天帆补充了另一重现实约束。语言大模型可以在统一模态下完成训练迭代,具身智能却做不到。不同机器人本体传感器配置千差万别,灵巧手、轮式底盘、人形躯体硬件差异巨大,模态很难统一。

同时,评测体系严重缺失,不像计算机视觉有大量标准化公开数据集,真机测试成本极高,很难公平横向比对各家模型真实能力。各个模块互相牵制,单一模块单点突破,很难带来整体质变。

对此,行业普遍认为,具身模型还是要从机器人需要什么能力出发,而非从已有工具出发。

沈宇军把机器人大脑拆解为三项底层工作:从传感器原始信号生成高质量Token;完成多模态信息的对齐融合;基于全部观测输出可落地执行的动作。这三件事对应的感官、神经信号传导、动作输出逻辑,是现有大语言模型没有接触过的领域。

“沿着借用数字模型那条路走有短期价值,但走到最后,有一些门槛一定要跨过。”沈宇军说。

刷榜、跑分、演示之外,行业还需要一套面向真实物理世界的评判标尺。

沈宇军提出一个设想:“把机器人带上模型,在这个会场通上电,跟所有的人接触,要能待满一整天不出问题。”

这个标准看似简单,背后却是对泛化性、安全性和长程任务能力的综合考验。“如果这件事情做不到,它只能是在某一个特定场景或封闭场景待着的话,谈通用还太远。”沈宇军表示。

“具身智能缺数据”是整个行业最高频的共识。但行业普遍认为,当下高质量的数据更为重要。

免责声明:本文信息来自 21世纪经济报道 平台,仅供参考。如有侵权,请及时联系我们删除。

评论交流

0
支持回复和点赞