外滩大会三问具身智能:模型、数据、生态如何突围?
2026年,具身智能已经走出实验室的玻璃房。
行业报告预测,今年全球人形机器人出货量将达到6.25万台,同比增幅接近247%,中国厂商占据绝大多数份额。
在刚刚结束的外滩大会上,机器人不再只用来跳舞表演,药房里的分拣机器人穿梭在80厘米窄货架间完成夜间分拣;在工厂产线上,机械臂承接小件上料、纸箱拆垛;在医院场景中,康复机器人日复一日辅助病患肢体训练。资本、政策、供应链集体向这个赛道倾斜。
但热闹背后,行业还没有从样板点走向规模化复制。大量样机停留在展会演示,一次完美的Demo可以靠反复调试拿到,但换到另一家门店、另一套产线,成功率便断崖式下滑。
在外滩大会举行的“基座之上:具身智能的场景突围与协同进化”论坛上,多位具身智能领域的科学家、数据专家与企业CEO共同探讨了行业现状和卡点。
他们认为,行业热度之下,技术路线没有收敛,高质量物理数据供给不足,能够规模复制的产品形态和商业模式也还在探索中。
过去一年,VLA、WAM的路线之争占据了具身智能行业大量讨论篇幅。
一部分团队选择在成熟的视觉语言大模型之上做改造,把数字世界的能力迁移到机器人;另一部分押注世界动作模型,强调对物理环境的推演预测。两种方案都产出过不少惊艳的演示视频,但落地到真实多变的物理环境,两套路径都暴露出明显短板。
蚂蚁灵波首席科学家沈宇军在圆桌论坛上直言:“上半年大家一直在争论做VLA还是做WAM?站在现在这个时间点往回看的时候,感觉那时候之所以会有技术路线之争还是因为大家过于想走捷径。”
VLA、WAM本质上是把已有的VLM多模态模型、视频生成模型迁移到机器人任务上衍生出的概念名词。数字大模型接收的是对话式的输入,而物理世界机器人面对的是源源不断涌来的传感器数据流:视觉、力觉、空间位移等,且环境时刻发生变化,这是两套完全不同的信息范式。把现成数字模型拿来做二次微调,短期可以快速做出亮眼Demo,却绕不开物理世界独有的难题。
香港中文大学校长特聘助理教授薛天帆补充了另一重现实约束。语言大模型可以在统一模态下完成训练迭代,具身智能却做不到。不同机器人本体传感器配置千差万别,灵巧手、轮式底盘、人形躯体硬件差异巨大,模态很难统一。
同时,评测体系严重缺失,不像计算机视觉有大量标准化公开数据集,真机测试成本极高,很难公平横向比对各家模型真实能力。各个模块互相牵制,单一模块单点突破,很难带来整体质变。
对此,行业普遍认为,具身模型还是要从机器人需要什么能力出发,而非从已有工具出发。
沈宇军把机器人大脑拆解为三项底层工作:从传感器原始信号生成高质量Token;完成多模态信息的对齐融合;基于全部观测输出可落地执行的动作。这三件事对应的感官、神经信号传导、动作输出逻辑,是现有大语言模型没有接触过的领域。
“沿着借用数字模型那条路走有短期价值,但走到最后,有一些门槛一定要跨过。”沈宇军说。
刷榜、跑分、演示之外,行业还需要一套面向真实物理世界的评判标尺。
沈宇军提出一个设想:“把机器人带上模型,在这个会场通上电,跟所有的人接触,要能待满一整天不出问题。”
这个标准看似简单,背后却是对泛化性、安全性和长程任务能力的综合考验。“如果这件事情做不到,它只能是在某一个特定场景或封闭场景待着的话,谈通用还太远。”沈宇军表示。
“具身智能缺数据”是整个行业最高频的共识。但行业普遍认为,当下高质量的数据更为重要。
评论交流
0