“ChatGPT时刻”尚未到来 具身大脑已提前打响“百模大战”
创始人
2026-09-06 19:29:33
0

每经记者|可杨    每经编辑|董兴生    

当前,机器人产业软件落后于硬件已是行业共识,“脑体倒挂”是行业的痛处,如何突破软件端的瓶颈,业内已开始“八仙过海、各显神通”。

在不久前落幕的“2026世界机器人大会(WRC)”上,银河通用创始人王鹤提到一组对比数据:2025年,银河通用发布世界动作模型论文时,他能找到的相关论文只有他们一篇;一年多后,他再次在网上检索,数字已经变成171篇。

另一边,星海图创始人高继扬也谈到,最近的18个月里,全球已经出现100多款开源具身基础模型。

公司层面也迅速变得热闹。

仅世界模型这一赛道,截至8月31日,据《每日经济新闻》记者不完全统计,国内至少已有30家公司发布、预告或明确宣布涉足世界模型。

具身大脑开始呈现出上一轮“百模大战”的特征,只是这一次比很多人预想中来得更早。

2023年,“百模大战”爆发时,ChatGPT(一款对话式人工智能助手)已经完成了一次近乎全民规模的产品教育,大语言模型赛道构成了相对清晰的技术底座。后来者可以争论模型多大、开源还是闭源,但起码清楚自己正在追赶什么。

具身智能恰好相反,行业还没有等来一个所有人都能感受到的“ChatGPT时刻”,也没有就模型路线达成一致。

不过,公司数量最繁盛的时候,往往也是淘汰真正开始的时刻。

答案未定,模型涌现

过去几年,具身大脑的主流答案是VLA(视觉—语言—动作模型),把视觉、语言和动作放进同一个端到端模型,让机器人从人类示范中学习下一步动作。这是在重复被大语言模型验证过的路线,如果大语言模型可以通过预测下一个词学会写作和推理,那么机器人是否也能通过预测下一个动作,学会工作?

过去两年,机器人行业证明了前半句话——经过充分训练后,机器人已经能够抓取、整理、折叠、搬运,甚至完成几个动作组成的任务。

但也正因如此,下一堵墙才变得清晰起来。

宇树科技创始人王兴兴提到,机器人在固定场景、经过充分采集训练后,成功率可以做到接近100%,但环境或物体稍有变化,成功率就会严重下降。“机器人在‘最后几厘米’甚至‘最后几毫米’没办法很好地跟真实世界匹配……最终误差也无法很好地修正,导致成功率下降得很严重。”

对致力于成为生产力的机器人来说,实验室里的一个失败样本,到了工厂会被连续作业不断放大。

墨奇智能联合创始人兼CTO(首席技术官)黄青虬算了一笔账,硬件、软件和算法三个模块,假设每一个模块的失败率是1%,单个动作的成功率就是0.99的3次方,如果机器人要完成一个长程任务,可能是10个动作的集合,那成功率可能就是0.99的30次方。

如此一来,成功率就从99%衰减到73.97%,这意味着在工厂等真实连续作业场景中,如果不解决长程任务的稳定性,机器人每执行三四次任务就有可能失败一次。

世界模型顺理成章地被推到具身智能竞争的中心。

它承接的是行业对下一阶段能力的期待,希望机器人不只模仿过去见过的动作,还能预测动作发生后,环境和自身状态将如何变化,以此提高对新任务和长程任务的处理能力。

但当大家谈及世界模型,所谈论的未必是同一个“世界”。有人强调预测未来画面,有人把视频、动作和机器人反馈放进同一个模型,也有公司尝试引入更多物理规律。

伽利略研发总监刘伯韬认为,现阶段真机实测数据、端侧算力以及模型能力,尚不足以支撑开放环境下的真正通用化能力,很多场景下所谈及的泛化能力仍存在现实瓶颈。

星源智创始人刘东则认为,在物流分拣等边界明确的场景中,让机器人适应不同物体的小范围泛化已经能够实现,而任意环境、任意任务则仍然缺少足够数据。

就这样,世界模型出现了有些反常的繁荣。

VLA已经足够成熟,却没有强大到足以终结技术路线,反而把泛化、长程任务等问题暴露出来,而新的方案还远没有形成强势的共识。

同时,模型本身的门槛也尚未高到把大量玩家挡在大门之外。摩尔线程创始人、董事长兼首席执行官张建中提到,目前大量VLA仍集中在70亿参数左右,训练可能只需要几十张甚至几张GPU(图形处理器)。他认为,具身智能的世界模型真正走向“ChatGPT时刻”,算力需求一定会在千卡甚至万卡级。

百万小时之后数据仍然不够

围绕具身大脑的争论,最后大多会回到数据,但什么才是一条好数据?

大语言模型崛起之前,人类已经花了很多年在互联网上自然生产文本、图片和视频,模型出现以后,只需要把这些已经存在的数据组织起来。

但机器人没有这样的数据基础。

黄青虬举了一个擦桌子的例子。

数据采集员可能只完成一条标准轨迹,但真正的保洁人员却会观察污渍,调整方向、力度和次数,没有擦干净就再来一次。两段数据都叫擦桌子,机器人能学到的内容却相差很大。如果1万小时数据中有9000小时高度重复,时长增加也未必带来新的信息。

数据量成了最容易衡量但也最容易失真的指标。

不同公司的选择也迅速分化,有人坚持真实数据,有人押注仿真,也有公司把互联网视频、人类操作、合成数据、真机遥操和部署回流混合起来。

光象科技将训练过程分成了几个阶段,互联网视频和没有动作标注的人类第一视角数据,主要用于建立模型对物理世界的基础认识;带有动作标注的第一视角数据,帮助模型学习动作发生后物体状态如何变化;真机遥操数据负责适配机器人的真实构型和操作规范;仿真数据则可以在相同状态下批量生成不同动作及其后果,让模型学习哪些动作可行,哪些会导致失败。

王鹤将银河通用的数据体系分为互联网数据、人类数据、合成数据、真机遥操数据和真机回流数据五层。据其披露,公司已积累50万小时高精度人类操作数据和50万小时不依赖手持机械装置的人手数据。

百万小时数据开始成为部分企业争夺的规模门槛,但如何将这些数据转换为机器人能力,仍取决于标注、筛选和训练方法。

真实数据与仿真数据各有代价,真实数据直接来自物理世界,但采集慢、成本高;仿真数据可以大规模试错,却要承担虚实迁移偏差。

奥比中光创始人、董事长兼CEO(首席执行官)黄源浩提到,机器人操作数据正在从视频扩展到第一视角、触觉和力觉,但不同信号之间的时间同步仍不成熟,视觉与触觉数据相差15毫秒都可能影响数据的有效性。机器人的关节范围、手部姿态和传感器配置也各不相同,只有完整记录位置、受力和物体状态,数据才有机会跨本体、跨模型复用。

现阶段,行业还没有探索出一种可以适用于所有任务的比例。

自动驾驶曾经提供过一个很诱人的范本:车先卖出去,人继续驾驶,传感器自然把大量真实驾驶数据带回来,部署越多,数据越多;数据越多,模型越好。

但机器人很难照搬。在机器人学会自主工作以前,没有这么多人会主动购买和使用它,冷启动数据只能由企业自己采集。

因此,公司争抢工厂、物流和零售场景,得到的不只是一张订单,还是数据飞轮的第一圈。

黄青虬认为,目前数据规模仍小,今天很多算法实验得到的结论,随着数据量增长可能被推翻,VLA之后还会出现新的模型架构,真正能够留下来的,是数据和模型训练基础设施,以及经历过一轮轮范式变化的人才。

工厂手握淘汰赛投票权

“百模大战”这个词,天然带有淘汰赛意味。

在上一轮大语言模型的竞争中,大量模型在发布后迅速消失,竞争从参数规模转向推理成本、产品入口、生态与收入。

对机器人产业来说,更大的变化来自客户开始算账了。

星动纪元联合创始人席悦提到,过去不少机器人项目停留在概念验证阶段,客户不会优先考虑价格;今年越来越多的客户开始认真计算投资回报率,以及机器人能否批量、持续、稳定运行。

光象科技首席科学家吕尧认为,行业需要基准来比较模型能力,但最终验证仍要回到真实机器人和工业产线上,看具体工位的任务成功率以及能否为客户创造价值。

光象科技创始人兼CEO张涛也提到,现有榜单还不足以全面代表模型能力,排名靠前只能说明模型进入第一梯队,很难直接证明其真实部署水平。

张涛坦言,客户一定会关注成本,如果一家企业声称不关心成本,其目的很可能并非是真正推动落地。更重要的是要让产品成本与场景价值匹配,对于已经存在更便宜、更成熟方案的任务,没有必要投入一台价格更高的具身机器人。他认为,具身智能更适合传统自动化难以处理,同时具备真实需求和规模化潜力的场景。

这些指标最后都会变成一张账单:一项新任务需要训练几天,一台机器人每天处理多少件产品,换一个场地要投入多少工程师,单位劳动成本能否低于人类。

相比零样本、跨场景和跨本体,这些数字不够醒目,却会更早决定公司去留。

训练成本也在上升。

极佳视界联合创始人、首席科学家朱政测算,团队使用几十万小时数据训练几十亿参数的世界模型和具身基础模型,成本已达到约1亿元。如果未来数据扩大到几千万甚至上亿小时,参数增加十倍、百倍,而数据利用效率没有同步提高,意味着训练模型的成本将提高到上千亿元。

王兴兴把机器人进入陌生环境后,仅凭语言指令完成约80%的任务视作接近“ChatGPT时刻”,他给出的时间是快则两三年,慢则五到十年。

黄青虬给出两个尺度:如果看商业部署,三年内有1000台机器人在真实产业中工作可以算作标志;如果要求机器人在陌生环境和任务中都达到较高成功率,至少还要五年。

高继扬认为,具身智能未必会拥有一个公众同时感知的“ChatGPT时刻”。大语言模型上线后,每个人都能立即打开电脑试用,机器人的第一批有效部署却会藏在工厂、仓库和零售后场。技术拐点可能已经发生,但公众却要等到机器人渗入足够多的生产环节后,才后知后觉地发现它们无处不在。

尽管如此,“百模大战”仍然有它的价值。

在技术路线没有收敛时,足够多的模型、数据方案和本体实验,可以更快排除错误答案。但它最后不会由参数、名字或一次展台演示决定胜负。

相较于大语言模型的“百模大战”,具身智能的筛选可能更早发生。毕竟,大语言模型可以先训练,再寻找用户和应用,但机器人公司在模型还没有收敛时,就已经被推入产业现场,算法、数据、硬件同时开始接受检验。

不过,套用汽车工业的经验,20世纪初,蒸汽车、电动车和汽油车曾经同时跑在街道上,没有人能够确定哪一种代表未来。如今再回头看,那些消失的技术,共同组成了一个新产业寻找主流形态的过程。

历史总是循环往复,一个产业最不知道答案的时候,往往也是答案最多的时候。

封面图片来源:新华社

相关内容

人民币跨境支付正成APEC...
对于中国企业而言,人民币结算能够成为其降低汇兑成本、简化资金管理的...
2026-09-06 19:44:03
原创 ...
这事听起来像个天大的玩笑,却真真切切地发生了:一个国家花费巨资购入...
2026-09-06 19:42:28
对价2.94亿美元!复星医...
大河财立方9月6日消息,复星医药(600196.SH)公告称,控股...
2026-09-06 19:42:20
一批医院,晋升三甲
编辑 | 乐清近日,湖南省卫生健康委员会印发《关于确认耒阳市人民医...
2026-09-06 19:42:18
大幅度降温!冷空气要来了!...
受西风带暖高压脊控制这个周末我省明显有点热在初秋时节气温常有反复不...
2026-09-06 19:41:42
北京最舒服的天气要来了
(来源:千龙网) 【#...
2026-09-06 19:41:25
6700万吨石油涌向中国!...
俄罗斯在中国能源版图上的分量,已经重到没法忽视了。 2025年全年...
2026-09-06 19:41:20
国防部确认:中国空军将派战...
“国防部发布”9月6日消息,应埃及军队邀请,中国空军将派战斗机、预...
2026-09-06 19:40:53

热门资讯

原创 4... 这事听起来像个天大的玩笑,却真真切切地发生了:一个国家花费巨资购入了二十架顶级隐形战机,结果却有超过...
一批医院,晋升三甲 编辑 | 乐清近日,湖南省卫生健康委员会印发《关于确认耒阳市人民医院等3家医院等级的通知》,经严格评...
大幅度降温!冷空气要来了!辽宁... 受西风带暖高压脊控制这个周末我省明显有点热在初秋时节气温常有反复不过最后一定是会回到转凉的主线任务上...
北京最舒服的天气要来了 (来源:千龙网) 【#北京最舒服的天气要来了# 】#北京...
国防部确认:中国空军将派战斗机... “国防部发布”9月6日消息,应埃及军队邀请,中国空军将派战斗机、预警机、加油机、直升机等多型军机,参...
葫芦娃爷爷被山寨了,书圣故里景... 【#葫芦娃爷爷被山寨了#,书圣故里景区回应】#景区回应葫芦娃爷爷被山寨#近日,浙江绍兴。葫芦娃爷爷走...
盘活资产超万亿的XAU差价合约... 近年来,全球资产配置需求持续升温,参与者对高效、灵活的交易工具愈发关注。在这样的背景下,如何通过差价...
提升科技攻关能力,行业特色高校... 转自:中国科学报作为我国高等教育体系的重要组成部分以及国家重要战略科技力量,行业特色高校,特别是其中...
“一带一路”国际攀岩挑战赛暨中... (来源:中国体育报)转自:中国体育报9月4日至6日,2026年“一带一路”国际攀岩挑战赛暨中国攀岩联...
上海下周以多云为主最高温31℃... 澎湃新闻记者从上海市气象服务中心获悉,今日(2026年9月6日)上海天空变化快,时而晴空朗日,时而雨...