WAIC2026 深度|困住具身智能的,从不是数据规模,而是对齐难题
撰文 | 白丽
出品 | 勇砺商业评论 阿桶观察 全球商业风向
作为全球人工智能领域的顶尖风向标,2026年世界人工智能大会(WAIC)的规模与规格再次刷新纪录。
来自全球数十个国家和地区的顶尖学者、科技巨头CEO与顶级资本齐聚上海,上百家大模型与具身智能企业在此同台竞技。
在这个汇聚了全球AI产业最强声浪的最高舞台上,热闹与冷静正形成一道极其微妙的分界线。
如果你只是在主展馆里漫步,会觉得这是一个属于“钢铁侠”的黄金时代——这里有上百款形态各异的人形机器人,有的在倒咖啡、有的在叠衣服、有的甚至在表演高难度体操。
但如果你推开闭门研讨会的大门,在那些距离商业落地最近的圆桌论坛上,气氛却截然不同。
行业大佬们不再执着于用花哨的演示来证明“机器人有了灵魂”,讨论的焦点已经从“模型架构与参数规模”,下沉到了极其干瘪却致命的工程命题:跨本体的数据因果关系怎么对齐?端侧延迟如何降到毫秒级?在工厂搬砖的单机投资回报率(ROI)需要几年能打平?
具身智能正在经历一场从“规模幻觉”向“工程理性”的残酷倒逼。而在这个转折点上,星源智创始人兼CEO刘东,抛出了一个略显“冷峻”但直击要害的观点。
在“真机数据赋能基础模型训练”论坛上,刘东对着台下的产业代表们一针见血地指出:“具身智能的数据竞争,首先不是规模竞争,而是质量竞争。未经标准化和对齐的数据不宜直接混合训练。”
在这个笃信大模型“大力出奇迹”(Scaling Law)的时代,刘东显得格外冷静:“数据规模仍然重要,但扩大规模应建立在统一标准和高质量数据基础上”。
实际上,如果你了解他的来历,就会明白这种“工程实用主义”并非空穴来风。
谁是刘东?谁在试图做具身智能里的“Tier 1”
在创立星源智之前,刘东曾担任京东智能驾驶总经理,主导过自动驾驶产品从全栈研发到大规模商业化闭环的全过程。他太清楚技术从“实验室算法”走向“真实物理世界”时,需要踩过多少坑。
而在他背后站着的,是被誉为“AI黄埔军校”的北京智源人工智能研究院。
2025年8月,星源智带着智源的深度孵化背景正式成立。这匹黑马以惊人的速度在短短几个月内连续完成数亿元的融资,资方阵容堪称豪华:高瓴、赛富、中科创星等顶级创投,以及智元机器人、乐聚智能等产业龙头纷纷下注。
与展会上那些拼命秀机械结构的硬件厂商不同,星源智的定位非常独特——他们不造机器人的躯体,只造通用具身大脑(RoboBrain)。
刘东曾直言不讳地表示,星源智的目标是做具身智能领域的“ Tier 1 供应商”。他们要将这颗连接AI与真实物理世界的“物理大脑”标准化,卖给千姿百态的机器人本体企业。
但要指挥这支庞大的钢铁大军,星源智必须先跨越第一座大山:数据割裂的数据死结。
数据的“异构鸿沟”:标准化不是为了“整齐”,而是为了“因果”
在互联网和纯文本的世界里,数据天然具备极高的同质性。这让不少人产生了一种错觉:只要把全网的真机操作视频无限量地塞进模型,就能自动涌现出一个适应一切场景的“全能天才”。
但这在物理世界里根本行不通。
行业内很多家企业为了训练和验证基础模型,团队采买了20多个品牌的机器人本体,辛辛苦苦采集了约20万条真机数据。然而,在实际操作中,工程师们很快撞上了一堵极其坚硬的“异构之墙”。
不同厂家的机器人,相机的安装位置、视场角千差万别;轮式、四足、双足机器人的关节扭矩、自由度截然不同;底层的传感器采样频率和标注体系更是自成一派。
这就好比让20个说不同方言、戴着不同度数眼镜的人去教一个孩子画画。如果将这些未经对齐的数据直接混合训练,不仅练不出通用能力,反而会引入巨大的噪声,导致模型产生“神经错乱”,根本无法形成稳定的泛化能力。
面对窘境,团队回过头来做“修路”的苦活:自建数据采集与处理平台,对采集视角、关节信息、数据落盘及标注体系进行强行统一。
刘东在论坛上点破了这一步的本质:标准的意义,绝不仅仅是把Excel表格里的数据“整理得更整齐”,而是为了让不同来源、不同本体、不同场景中的“真实交互因果”变得可比较、可学习、可复用。
当一个双臂机器人因为抓取力度不够导致水杯滑落,和一个四足机器人因为重心偏移导致摔倒,如果它们的数据标准统一了,底层模型就能学到这两种不同表象背后的核心物理因果。这才是真正的高质量数据资产。
祛魅“Sora幻觉”:懂得“为什么失败”的世界模型
除了数据质量的重构,WAIC 2026的另一个核心暗线是对“世界模型(World Model)”能力验证的深层思考。
过去,以Sora为代表的视频生成模型让许多人产生了一种“Sora幻觉”——认为只要模型能生成高逼真度的物理世界视频,就能直接拿来当机器人的大脑。但“看起来合理”与“物理上的绝对精准”是两码事。
刘东指出,随着机器人开始进入真实岗位,世界模型已经进入了严苛的“能力验证阶段”。行业的竞争维度,正在从单纯的模型能力,迅速拓展到工程化能力和产业化能力。
真正具备产业价值的世界模型,必须穿透单纯的视觉生成,掌握三项硬核能力:
预测后果的物理直觉: 机器人不仅要能响应指令,更要能评估动作后果——预测“我推一下这个箱子会对物理世界产生什么影响”,并在微秒级的时间内根据真实反馈调整动作。
端侧闭环的实时性: 如果在高危工业流水线上,机器人的大脑完全依赖云端大算力,一次网络抖动就可能导致机械臂撞毁精密设备。大模型必须在机器人端侧实时运行。
从失败中学习的能力(最关键的一环): 过去我们只教机器人“怎样会成功”,但真实的物理世界充满了变数。模型必须基于真实交互和失败经验持续学习,知道“什么情况下会失败”,才能不断更新策略,提升任务成功率。
这正是星源智押注“具身交互式世界模型 + RoboBrain Pro具身大脑 + 端侧算力平台”协同发展的底层逻辑。让大模型不仅能理解世界,还能评估动作后果并在失败中进化,最后通过标准化接口灵活适配不同躯体。
商业算账:告别展台表演,到真实场景去挣钱
技术价值最终要落在商业闭环上。判断具身智能实力的标准不再是论文的引用量,而是极其冷酷的商业账本。
本届WAIC展现出的一个鲜明变化是:机器人开始真正走向工业制造、公共服务等真实岗位“上岗”了。 机器人的产业应用,不仅依赖本体硬件的强化,更依赖底层智能能力完成的这一轮“工程化演进”。
在星源智与中力股份联合打造的具身装卸解决方案中,我们可以清晰地看到这种“算账思维”的胜利:
无人叉车: 搭载具身大脑后,无人叉车的装卸效率已经达到了人工操作水平,双车协同装卸时间被惊人地压缩到了分钟级。
“擎天柱”高位作业机器人: 这种能在十米高空进行复杂拣选的设备,直接切入了工业场景中最危险、最难招人的地带。过去这类高空作业需要复杂的系统和多台设备配合,现在被整合为单台机器人的自主闭环作业。
工厂老板不在乎你的机器人会不会翻跟头,只在乎它能不能替代十米高空的高危作业,单机效率能不能拼过三个产业工人。星源智通过真实的业务数据,验证了具身智能在工业场景中的硬核商业价值。
走向“Wintel式”的生态大航海
随着行业逐渐祛除虚火,具身智能正在从单点技术突破,迈向规模化应用的前夜。
目前,星源智的具身大脑已经覆盖了超过70%的主流机器人本体企业,包括智元机器人、极智嘉(Geek+)、乐聚等行业头部玩家都在将其技术体系应用于产品部署。
这种现象级覆盖率背后,是产业分工的必然规律。造出一台优秀的机械本体与训练一个高泛化的具身大模型,完全是两套不同的基因。
星源智选择了一条类似“Wintel / 安卓”的生态赋能路线:通过提供标准化的底层接口和“大脑模块”,大幅降低本体厂商的智能化门槛。
站在2026年WAIC的会场,回望过去几年的狂热与迷茫,一个清晰的事实正在浮出水面:
具身智能的终局,不仅在于聚光灯下多么优雅的炫技,或许更在于深夜无人的仓库里,无人设备能否精准、低成本地完成一次次复杂的交互与搬运。
当跨本体的数据因果被统一,当世界模型学会了从失败中总结物理法则,当这颗“大脑”能像芯片一样无缝嵌入到万千形态的机械躯体中时,这个行业,才真正迎来了它的“大航海时代”。(文/白丽)
#WAIC #WAIC2026 #世界人工智能大会 #星源智 #人工智能 #AI #具身智能 #大模型 #世界模型 #机器人
加载中,请稍侯......