机器人的智能短板,大晓世界模型补齐
具身智能今年一直在讲量产的故事,资本爱听,市场爱追,尤其是宇树上市,把想象空间急速放大。
整机价格不断下探,产业链预期一路升温,一台机器人从执行器到丝杠、灵巧手,都能找到新的估值想象。
但是宇树市值不到一个月腰斩的事实,也让市场重新审视,仅靠本体、销量和量产预期,究竟能支撑多少估值。
三季度开始,产业端对“机器人大脑”的关注明显升温,世界模型更是进入密集发布期。
9月9日,京东发布JoyAI世界模型;10日,宇树开源加入世界建模能力的WLA,高德发布3D原生城市世界模型ABot-Earth 0.7;11日,蚂蚁灵波继续开源LingBot-World 2.0。
一家成立仅一年多的公司,也迅速在这场竞赛里出圈。
近日,大晓机器人联合南洋理工大学S-Lab发布Puffin-World,在密集上新的世界模型中引发不少关注。
Puffin-World把物理、几何和外观直接定义为三种原生三维世界状态,不只生成画面,还要理解重力、空间结构,并预测未来的世界状态。
具身智能,拼智力久矣。
具身智能暴露智力短板
年初,图灵奖得主、世界模型路线的重要推动者杨立昆曾表示,人形机器人那些“打功夫”的炫技动作很多都是预先计算好的,行业最大的秘密在于,没有一家公司真正知道如何让机器人聪明到足够有用,现有机器人甚至还达不到家猫水平的常识能力。
IDC数据显示,2025年全球人形机器人出货量已经超过1.8万台,中国厂商占比接近95%。但接近九成产品仍流向文娱表演、教育科研、数据采集、导览展示等场景,真正进入工业制造的只有9.2%。
到了2026年上半年,全球出货量进一步超过2.2万台,智能制造和仓储物流合计占比却只有18%左右。
以宇树为例,2025年前三季度,宇树73.6%的人形机器人收入来自科研教育,行业应用仅约9%。
大量机器人没有进厂打工,而是留在实验室、课堂和展会舞台上卖艺。
要想跨过理论与现实之间的鸿沟,世界模型是最重要的技术路线之一。
所谓世界模型,本质上是让AI在内部建立一套对现实世界的模拟。机器人不仅要知道眼前看到了什么,还要理解物体之间的空间关系、基本物理规律,以及一个动作做出去之后,环境可能发生什么变化。
机器人能在脑内预演后果,跨场景泛化才真正有了基础。
目前来看,资本的注意力已经开始迁移。
IT桔子数据显示,2026年前8个月,国内具身智能赛道已经完成466起融资,融资金额达到1245.1亿元。其中,具身大脑系统的融资起数占比已经达到38.8%,反超人形机器人整机的21.1%,成为融资次数最多的子赛道。
到了8月,盖世具身智能统计的56起融资中,接近一半流向与大脑系统相关的企业。
世界模型,也由此从一条前沿技术路线走到了牌桌中央。
大晓机器人此时推出Puffin-World,踩中的正是这个窗口。
大晓押注世界模型
大晓机器人,是这一轮具身智能创业潮里很年轻的一家公司。
公司2025年7月成立,由商汤科技联合创始人王晓刚出任董事长,陶大程担任首席科学家。
仅2026年上半年,大晓累计融资数亿美元,蚂蚁集团、吉利资本、达晨财智、深创投等均有参与。
成立一年多,大晓已经连续推出多代机器人基础模型和世界模型,最近在行业引起轰动的,就是与南洋理工大学S-Lab联合发布Puffin-World。
和不少从整机切入的机器人公司不同,大晓一开始就把重心放在模型层。
今年6月,大晓发布Kairos世界模型技术栈,7月升级到Kairos 3.1。Kairos解决的问题更靠近机器人行动端,把视觉、语言、力触信息和动作轨迹放进同一套模型,根据当前状态推演后续变化,再生成动作。
这条路线锚定的,是人形机器人最难解决的长程任务。
机器人抓一次杯子并不难,难的是连续完成开门、取物、移动、放置等一串动作。中间任何一步发生偏差,后续动作都要跟着调整。如果模型只能按照预先学好的动作序列往下执行,任务越长,误差越容易累积。
大晓此前一直把这类问题作为重点。Kairos 3.1进一步加入长时记忆和端侧部署,希望让机器人在任务过程中持续判断环境变化,而不是每一步都依赖固定脚本。
问题在于,要实现任务执行,前提是脑子里先有一个足够准确的世界。
Puffin-World就是答案。
过去不少世界模型主要围绕RGB视频预测展开,根据前面的画面生成下一帧。这样的路线擅长生成,却会把很多对机器人更重要的信息忽略,比如重力方向、相机姿态、物体距离和空间结构。
Puffin-World把物理、几何和外观拆成三种原生状态统一建模。
物理状态负责重力方向和相机姿态,几何状态描述深度与空间结构,外观状态对应最终看到的视觉画面。
基于这套表示,Puffin-World用一个模型同时完成了四类任务:物理世界理解、自由视点模拟、三维生成与重建,以及闭环探索。
尤其是闭环探索,意义在于模型不再只是被动生成画面,而是可以根据当前环境判断下一步应该观察哪里,再继续更新对世界的认识。对于机器人而言,这比单纯把视频生成得更逼真更接近真实需求。
数据规模也随之往前走了一步。
大晓与南洋理工S-Lab构建的Puffin-16M包含1500万组视觉—语言—相机三元组,以及100万条复杂相机轨迹;与此同时,团队还为28个公开数据集补充绝对相机姿态标注,覆盖约4450万张图像。
从公开评测看,这套模型已经取得了成果。
Puffin-World在相机到世界理解、相机可控生成、复杂轨迹和3D世界建模四类任务上取得领先成绩。其中,相机理解12项中位误差指标全部最优,36项AUC指标中33项达到最好或并列最好;在RealEstate10K三维世界建模上,也取得17.22的PSNR和0.318的LPIPS。
把Kairos和Puffin-World放在一起,大晓的技术路线就容易理解了。
Puffin负责把现实世界表示得更准确,Kairos再把这种理解继续推向任务规划和动作执行。二者合并,指向的是一个可以授权给全行业的机器人大脑。
如果这条路走通,人形机器人行业的估值锚点会彻底位移。
机器人大脑,值得独立估值
过去资本市场给机器人公司定价,核心还是整机。
一家公司能不能制造机器人,能否稳定交付,最终决定了其收入规模和估值空间。
即便人形机器人披着最前沿技术的外衣,背后的估值逻辑仍然离不开制造业。
但当竞争开始转向机器人大脑,这套估值方法就不够用了。
模型和软件最大的不同,在于一次研发可以被反复复制。如果同一套机器人大脑能够适配不同厂商的本体,又能进入工厂、仓储、家庭等不同场景,软件和模型就有机会从硬件里单独拆出来,形成新的价值层。
事实上,资本已经开始尝试为这种可能性定价。
今年1月,机器人基础模型公司Skild AI完成14亿美元融资,估值超过140亿美元。
Skild的目标是打造一套能够控制不同机器人、完成不同任务的通用大脑。
另一家同样押注通用机器人模型的Physical Intelligence,最新一轮融资估值也达到约110亿美元。
这些公司的估值背后,市场购买的其实是一种平台化预期。今年9月,Skild披露,其商业部署仅10个月,年化收入已经突破1亿美元,付费客户超过60家,应用覆盖仓储、工厂、数据中心、配送、安防等多个场景。
未来机器人品牌可能有很多,但负责理解环境、规划任务和生成动作的大脑,并不一定需要自主研发。
类似的价值迁移,在其他科技产业已经发生过很多次。
汽车进入智能化时代后,整车制造固然重要,但自动驾驶、操作系统和软件能力已经拥有独立价值。
半导体行业的ARM,卖的不是芯片而是架构和IP授权;安卓不收手机钱,收的是生态位;云计算按算力计费,与服务器是谁制造无关。
不同的是,这套估值逻辑放在人形机器人赛道更有想象力。
机器人如果只能完成几项固定动作,本质上仍然是一台披着人形外壳的自动化设备;只有能够理解环境、规划任务并持续学习,才接近市场真正期待的通用机器人。
世界模型正在进入人形机器人任务规划和自主决策的关键链路,也是机器人大脑中技术壁垒最高、最容易形成溢价的部分之一。
这也是大晓机器人成立一年多,就迅速得到资本重视的原因。
大晓今天拥有的,并不只是一款世界模型。
从基础模型、数据底座,到不断扩大的本体适配和场景连接,这些能力正在被放进同一套体系里。单独看任何一项,都很难解释机器人大脑的全部价值。
真正值得资本提前定价的,是这些能力未来还能形成多大的组合空间。
从这个角度看,大晓争的已经不是某一款模型的领先,而是下一代机器人产业里最有可能被独立定价的那一层能力。
当人形机器人从硬件竞赛走向智能竞赛,世界模型、数据和跨本体适配能力,很可能从整机的附属项,变成决定产品边界和产业价值的核心资产。
届时,才真正进入大晓们的主场。
来源:朝阳资本论
加载中,请稍侯......