李飞飞的Atlas,为具身智能推开新世界大门
文 | 超前实验室,作者 |青苹吹果,编辑 | star皆空
“世界即所发生的一切。”
这是路德维希·维特根斯坦在1921年出版的《逻辑哲学论》中写下的名言。一个世纪后,这句话被AI领军人物之一李飞飞引用,而她创办的World Labs正在让AI理解空间。前段时间,World Labs发布新一代世界模型Atlas,官方称其为“全球首个”能同时处理文字、图片、视频和3D的多模态世界模型。
来看demo,十分惊艳:喂进两三个视角的照片,它能重建出整个场景,再让镜头飞到从没人站过的位置。
这无疑为行业打开了新世界大门:
长期以来,传统3D重建高度依赖密集拍摄,必须围绕场景进行多角度、高覆盖率的图像采集,才能拼合出相对完整的模型。这种方式对设备、时间和人力要求极高,导致3D内容生产始终难以规模化,门槛居高不下。
Atlas正在改变这一范式。依托大模型的强大先验知识与生成能力,它仅需少量普通手机拍摄的图像,就能实现高保真3D重建。
由此,3D内容创作的门槛被大幅拉低,无需专业设备,也无需密集采集,海量旧照片、旧影像都有机会转化为可用的3D资产,沉睡的数据潜力被重新激活。
不止于此,传统AI生成模型主要服务于影视、游戏等创意产业,核心是生成“看起来逼真”的内容;
而Atlas通过构建可交互、可推演的“世界模拟器”,将AI生成能力拓展至机器人领域,即Real-to-Sim。

它让生成结果不再只是静态画面,而是能够被进入、被操作、被验证的动态环境。
在机器人领域,这意味着机器人可以在AI生成的模拟环境中进行海量试错与策略训练,通过“想象”预测不同动作可能带来的后果,在虚拟世界中快速积累经验,再迁移到真实世界。
这直击机器人真实世界训练数据匮乏、采集成本高昂的核心瓶颈,为具身智能提供了一条低成本、高效率、可扩展的训练路径,也将加速机器人从实验室走向现实应用。
给Atlas一张照片,TA能造出一个世界
先来看Atlas干了件什么事。过去两年,视频生成模型的相机控制全靠玄学抽卡。
你给出一句话或一张图,TA顺着往下想象画面,镜头怎么动基本靠提示词碰运气,生成的画面次次不一样。
而Atlas换了底层逻辑,把“相机”直接做进了模型。
相机位姿参数作为原生输入,要什么角度什么轨迹,直接喂数据给坐标。
World Labs将这套机制称为“空间上下文”,每一张送进模型的图片,都会被锁定在三维空间里的某个具体坐标上,相机的姿态和深度信息,也连同图像一起被带进模型。
模型手里拿的不是一叠孤立的照片,而是一张带坐标的世界草图。
于是你就能像坐进导演椅一样调度它。
官方demo里最出圈的一段,是用三到五台普通手机拍同一瞬间,模型就能冻结时间、把镜头绕进牛奶溅起的那一刻。

放在二十多年前,《黑客帝国》那个子弹时间镜头靠的是上百台相机围着绿幕棚转圈,如今几台手机就能复刻个大概。
3D重建方面也是同样惊艳。
按World Labs官方博客的说法,斯坦福主方庭那段航拍,输入只是2到25张站在地面随手拍的游客照。

传统三维重建讲究把每个角落都拍全,围着场地转几百圈是家常便饭;Atlas给三五张、几十张就能交差。
看到这里,你可能会大受震撼,感叹现在的AI已经开始懂物理世界了!
但其实不然。
官方在博客和访谈中说了两件事:一是Atlas已经在几何层面做到了“空间上下文”理解,二是团队的长远目标是让模型最终理解物理规律。很多人把两者混为一谈。
可几何和物理压根不是一回事。
几何是入场券,物理才是难关
几何和物理的区别在哪里?
几何回答“东西在哪、长什么样、换个角度还是不是原来的形状”;物理则是回答“推它一下会怎么动、会不会倒、捏多重会碎”。
Atlas这次惊艳的部分,基本全落在几何这一栏,碰撞、摩擦、形变这些要真物理的活儿,官方demo里几乎没有体现。
而World Labs本身也清楚这一点。
他们今年6月发过一篇梳理世界模型的长文,开篇就自嘲“世界模型是当下AI圈被用得最滥的词”,接着按功能把各类产品划成三档:只会吐画面的渲染器、能吐出经得起检验的物理状态的模拟器、直接输出动作的规划器。

照这把尺子量,Atlas只是从「渲染器」往「模拟器」的方向迈出了一大步,可离真正懂物理还差距甚远。
过去评一个世界模型好不好,基本只看画面像不像,那类指标说白了是在比像素分布:模型完全可以生成逼真但物理上错得离谱的画面,照样拿高分。
但这两年开始换考卷了。
面向具身智能的评测WorldArena,把“轨迹准不准”“物理遵不遵循”单拎出来当考题。
值得一提的是,今年8月底WorldArena2.0的首版榜单上,国内影溯的InSpatio-Curious拿下77个参评模型的总分第一。

而其画面质量分比第二名低了将近9分,居然还能照样登顶,这是因为轨迹精度、深度准确度、时空一致性这些硬指标把它抬了上去。
可见,在新考卷里,“画得美”越来越不值钱。
除此之外,还有由UCLA、耶鲁、索尼AI与美国陆军研究实验室今年1月联合放出的WorldBench,把物理概念拆开逐项考。
结论相当不留情面:所有被测模型在生成靠谱的物理交互这件事上,一个都没过关。
这样一看,Atlas这份成绩单既没发论文,也没有model card,对比数据出自官方自测,而且同场比较的对手只能拿文字描述运镜,它却握着精确轨迹,赢面天生占优。
更准确地说,Atlas在官方设定的机位控制任务上展示了目前最强的能力。但它没有经过第三方物理评测,不能直接说它“懂物理”。真正的物理关卡,Atlas还没被严格考过;而WorldBench的结论是,现有模型在物理交互上都没过关。
既然如此,大家为什么还一股脑往“物理对不对”这个方向卷?
Atlas为代表的新路径,有望成为具身智能“练功房”
因为物理是否正确,是仿真数据生成能不能用的前提。
李飞飞在发布后的访谈里说:机器人眼下最大的瓶颈是数据,芯片还排不上号。
互联网上现成的文字、图片、视频管够,机器人却学不会这些,它需要的是“从这个角度、用这个力度捏下去会发生什么”这类带物理后果的经验。
但真实采集贵得离谱。
World Labs的创始团队举过例子:过去想重建一个空间,专业采集员也得围着它拍几百上千张,换普通人上手,在一间屋子里转悠一两个小时是常事。
这套成本降不下来,机器人训练的数据就永远攒不够。
于是,“从仿真到现实”这套流程,从实验室的冷门话题变成了兵家必争之地:
先把真实环境快速搬进虚拟世界,再批量做随机化,电线换个方向弯、杯子换个颜色摆、光照随时变,让机器人在虚拟环境里把该踩的坑先踩一遍。

World Labs今年7月悄悄把专攻机器人仿真的SceniX收进囊中,Atlas正是这条战略第一次以模型形态落地。
而把镜头拉长一点,你会发现给AI造“练功房”这件事,人类其实练了很多年。
上世纪30年代,美国人埃德温·林克捣鼓出第一台像样的飞行模拟器,二战期间数十万盟军飞行员先在模拟舱里摔够了,才被允许登上真机。那会儿连晶体管都还没影儿,全靠机械装置硬模拟仪表反应。
到了自动驾驶时代,这套打法卷土重来:Waymo曾公开披露,它的系统在虚拟环境里跑出的测试里程,比真实路测高出两个数量级不止。
飞机靠模拟舱练出飞行员,汽车靠仿真路练出老司机,如今轮到AI,它要练手的对象是整个物理世界。
把历史看明白了,再看资本的动作就不难懂。
这两年涌进世界模型赛道的钱以百亿计,资本赌的早不是哪家的画面更漂亮,谁能用最低成本把真实世界搬进模型、让AI在里面反复试错,谁就站在下一代AI的上游。
而Altas的方向,有望让数据采集和仿真成本断崖式下降,使得初创公司无需依赖巨额硬件投资即可完成机器人训练,有望推动“仿真优先、真机验证”新范式普及。
AI要想真正理解物理世界,还为时尚早。
但Atlas至少证明,几何做对这件事,是个可以被工程化解决的,而且一旦做对,立刻能变成产品力。
世界模型的竞赛,正在从“谁生成的画面更像真的”,转向“谁生成的状态更经得起算”。
从渲染器到模拟器,这一步跨过去,AI才算真正摸到物理世界的门。
Atlas是把门推开了一条缝,物理AI,终于有了第一块踏脚石。
加载中,请稍侯......