创·问|Aibee爱笔智能林元庆:“结硬寨,打呆战”,通向物理世界AGI

理解复杂世界这事儿,AI和人类一样,都没有捷径。
人类靠肉身碰撞,凭经验拼凑世界的全貌;而 AI 知晓宇宙万物,却无法理解物理世界的时空运转。同样没有捷径的,还有Aibee爱笔智能创始人兼CEO 林元庆选择的创业道路。
硅谷NEC实验室科学家、百度研究院院长、明星创业者,林元庆本可以把AI 带向更热门的赛道,但他偏偏选择了AI赋能线下的实体传统行业。
过去九年,林元庆一直在让 AI 学会感知、理解现实世界。直到空间智能、世界模型成为新的行业共识,外界才重新认识爱笔——那些在物理世界积累的场景和数据,正成为未来 AI 理解真实世界的重要基础。
在林元庆看来,AI 不能永远只是“坐在玻璃房里的大师”,它需要进入真实世界才能发挥最大价值。为此,林元庆绘制了一张AI 能看得懂、走得通的地图,也在这张地图上,找到了自己那座“金山”。
全文分享如下:
Q:华创资本
A:Aibee爱笔智能创始人兼CEO 林元庆博士
坐在“金山”上
华创资本:过去几年大家的焦点都在大模型,今年世界模型、物理 AI 突然成了新共识,被视作 AI 的下一波技术浪潮。你们怎么做到风口来之前,就已经站在了这里?
林元庆:前两年大语言模型很火,我们也没想过跳上那条船,因为知道水一定会往这边流。
归根结底,AI的发展脉络就是这五个AI应用领域:自然语言处理(NLP)、语音识别、计算机视觉、机器人学(robotics)和大数据分析。 技术的演进有快慢,行业也有螺旋上升。
2017年爱笔成立时,我们就在做“线下空间的数字化和智能化”,那时名字起太长了,但和今天“空间智能”本质是一个概念,即对物理空间的3D理解。
行业总有新概念,但我们做的事没变——让AI 进入线下物理空间。
华创资本:AI 从虚拟到现实,要跨过什么样的鸿沟?
林元庆:机器人得有一双人类那样的“眼睛”:能识别周围有什么物体,它们在什么位置,是怎么移动的,要对空间和时间都有感知、理解。
过去几年,我们在线下的场景中进行了大量的三维重建,无论是商场里的顾客、店铺、商品,还是路口的行人、车辆,都能被标注出精确的3D坐标。这些数据既能让商家提升运营效率,进而提升业绩,也能降低城市交通拥堵,最终实现AI赋能现实物理世界的运营。
华创资本:为什么这些能力在今天突然变得重要了?
林元庆:过去在语言阶段,AI 可以依托公用数据进行训练。但物理世界的AI,需要大量真实的场景,而场景即数据。我们现在每天要处理的视频数据超过了100万小时。这是什么概念? 国内抖音、快手、腾讯视频三大平台合起来,一天新上载量才 27 万小时,而YouTube 是 72 万。
而且爱笔这些结构化的数据都来自固定真实的场景,是未来训练物理世界AI 的稀缺资源。所以,我们一直坚信,爱笔其实就坐在“金山”上——拥有海量的线下场景以及物理空间的数据。
从经验到数据
华创资本:2017年,你带着 AI 和互联网的基因创业,为什么一开始反而选择做线下生意?
林元庆:有的科学家喜欢提出新问题,有的注重解决问题。
技术能不能落地,一直都是我的兴趣所在。我那时候在百度研究院任院长,看到 AI 对互联网的赋能已经渗透到互联网业务的方方面面,但往线下一看, AI 还几乎不存在。
创业前,我拜访了九个传统行业近40家公司,认识到,AI技术的发展绝对不能脱离应用,脱离实体传统行业。
我们给公司起名Aibee,即 AI To B,就是想让AI 走出实验室,走出互联网,在现实世界的各行各业也能有用武之地。
华创资本:爱笔最早选择从购物中心起步,你们用AI 做了哪些改造?
林元庆 :爱笔在购物中心的场景有“五件套”:AI 精准客流、AI 停车、AI导航( AR/VR 导航)、AI 大屏、ToC AI 智能体。
今年龙虾出来后,我们又研发了大数据分析的智能体:如运营智能体、招商智能体和营销智能体。计算机视觉的AI技术负责收集物理世界的全面数据,而语言大模型的AI技术负责分析这些数据,并产出业务建议。
这些技术都是爱笔自研的(除了LLM基础大模型用的是开源大模型),在购物中心这样一个大体量的物理空间,我们提供的是一站式AI整体解决方案 。
从对购物中心的业务赋能来看,爱笔的AI解决方案已经覆盖购物中心日常业务的全流程,包括招商、营运和营销,既赋能购物中心自身,又赋能品牌商户,还赋能C端顾客和购物中心的交互方式;从AI技术的应用上看,深度应用了计算机视觉(CV)、语音识别(ASR)、语言大模型(LLM)、大数据分析(big data analysis)和机器人学(robotics) -- 这些“AI神主牌”在购物中心这个场景里做到了“众神归位”、各尽其职。
我还没见过哪家AI创业公司能做到这样综合性的AI协奏能力,让 AI可以在数字世界和物理世界畅游。
华创资本:过去商户在做选品、换人等大的决策时往往凭借经验而不是数据,你们怎么打破这一点的?
林元庆:核心是我们逐步开始用客户的语言和她们沟通,并且我们的技术可带来实实在在的业务赋能。
以AI精准客流为例,我们的客流数据分析像照 X 光一样,能识别出一个购物中心的各个品牌店铺有哪些运营薄弱环节。比如爱笔曾花了三个多月帮一家珠宝门店提升业绩。店铺门口路过多少人?其中有多少会被吸引进店?多少人能逛够8分钟达到长停留?那些长停留的顾客中有多少人会下单?数据往往能显示出问题。于是,通过产品设计年轻化以及提升店员接待能力,这家珠宝店的业绩提升了146%,交给购物中心的抽成租金翻了约5倍。
听上去似乎很复杂,但我们用的无非是互联网那套已经很成熟的漏斗分析:UV、 PV、 转化率。互联网产品经理天天都在做的事,但线下购物中心没人干过,因为之前线下不具备这样的per-ID的数据,但爱笔的AI精准客流弥补了这一点,彻底enable了这样的漏斗分析。
华创资本:这两年大家都在唱衰购物中心和商业地产,为什么你们还能保持增长?
林元庆 :其实很多购物中心的生意依旧如火如荼,很反直觉吧?一些头部的商场每年依然能卖100亿的货,他们每年的销售额还在增长。
我们看到的反而是积极的变化:
第一,商业地产过去收取固定租金,但疫情后改成保底租金+抽成。商户业绩越高,购物中心提成更多,自然有动力、意愿去提升运营水平。
第二,行业在向头部聚集,比如华润开始做轻资产运营,未来五年他们还计划再开一百多家购物中心,其中大部分会采取轻资产运营的方式重新装修、招商。当管理半径扩大,怎么可以让管理团队不用等比例扩大,AI技术就是武器。
第三,热钱消失,决策就会回归本质:你的产品最终能否为行业创造价值。购物中心并不会消失,往往行业处于低谷时,大家才更有动力提升效率,技术赋能也显得特别有意义。
全世界只有爱笔能做到
华创资本:很多人都在用AI 改造传统行业,为什么你们走通了这条路径?
林元庆 :很根本一点,可能我是一个特别不功利的人,很多合作伙伴常常这么评价我。
在大战略想清楚想透彻之后,我一直是“结硬寨,打呆战”的风格。在具体的实现路径上,我们对底层技术做足够的抽象,以及由此而实现极致的产品化。比如在购物中心,通过机器人3D 扫描建模,让 AI 透过摄像头去“看懂”空间里的人、物体是如何移动的。做停机坪也是如此,飞机什么时候停下来?停哪个方向?地面哪辆车接驳?这些都能转化成三维空间的理解。
当做好空间智能的中间层,无论上面是什么应用,通过建三维模型,就可以掌握全链信息。无论物还是人,AI 都能理解他们的状态和交互。当复杂技术转换成足够标准的产品,不管是跨行业还是跨品牌,都可以迁移。
比如我们覆盖的四大场景:购物中心、品牌连锁门店、机场和枢纽、双智城市,底层都是同一套技术,华润购物中心能落地的,小米品牌门店也能复制,机场也是如此。
华创资本:想让 AI 真正“看懂”线下空间,最难做到的是什么?
林元庆:像自动驾驶只需要关注道路这个相对标准化的场景,就已经需要海量的资金投入,如今发展十几年,还没有很好地实现L5、全无人驾驶等技术。而购物中心、机场等场景更复杂,如何更全面的3D理解这些空间,实际上难度不小。比如机场有人、车、行李、飞机等,通常意味着十万级别的物体分布在大几十万平米的空间里,需要一套系统很好地去实时理解所有物体的空间位置等信息。这需要一套超大规模的超强AI分析能力。而自动驾驶,通常只需要理解周边最多20~30个物体。
因此,如何在时空上统一指挥这样一套大规模空间智能系统,实现对每一个物体的精准3D理解,特别难。不夸张的说,这些技术全世界现在只有爱笔能做到。
此外,同样关键的还有成本问题,如果太昂贵,技术很难商业化。
华创资本:技术的壁垒足以构成护城河吗?
林元庆:爱笔的这一套空间智能技术,壁垒很高。
除了算法本身的壁垒,还有算法工程化。能不能鲁棒地实现高精度?能不能把成本压下来?以及最终能否真的落地?比如一个10 万平的购物中心做三维建模,通常成本大约在 300 万~500 万,而我们可以做到10万元以下。这还不算是最夸张的,我们曾给北京海淀区做全区的道路3D 扫描,很多公司的报价高达2~3亿,你猜我们多少钱做的?800 万。
华创资本:你们怎么能把成本控制到这么低?
林元庆:我们通过不断提升AI技术去优化成本。最大的优化,往往不是来自某一个单一模块,而是把这些AI系统当作整体,需要对各项AI技术庖丁解牛。
不单单是3D建模,我们在3D感知技术的优化方面更极致。比如爱笔做的第一家北京的购物中心,2018年把3D感知系统搭起来时需要用 150 台 8 卡的GPU 服务器,因为视频数据量太大,仅仅一天的数据就需要10天做计算。八九个月后,我们减到12台GPU,一天的数据在一天内算完,提升了差不多 100 倍的计算效率。
之后,我们把 90% 以上的计算放进摄像头,用AI 芯片去算,一下降到了 1 台 GPU 服务器。今天,我们连那一台也没了,所有相关的计算都可以放在摄像头端。最早一台GPU 价格15万,150台的成本就需要两千多万元,还需要乘以10天的计算。但我们现在做到了万元级别且能在0.5天算完。这个过程中要对算法、算力不断优化。
DeepSeek 出来时大家知道了蒸馏,但爱笔从2018、19年就开始用蒸馏、量化、剪枝这些技术,疯狂地把成本降了下来。
华创资本:这套能力还能让 AI 解决哪些现实中的问题?
林元庆:爱笔的这套空间智能技术实际上和大模型一样,已经非常通用。无论落地的是店铺、购物中心、机场这样的室内空间,还是户外场景的双智城市,效果都非常好。
我们在北京联想东桥做过约6个月的AI红绿灯交通优化,让早晚高峰的拥堵系数下降了约一半,既节约了驾驶者的时间,也更节能。过去改善拥堵时,很多参照来自互联网地图数据,只能算车流、速度,同时定位和数据的误差有时还很大。
而爱笔能在路口这个三维空间算出每一个机动车、非机动车和行人都在哪,它的速度、朝向,相当于做了实时完整的数字孪生,这套既完整又精准的数据对实时控制红绿灯非常有效。我们发现同样的算力水平,爱笔计算出来的数据维度和丰富度是竞争对手的上千倍——这得益于我们之前算法效率的提高。
同样的路口,没有物理扩建,但全天车辆通过的数量同比提升了 14% 左右。而且,爱笔的这套技术不用雷达也能实现3D感知,利用现有的摄像头即可,落地成本只是其他公司同类方案的10%甚至更低。因此,相当于只花了一辆自行车的钱,可以买一辆汽车。此外,我们的技术还能应用到发电场站、大型展会、化工厂、景区、养老社区等广阔的线下空间,这些我们今年通过行业合作伙伴都在落地。
价值是最直接的验证
华创资本:这两年行业玩家那么多,为什么最终很多公司都没有活下来?
林元庆:技术创业公司活下来很不容易。以购物中心的AI赋能为例,我们自己经历了三个阶段的市场洗牌。疫情前,百花齐放,既有明星 AI 创业公司,还有腾讯、阿里这样的大厂,那时候智慧零售、新零售引起的讨论很多。
接着是疫情时期,大家意识到就算投入巨大,技术也不一定能做得出来,尤其计算机视觉、大数据分析等能力,都需要配备强大的技术团队。做不好就无法深度赋能业务,何谈价值?再加上这期间,线下零售的日子艰难,非常多公司都撤了。
到了第三阶段,市场上几乎看不到AI 公司了,除了爱笔只剩一些做了十几年的传统公司。他们的技术远远不及爱笔,但因为做得久,之前积累了很多客户。但从2025年开始,很多公司的业务下滑,我们的业绩增长反而一直在加速。
今年上半年,爱笔AI赋能购物中心的业务增长了约200%,说明整个行业在加速采纳我们的AI整体解决方案。
华创资本:你们的技术在哪些行业已经建立了优势?
林元庆:国内头部的购物中心,目前都在采用爱笔的智能化方案,且行业内没有第二家可以做同样的事情。我相信再过3~5年,爱笔的AI Mall整体解决方案,会成为行业的标配。
其他场景下我们也建立了绝对优势:全国接近一半的新能源汽车门店,采用的都是爱笔的 AI 精准客流方案;全国 TOP 20 客流量的机场如首都机场、大兴机场等,有16家在和我们深度合作;城市治理、智慧交通层面,我们已经在北京海淀、通州进行过验证,极大改善了交通拥堵等问题。
技术、成本优势,都让我们处于行业绝对的优势地位。
华创资本:这些客户最终买单的是什么?
林元庆:他们其实不太关心你背后用了什么技术,甚至数据维度也不是最关心的。
B 端本身离钱近、离效益近,你的技术能不能和业务真正绑定,扎实赋能业务,价值才是最直接的验证。市面上很多公司的模式都是合同签了、落地了、验收了、收款了、结束了。
但爱笔不是这样。收款了,我们和客户的合作才刚刚开始。对我们来说,终极目标是通过AI 赋能为客户创造业务价值,否则再厉害的技术也没有实际意义。
华创资本:爱笔这两年也在出海,海外客户买单的逻辑有何不同?
林元庆:去年我们和中东阿曼首都的马斯喀特机场达成了合作,覆盖了航站楼、停机坪,以及周边的停车场、道路,这个项目已经成为爱笔在海外的标杆项目之一。要知道,过去中国的 AI 技术很难在中东机场落地,出于对安全稳定等因素的考量,中东机场的信息化系统大部分都是欧美公司来做。但爱笔的AI技术大大超出了他们的预期。此外,香港中环有个综合体项目,未来会是香港的新地标,这个项目的购物中心、办公楼、酒店、剧院等全套空间智能方案,都由爱笔独家提供。我们出海不过一年,但增长迅速,今年签单预计会有接近 10 倍的增长。
世界模型的一部分
华创资本:你认为爱笔现在积累的能力,和具身智能之间是什么关系?
林元庆:首先,我们拥有物理世界海量的数据,可以训练模型,让 AI 更好地感知现实世界,在具身智能的“智能”环节,我们可以输出自己的能力。
第二,具身智能将来一定会落到购物中心、机场、交通枢纽等各种物理世界的场景中,爱笔可以是非常好的合作伙伴,提供环境智能的能力。
比如我们现在做的AI 停车,除了能导航、找车之外,我们把 L4 级自动驾驶技术AVP (自主代客泊车系统,可以自动召唤、泊车、避让行人等)所需要的场端智能也已经预置其中。当未来车端足够智能时,我们只需要升级场端智能的算法,就能实现场端和车端的协同,进而为AVP实现1~2量级的安全级别的提高。届时,商场的停车场、各个新能源汽车品牌,都可以直接接入我们的系统,这样就形成“飞轮效应”。
此外,我们还可以帮商场管理&赋能各种送货机器人、扫地机器人等,有很多可以延展的空间。
华创资本:你提到爱笔未来会成为世界模型的一部分,在Physical AI真正到来之前,你认为下一阶段最重要的目标是什么?
林元庆:By the end of the day,we are a tech company. 我们想在技术上干件大事,否则就辜负了AI这一历史大趋势。这件大事,就是和语言大模型(ChatGPT)历史地位并列的视觉基础大模型——LVM-rtdsp(分别指 realtime、 depth (3D)、semantic、 pixel-level)。
我们希望这个视觉基础大模型,能让摄像头像人的眼睛那样理解真实世界——既能实时感知,也能理解三维空间、语义和每一个像素级细节。
华创资本:为什么你认为视觉基础大模型,会成为和语言大模型同样重要的基础能力?
林元庆:今天大家讨论Physical AI,大多关注VLA或者JEPA,把视觉、语言和行动放进同一个学习框架。但更底层、更通用的其实是视觉能力,而很多视觉感知任务,并不需要action。
比如一个机器人理解屋里有什么家具、大人小孩在做什么时,就不需要有action。哪怕需要action的场景如自动驾驶,当有了通用的视觉大模型,能像人一样理解周边的环境,有智能涌现,那自动驾驶的训练就会简单得多。就好比一个18岁的小伙学开车,并不需要海量的数据,只需要训练大约1万公里就足够了。
今天特斯拉积累的数据已经是百亿公里级别,就算一个人一天开500公里,完成这些公里数也需要大约5万年的时间。而尽管拥有了如此海量的数据,FSD却还没有实现全无人驾驶。
所以,一个通用的视觉大模型,是可以让VLA的效率提升万倍以上的。
华创资本:如果视觉基础大模型真的会成为下一阶段的重要方向,在你看来为何爱笔有机会?
林元庆:不同于“AI四小龙”偏2D的识别,我们从创立之初,就在做3D空间的理解,只是我们做的是特定物体如人、车、飞机等。而视觉基础大模型是对爱笔现有的空间智能技术一个非常natural的扩展,从理解特定物体扩展到理解所有物体。
如今,爱笔每天要处理超过100万小时的真实视频数据,长期积累的场景和数据,是训练视觉基础模型最重要的基础。视觉大模型训练的核心灵魂之一是“自标注&自学习”,而爱笔的“静止摄像头+预3D建模”非常适配这一学习框架,它实现自学习的难度比具身智能上移动的摄像头低了好几个数量级。
因此,我预测,当视觉基础大模型的AGI到来时,爱笔的这套基于第三视觉的学习框架,要比具身智能的第一视觉的框架早到达至少2~3年。
在AI时代,2~3年就是巨大的优势。当物理世界的AGI特别是视觉AGI到来时,爱笔将是少数站在终点的公司之一。
加载中,请稍侯......