从Token到Action:北京走进物理AI时刻

7月24日上午,北京市委书记尹力围绕构建高精尖经济结构、聚力发展智能经济在朝阳区、海淀区进行调研,市委副书记、市长殷勇一同参与。这次调研选取了三家在AI领域极具代表性的企业,分别是月之暗面(Kimi)、千寻智能(Spirit AI)和360集团。三家企业的分工恰好彼此互补:月之暗面(Kimi)代表数字世界的通用智能,千寻智能代表物理世界的具身智能,360则代表了AI时代的安全基底。
大模型拼的是认知的高度,具身智能拼的是落地的深度,安全守住发展的底线 —— 三者共同撑起了北京智能经济的「铁三角」。
向上生长:从数字智能到物理智能
如果把人工智能比作一场攀登通用智能(AGI)的远征,那么行业已经悄然分出了两条关键的路径。
第一条路径由Kimi代表——在数字世界里继续上探认知边界。2026年7月17日发布的Kimi K3,以2.8万亿参数、100万token原生上下文窗口和全球首个开源3万亿级模型的身份,将月之暗面推到了全球大模型竞赛的最前沿。在Code Arena前端编程公开盲测中,K3以1679分登顶;在BrowseComp、Automation Bench、Terminal-Bench等任务评测中,其表现领先于同期对比模型。

Kimi解决的是数字世界里的理解、推理、编码和智能体任务。它让AI更会思考,让机器能够处理越来越长的上下文、理解越来越复杂的代码库、协调越来越多的子任务。这是“Token”的路线——在数字符号的世界里,不断逼近通用智能的认知上限。
第二条路径由千寻智能代表——让AI走进物理世界,也就是“Action”路线。和文本、代码不同,物理世界从来不是稳定的输入框。物体会移动,光线会变化,人会突然打断任务;机器人每做出一个动作,都会改变下一步要面对的环境。千寻的Spirit系列模型要解决的,正是机器人如何感知真实世界、规划连续动作,并在动态变化中持续完成任务。
2026年6月,千寻自研的Spirit v1.6在RoboArena评测中登顶。这个由加州大学伯克利分校、斯坦福大学及英伟达等联合发起的评测平台,被称为具身智能的“奥林匹克”和机器人领域的“Chatbot Arena”。而Spirit v1.6是首个在该榜单登顶的中国具身模型,排名力压英伟达的DreamZero和Physical Intelligence的Pi0.5。

从Kimi到千寻,并非是大模型与机器人的简单行业分类。Token 的进阶,是数字世界的智力登顶;Action 的突破,是物理世界的根系扎根。前者决定 AI 能想多远,后者决定 AI 能走多实。全球的AI产业也正沿着这两条主线同步推进,但两者的竞争态势已出现明显分野。
数字世界的大模型竞赛经过数年激烈角逐,头部格局日趋稳定——OpenAI、Anthropic以及中国的智谱、Kimi等已各自占据生态位,技术路线、商业模式和竞争边界逐渐清晰。而在物理智能领域的角逐是增量开荒,全球科技巨头与创业公司正将资源密集投向具身智能,形成一个更大的战略窗口。
向下扎根:千寻的勇气和底气
千寻智能成立于2024年,创始人韩峰涛曾任珞石机器人CTO,联合创始人高阳来自清华大学交叉信息研究院。两人分别掌握机器人本体与AI模型两条核心技术栈,使公司在创立之初即具备全栈研发能力。
从2026年2月到7月,千寻智能在半年内密集完成四轮超45亿元融资,估值从百亿快速突破200亿元,成为国内具身智能领域估值最高的公司之一。这次北京市领导的调研走访,也再一次夯实了千寻在国内具身赛道的领先地位,而它的底气来自相互咬合的技术与商业支点。
当家模型在半年内的两次夺冠——Spirit v1.5在RoboChallenge Table30真机评测中成为首个超越Pi0.5的中国模型,Spirit v1.6在RoboArena中击败英伟达和Physical Intelligence的旗舰模型——已经充分说明了其算法能力经过了不同平台的交叉验证,也意味着千寻的模型在多任务泛化、真实场景迁移和工业级落地层面已具备全球竞争力。
千寻采用的是VLA(视觉-语言-动作模型)与世界模型深度融合的架构,而非简单拼接视觉和动作模块。模型底层采用人类视频做预训练,数据源与世界模型相同,但训练目标是预测 motion TOKEN,而非像素值,这种方式避免了预测像素值计算量大、学习效果差的问题。这种架构让机器人能够“边感知、边决策、边调整”,在执行过程中实时感知环境变化并动态规划后续动作。
具身智能的真正门槛,从来不是单动作的精度,而是长程任务里的「目标记忆力」与动态环境里的「突发应变力」。在2026年世界人工智能大会(WAIC)上,千寻首次公开展示了搭载Spirit v1.6的Moz1机器人完成“客厅收纳”“整理餐厅”等长程复合任务。当接收到“整理餐厅”的单一自然语言指令后,Moz1自主拆解出多个子任务:抓取桌上的可乐,移动至冰箱,开门、放入、关门;随后转向餐桌,夹起脏碗送入洗碗机——整个过程无需人工分步提示,不依赖固定脚本。

抗干扰能力是另一个指标。在桌面整理演示中,面对目标位置被遮挡、执行物品被移走、整理结果被打乱等人为强干扰,Moz1能够实时调整、重新规划。这解决了长期以来机器人只能完成短链条、单技能动作,难以保持对长期目标和上下文的持续理解的痛点。Spirit v1.6不仅能执行动作,也具备了复杂任务层面的推理与规划能力。
技术评测之外,千寻智能在商业落地这方面也提供了具体且可验证的进展:
2025年12月,千寻机器人在宁德时代中州基地投入电池包插拔检测,验收11个月,已生产超1000块电池。这是具身智能首次真正进入电池产线干活。2026年5月,博世中国与千寻签约,计划在两年内联合进行数据采集与训练,打造工业机器人的“通用大脑”。京东则签下三年合约,将Moz1引入京东MALL门店。这些真实案例都指向一个事实,千寻的产品已经跨过了从“演示”到“干活”的关键门槛。
具身智能的竞争,最终是数据闭环的竞争—— 谁能更低成本、更高密度地拿到真实世界的交互数据,谁就能跑得更快。千寻自研了可穿戴数采设备,并建立了自己的数据基础设施,打通完整数据管线。
在数据策略上,千寻智能构建了一套独特的“数据金字塔”:底层以海量互联网视频进行预训练,让模型在较低算力消耗下建立广泛的行为认知;第二层通过自研uDAS可穿戴数采设备,在全国100多个城市部署超1500名采集人员深入真实场景,采集大量包含失败案例与环境干扰的“脏数据”,单条成本降至传统方式的1/10;第三层以真机遥操作补充高精度动作数据用于模型微调;顶层则将Moz1等部署至宁德时代、京东等真实场景进行验证,运行数据回流持续优化模型,形成自我强化的数据飞轮。这一体系支撑千寻智能计划在2026年积累突破100万小时真实世界交互数据,其核心原则正如团队所强调的:“完美数据教不出能干活的人形机器人。”

模型、硬件、数据、场景四个环节的打通,使千寻具备了自我强化的闭环能力:真实场景产生数据,数据训练模型,模型驱动机器人进入更多场景。这就是千寻能够代表物理智能、与Kimi并列的原因。
补上关键拼图:北京的AI版图正悄然改变
从互联网时代的百度、搜狐,到移动互联网时代的小米、字节跳动,北京长期处于中国科技创新的前沿高地。进入AI时代,这一历史延续性并未中断,但叙事重心正在发生一次重要迁移。
过去,北京AI的公共叙事更多集中在大模型、互联网和数字智能。北京拥有全国最多的备案大模型产品,AI核心产业规模达4500亿元,相关企业超2500家,在全球人工智能最具创新力城市中排名第二。智源研究院孵化了约20家AI创业公司,月之暗面、智谱AI、面壁智能等企业估值纷纷突破百亿。这是北京在“数字智能”领域的深厚积累。
而现在,Physical AI这块拼图正在被强势补上。千寻智能等一众具身企业的崛起,以及同期印发的《北京市关于加快智能体引领发展的若干措施》,都释放了一个明确信号:北京AI的战略视野已经从“训练更强的模型”扩展到“让模型进入物理世界、创造真实生产力”。
与硅谷、波士顿、苏黎世、慕尼黑、东京和首尔所代表的单点突破路径不同,北京更像是在搭建一套系统:用高校和实验室提供源头创新,用模型公司提升认知能力,用机器人和制造体系承载行动能力,再用工厂、门店、物流等真实场景反哺迭代。仅海淀区就已集聚2000余家人工智能企业和330余家具身智能企业,仿真数据、整机制造、世界模型等基础设施被逐一立起,基本形成了人工智能产业链的全栈部署。
当Kimi在数字世界里处理代码、文档和知识工作时,千寻的机器人已进入工业产线和商业门店,在真实场景中完成检测、分拣与操作。Kimi提升脑力劳动效率,千寻填补体力劳动缺口。两者共同勾勒出北京人工智能从数字空间走向物理世界的版图。
尹力在调研时指出,智能经济是以人工智能为关键驱动力,以数据、算力、算法为基本要素的新型经济形态。要推动人工智能技术优势转化为经济发展效能。而这里的核心是“转化”——技术本身不是终点,技术转化为生产力才是。
Kimi和千寻分别代表了“转化”的两个方向。Kimi将大模型能力转化为软件开发、知识工作和智能体协作的效率提升;千寻则将具身智能能力转化为工业检测、商业服务等场景的实际产出。两者都在回答同一个问题:如何把AI创新优势,变成实实在在的经济效能。
从互联网到移动互联网,再到智能经济,北京一直在孕育具有全球影响力的科技企业。而现在,这座城市正在形成一个从数字世界到物理世界、从能力展示到产业落地的系统闭环。
Kimi代表北京AI在数字世界继续上探,千寻则代表AI进入物理世界、创造真实生产力的新路径。Kimi之后,北京AI的下一个关键时刻,正在从Token走向Action。(本文首发于钛媒体APP)
加载中,请稍侯......