观点

小龙们绕过办公agent

文 | 字母榜

办公Agent成了巨头们的新角斗场。

但在这场热闹里,智谱、月之暗面、MiniMax等小龙们却相当冷静,没有搞出多大动静。

其实小龙们也做了——Kimi在6月发布了Kimi Work,智谱在3月发布了AutoClaw,DeepSeek则在8月开源了 DeepSeek Harness。

但很显然,这并不是什么“办公Agent”,只是个人桌面而已。

不是小龙们不想跟,办公Agent走的是企业采购,收入又高又稳定,尤其是准备IPO的阶段,有几单这样的合同,能让财报漂亮很多。

是小龙们跟不了,他们的基因和体量天然决定了小龙们不适合这条赛道,一旦强行踏入,不仅仅是亏本的问题,还可能耽误公司AGI主线。

01

巨头敢all in办公Agent,倒不是因为模型多强,相反,在这方面其实是小龙们领先的。

以Agent的基准测试为例,Kimi K3在SWE Marathon这项长程工程测试里拿了42分,比Claude Opus 4.8和GPT-5.6 Sol都高;BrowseComp长周期信息检索91.2%,全球第一;Terminal-Bench 88.3 分,OSWorld-Verified 84.8 分。

智谱8月14日发布的GLM-5.3更猛,Terminal-Bench 3.0从5.2的4.6分飙到28.3,DeepSWE v1.1从46.2涨到 66.9,接近Claude Fable 5的69.7;Agents' Last Exam从23.8提到28.5,超过Kimi K3的27.6和Opus 4.8的25.7—,并且三项Agent相关基准全部拿了开源第一。

所以巨头其实才是“弱势的一方”。

那么巨头赢在哪?赢在对客户组织架构的理解上。

巨头做的事,是把Agent放进了客户的组织关系里,这里面更多的是权限、审批、流程,而非小龙们擅长的数学、代码和推理。

如果说代码仓、文件这些材料是我们日常办公中的上下文,那么上述的这些事物,就是企业的上下文,而这才是巨头真正的护城河。

这些数据也只存在于钉钉、企业微信、飞书的服务器里,小龙们拿不到,也更没法用这些来训练模型。

巨头要做的,就是借助企业上下文,把Agent变成组织的“员工”,让它在一个现有的权限体系下替人干活。

甚至千问办公最近开源的个人工作上下文项目MyContext,也是从飞书、钉钉里的聊天、文档、会议记录中蒸馏“第二个你”。它想把组织里沉淀的工作痕迹,转化成Agent认识每个人的方式。

但数据方面只是,另一方面,在产品和技术层面,办公Agent之间比的是Runtime(运行时)。

大模型是大脑,但它没有手脚,也没有记忆。你跟它说“帮我整理一下上周的会议纪要,生成一份周报发给老板”,它能理解这句话的意思,可是它没办法执行这个指令。它是一个“只会想、不会做”的纯文本系统。

Runtime就是给这个大脑配上的身体和神经系统。它是一套程序框架,负责把模型的“想法”变成“行动”。模型说“我要读这个文件”,Runtime做的事,就是去打开这个文件然后阅读里面的内容。模型本身碰不到真实世界,Runtime是它和现实物理世界之间的唯一接口。

Agent要持续工作。模型先想下一步该干什么,Runtime去执行,执行完把结果反馈给模型,模型根据结果再想下一步,直到任务完成。这个循环就是Runtime的心脏。

我们常说的Harness,就是Runtime的上层。Harness负责管理怎么思考和调用,Runtime负责最终执行。

无论WorkBuddy也好、千问办公也好、豆包工作也好,它们的核心都是把长久以来积累的企业运行逻辑变成Runtime。

我们不妨拆分一下办公Agent这个词,模型决定的是“Agent”,Runtime决定的是“办公”。

巨头的Runtime是组织系统的延伸,小龙的Runtime是个人设备的延伸。

巨头的Runtime是生长在组织架构里的。千问办公的Runtime是钉钉的企业能力层;WorkBuddy的Runtime是CodeBuddy的Agent 栈,外面再套一层腾讯安全网关;豆包工作的Runtime干脆就是云电脑。

它们的Runtime的用户不是“你”,是“你的组织”,权限、审批、审计、数据全部围绕组织关系设计。

小龙的Runtime长在你身上。

Kimi Work的Runtime是Kimi Code这套本地执行内核,AutoClaw的 Runtime是通过OpenClaw接进飞书这类IM工作台。它们的Runtime默认的用户是“你”,围绕你的个人设备、个人浏览器等等。

或者也可以这么理解,小龙们的Runtime,是你的员工,巨头们的Runtime是企业的员工。这不是做得更窄,而是从另一头进攻。

显然,小龙们跟巨头们就不在一个出发点上,巨头们顺着Runtime,找到了办公Agent这条赛道,小龙们没办法强行挤进来。

02

易观数据显示,6月份国内17款主流桌面端 AI 原生办公智能体月度总访问量突破6000万次,而3月这个数字还只有2000万。仅仅过了三个月,就翻了两倍。

腾讯WorkBuddy以2097万次单月访问量登顶,超过第二、三名之和。信通院相关机构发布的《2026中国企业级 AI 智能体产业白皮书》表示,企业级AI智能体市场2025年212亿元,2026年预计增至449亿元,几乎翻倍,2029年有望突破3320亿元。Gartner的预测是,到2026年底,全球40%的企业应用将内置任务型AI智能体。

这才是巨头们迅速调整组织架构,集结力量做办公Agent的原因。

入口正在从“应用”迁移到“Agent”。一旦用户习惯了直接对Agent说话,不再打开办公软件,钉钉、飞书、企业微信十年积累的组织资产,就可能在一个产品周期内贬值。

巨头的办公Agent既是进攻,也是防守。

千问办公守的是钉钉的B端基本盘,WorkBuddy守住企业微信,豆包工作守住飞书。它们甚至愿意为入口烧钱,豆包工作登录就送30天订阅;千问办公公测免费,正式版才收钱;WorkBuddy使用Hy3免费送token。对巨头来说,办公Agent是生态战略的成本中心,是一份防止基本盘贬值的保险。

小龙们本身也没有类似的东西需要防守。

于是就有了一种说法:Kimi和智谱是独立模型公司,每条产品线都要自我造血,不能像巨头那样用补贴换市场。

这话对了一半。Kimi和智谱其实同样可能为入口补贴产品,只是它们能承受的时间和规模不如大厂。真正的差异,在于“时机”。

企业级办公Agent虽然客单价很高,可是要重运营、重定制,这里面要涉及ERP、CRM、OA、HR集成,权限要梳理,数据要私有化部署,合同要走信息安全、采购、合规的层层关卡。

大致流程是业务部门先提需求,IT部门做技术选型,然后拉着厂商做POC验证(少则两周多则一个月),验证通过后进入招投标流程,采购部门要比价、供应商准入,然后采购委员会审批。

法务部门要审合同条款、知识产权、数据责任划分,而信息安全部门要做渗透测试、等保评估、数据审查,合规部门要确认是否符合行业监管要求,最后还要分管副总裁甚至CEO签字。

一个大型客户的采购流程里,前后要接触十几到二十几个关键人,任何一个环节卡住,整个单子就停摆。

从接触客户到真正签单,动辄一个季度甚至半年,而且不同客户差异很大。

验收之后也不是一劳永逸了。企业客户买的不是软件,是服务。需要专属客户成功经理定期回访,需要7x24小时的技术支持响应,需要SLA保障,需要定期做安全巡检和版本升级,客户提的定制化需求还要持续迭代。

更麻烦的是,企业的组织架构和业务流程也是会变的。比如部门调整了、审批流改了,或者是新上了一套系统,那么对应的办公Agent配置就要跟着改,这些都需要厂商的人持续跟进。

一个大客户背后,往往要拴住一个2到5人的专属服务团队。

对尚未形成稳定现金流的小龙们来说,这显然有点难度。

03

在办公Agent这条赛道上,DeepSeek是个另类,从头到尾就没打算做一个完整的办公软件,官方对它的定义只有一句话,一切皆插件。

工具、文件、会话、沙箱、任务循环、甚至界面本身,全部做成了可替换的插件。

8月13日发布后,DSH的GitHub仓库在1小时内突破2万颗星,28小时破9.2万,9天超过18万,到了现在已经逼近20万。这是GitHub有史以来增长最快的开源项目。

社区随即涌现出超过1万个插件:桌面客户端、记忆系统、工作流工具、多模型切换器,光是将其从一个上手门槛极高的Web UI变成执行文件的deepseek-harness-desktop,就已经攒下1.3万颗星。

过去,Claude Code、Codex把Harness做成黑盒产品,而DeepSeek选择把Harness本身开源,等于把“造办公Agent的能力”发给了所有人。

于是,办公Agent大战里出现了一种全新的参与方式。DeepSeek只发工具,让所有人自己动手丰衣足食。你想让它理解图片,那就自己去GitHub插件市场里面下完了装进去,DSH只提供环境,不提供方法。

DeepSeek既不要应用,也不要入口,它要的是“标准”,让DSH成为办公Agent的公共底座,它只让开发者习惯用它的框架,习惯它的流程。

就像OpenClaw和Claude Code一样,所有的Agent产品,其产品逻辑都来自于这两款产品。

这么做的优势是,Agent和任务强相关,需要的就是需要,自己弄不了,还可以找社区。不需要的就是不需要,不像其他办公Agent,即使你可以一辈子用不上这个功能,但是它还是自带了。

这里只有一个问题,DSH所使用的叫做MIT协议,意味着谁都能拿来改。巨头和小龙们虽然都有对应的产品,但它们同样可以基于DSH做二次开发。

这点就和安卓很像,可它背后有谷歌的搜索和广告收入撑着,而DeepSeek背后只有API这一种收费方式。赌标准的前提是赌别人愿意长期留在你的体系里。

社区项目再繁荣,也很难转化成DeepSeek自己的收入,DeepSeek真正能收的只有通过DSH默认调用DeepSeek模型的API费用。

DSH的插件可以接任何模型,今天跑DeepSeek,明天就可能切到GLM、Kimi或者GPT,这个底层随时可能被架空。生态越开放,DeepSeek就越可能成为基础设施,却也越没办法独占产业链。

虽然说办公Agent这条赛道刚刚起步,但有一个方向是确定的,那就是未来的办公室,绝对会聚焦于某个办公Agent,不像现在一样,各种软件、数据、报表堆砌在桌面。

Agent成为新的入口,组织软件形态将会被重写。

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
信维通信“拐点”初现:扣非增长22%,新业务渐次起量 | 看财报
« 上一篇 08-28
Hugging Face 130亿美元探价:不缺钱的“卖身”悬疑与分发层中立悖论
下一篇 » 08-28

相关内容

扫地机双雄,出海续命
商场掀起板前潮,多品牌扎堆入局,餐饮消费逻辑正发生转变
时代落幕,彩电一哥康佳主动宣布退市
Hugging Face 130亿美元探价:不缺钱的“卖身”悬疑与分发层中立悖论