实测AI办公三强:豆包全能、WorkBuddy够稳、千问还得加把劲
文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠
9月以来,办公Agent又迎来一轮密集更新。
阿里的千问办公、腾讯的WorkBuddy和字节的豆包工作,三家又一次迎来正面对决。
豆包工作的更新频率最高。9月2日,它上线了多Agents并行和操作电脑功能;一周后,又补上本地Office编辑、浏览器录制与回放,以及本地与云电脑的自由切换。9月15日,豆包工作和飞书共同发布豆包工作伙伴,让Agent加入群聊,接收不同成员交来的任务。
另外两家也在加速。9月7日,千问办公推出多人工作台,用自然语言描述需求,就能生成一个最多支持百人同时在线协作的网页应用。此前,它宣布上线刚满一个月,用户数已经突破3000万。9月2日,WorkBuddy开放平台正式上线,首批集结超百家生态伙伴,支持接入智能眼镜、录音卡片、智能耳机等十几个品类的硬件,腾讯同步发布了9款联名硬件。
这一轮更新,有一个共同方向,办公Agent正在进入更多真实的工作场景。电脑里的文件、群聊里的讨论、随身设备记录的信息,都可能成为它理解任务的线索。
当功能越来越像,普通用户到底怎么选?
我们选了市场营销、内容运营、产品经理和开发四类工作,分别设置真实工作任务,交给千问办公、豆包工作和WorkBuddy完成,调用了它们自己最新的旗舰模型,三家的表现如下:
豆包工作整体领先,多模态能力较强,适合工作中图片、视频等创意呈现需求高的人群;
WorkBuddy的产品设计用起来顺手,尤其适合有轻度开发需求的人群;
千问办公中规中矩甚至可以说平平无奇,但基础的办公任务可以完成。
接下来,具体看看它们的表现。
01.市场营销:千问谨慎、WorkBuddy细致,豆包高效
市场营销是目前比较容易把AI接进工作流的职业之一。搜集信息、整理分析、做物料初稿,都已经可以交给Agent先跑一遍。
先让三个Agent做一份竞品分析,这个环节最怕信息不全,分析注水。三家Agent的性格,从接活开始就能感受到。
千问办公像细致的秘书,动手前会先确认交付格式和对标品牌的选择,问清楚后才开工。

千问办公思考过程
它交上来的网页信息量有点单薄,列了三家竞品的相关情况,但每个维度展开的内容比较少,对于整体行业的分析也比较少。

千问办公制作的竞品分析
WorkBuddy则是先把过程摊开给你看。它先交了一份调研过程资料,解释为什么选这三家作为对标对象,再展开分析。

WorkBuddy思考过程
成品也延续了这种细致。报告加了目录,先讲市场情况,再看竞品动态。它的分析维度最多,竞品信息展开得最充分,也简要归纳了各个品牌的特点。

WorkBuddy制作的竞品分析
到了市场机会部分,又列出5个切入方向,结尾附上数据来源和口径说明,方便核对。

WorkBuddy制作的竞品分析
豆包工作接到任务后,自己调用了刚上线的多Agents并行功能,让几个子Agent分头调研,再完成报告。

豆包工作思考过程
它最后交了网页版和飞书文档两个版本。内容大体相同,网页版用了更多表格,主次也更清楚。

豆包工作制作的竞品分析
除了分点介绍三个品牌,它对不同竞品的横向对比更出彩,用图表对比了各家关键数据。

豆包工作制作的竞品分析
它还用一条时间轴串起三家的动态,可以直观看到各家的动作。

豆包工作制作的竞品分析
竞品报告是“里子”,物料是“面子”。我们给了一份贝果新品的完整brief,要求产出主视觉海报、小红书封面图和15秒预热视频。
先说结论,在本次测试中,豆包工作主动调用了专门的视频生成模型和文生图模型,它的整体完成度最高。
尤其是视频。豆包工作设计了一条简单的情节线,把贝果的制作过程串了起来,镜头之间有推进,背景音乐和旁白也加上了,最像一支完整的新品预告。
图片的整体效果也过关,但主视觉里有一处文字挤在了一起。拿来做初稿可以,正式使用前还得处理这些细节。

豆包工作制作的海报,左主视觉/右小红书封面图
千问办公生成的两张图比较生硬,感觉是套用了设计软件最常见的模板。

千问办公制作的海报,左主视觉/右小红书封面图
但它的短板主要在视频。视频看上去是让主视觉动起来,并切换不同视角展示面包图,整体更像一张动态海报。
WorkBuddy先让无文字版海报动起来,再接上掰开贝果的特写,最后回到带抖动效果的主视觉,和千问办公的相比质量大差不差,胜在画面丰富。
它生成的海报则比较中规中矩,没有特别突出的地方。

WorkBuddy制作的海报,左主视觉/右小红书封面图
这一轮真正拉开差距的不是文字,而是交付形式。三个Agent都能做调研,但一旦任务继续往海报、短视频等环节走,豆包工作的多模态生成优势就更明显;如果主要任务停留在资料搜集和分析,WorkBuddy也值得考虑。
02.内容运营:WorkBuddy交卷快,豆包拆得细
内容运营的工作,一半在追热点,一半在琢磨选题。
我们先让三家整理近期的AI热点,再给出选题策划,看看谁搜来的信息最全、建议最好。
WorkBuddy反应最快,11分钟就交卷了。它的热点按模型、资本、政策等类别整理,基本覆盖了过去一周的重要动态,拿来快速补课比较方便。

WorkBuddy制作的热点汇总
可惜给出的5个选题有点泛,可操作性不强。

WorkBuddy制作的选题策划
千问办公直接在对话框里给出了回答,没有另外生成文档或网页。篇幅也比较短,热点分成三个方面,信息量不大。

千问办公制作的热点汇总
选题只是简单带过,能提供的参考有限。

千问办公制作的选题策划
这一轮,我们还用上了豆包工作新上线的操作浏览器功能。开放权限后,它自己打开浏览器搜集近期AI热点,查看了5个网页信息源,最后交来一张网页版热点矩阵图,以及一份完整的策划案。

豆包工作思考过程
两份成品各有用处。热点图用不同颜色区分赛道,并归纳出三条主线,适合先扫一眼,了解这一周各个方向发生了什么。

豆包工作制作的热点汇总图
策划案也按赛道展开,把具体热点做了详细总结。

豆包工作制作的热点汇总
它给出的5个选题也是三家里最详细的,覆盖了我们要求的内容,并且信息量比较足,内容最丰富。

豆包工作制作的选题策划
会追热点只是及格线。我们再让它们从机器之心、量子位等AI领域账号中抓取过去一周传播度最高的AI领域文章,分析选题类型、文章亮点和数据表现。
这道题的问题在于,三家都没办法拿到完整、可核验的公众号阅读、点赞和在看数据。怎么判断高传播,就看各家本事了。
WorkBuddy显示自己检索了118篇文章,并从中筛出15篇。它先说明公众号数据无法获取,再用跟进同一话题的头部媒体数量、站外扩散广度和事件延续天数,合成了一个传播指数。

我们要求的选题类型和文章亮点它都涵盖了,WorkBuddy还补充分析了四家媒体的选题偏好和做法差异,最后给出选题建议。

千问办公也先交代了判断方法,它结合跨平台转载数、首页推荐位、搜索热度和二次讨论,交叉判断传播情况。

它先选出传播度最高的10篇文章,又按账号分别列出前5篇展开分析。

整理了一周热点结论、洞察和建议,附上信息来源。相比第一轮,这次的回答完整了不少。

豆包工作交来的内容密度仍然最高。它先归纳5个核心热点,分析哪些选题更容易获得关注。

再从抓取到的135篇文章里筛出18篇,整理选题类型、账号偏好和本周观察。

它甚至还选了7篇来进一步拆解。

它还会把已查证的数据和估算内容分开标注,让人至少能知道哪些信息可以引用,哪些只能作为判断线索。
两轮下来,豆包工作的优势主要是交付更完整:从热点汇总、选题策划到样本拆解,几个步骤接得更顺。WorkBuddy在方法说明上更谨慎,千问办公第二道题的完整度也明显比第一道高。
03.产品经理:豆包原型更好看,WorkBuddy快且细
产品经理最日常的两件事,画原型和做复盘,我们各给了一道题,看看三家能把这两件事做到什么程度。
先让它们做一个奶茶点单小程序。
WorkBuddy最快,6分钟交卷。成品看上去很像小程序,配了模拟产品图,还自己加了热门榜单,方便用户挑选。单论功能丰富度,这轮它表现最好。

WorkBuddy制作的小程序
千问办公花了15分钟。功能齐全,但页面透着一股网页味,产品占位图不够统一,视觉呈现不够好。

千问办公制作的小程序
豆包工作用了20分钟,功能同样完整,交来的版本最接近我们印象中的奶茶小程序。主页banner会滑动切换,占位图选的都是同类饮品,塞进页面里毫不违和,审美是三家中最好的。

豆包工作制作的小程序
接着我们再让它们做一个数据看板,并写一份归因分析和改进建议。
在这一关,三家的数据看板覆盖的维度差不多,图表和交互都有,主要区别在视觉呈现,没有太大差距。能看出差异的主要是报告。
WorkBuddy写得最细。直接原因和根本原因分开讲,建议按优先级排序。

WorkBuddy制作的数据分析
WorkBuddy还主动交代了结论缺哪些数据验证、各项指标用的什么口径。

WorkBuddy制作的数据分析
豆包工作的整体分析结构和WorkBuddy很像。它的亮点在下月目标上,它把每个目标为什么定这个数讲得很细,还配套给了辅助监控指标和相应的总结分析。

豆包工作制作的数据分析
千问办公给出的成品比较简单,虽然也涵盖了我们的基本要求,但分析偏简洁,且给出下月目标后,没有进一步延伸。

千问办公制作的数据分析
产品经理这个职业,我们投WorkBuddy一票。但豆包工作的审美优势也比较大,如果单看设计产品图它更为契合。
04.前端开发:豆包完成度更高,WorkBuddy有巧思
压轴的是前端开发,是最难糊弄的职业。先来一个测试Agent能力的经典题,做一个骑自行车的鹈鹕SVG动画,看看三家能不能同时处理代码、动画和物体之间的空间关系。WorkBuddy想法不少。它给鹈鹕系了条红围巾,嘴里还衔了条小鱼,角色一下子就活了。可惜细节没兜住,围巾像直接贴在脸上,小鱼隔着长喙能被看穿。骑行动作倒是符合物理规律,就是鹈鹕本身像几块拼接起来的,不够自然。

WorkBuddy制作的鹈鹕动画豆包工作建模更自然,鹈鹕的形象在视觉上更美观,也没有明显的物理穿模,骑车的速度还分了悠闲、正常、飞驰三档。

豆包工作制作的鹈鹕动画千问办公这轮有点翻车。鹈鹕没握住车把,两只脚像踩在同侧踏板上,不符合物理规律。

千问办公制作的鹈鹕动画接下来,我们上一个更接近真实工作的需求,一个科技峰会报名网站。要能报名,能管票,管理后台带密码,还能导出名单。豆包工作的审美依旧在线,最像一个真实存在的报名网站。每种票的权益写得清清楚楚,排版是先看完活动信息再选票报名,要求基本全覆盖。

豆包工作搭建的网站WorkBuddy则是走赛博霓虹的蓝紫风格,基本的功能也都能正常使用。

WorkBuddy搭建的网站千问办公动用了多人工作台的新功能,它也采用了蓝紫配色,网页支持多人同时打开来报名,管理员在后台看名单做统计。

千问办公搭建的网站动图这一轮豆包工作取胜,WorkBuddy的整体表现也不错,但它稳定性不足,有巧思但落地不稳。
05.结语
过去几个月,一个明显变化是,大厂内部原本分散的办公Agent开始收拢。7月20日,腾讯将QClaw部分业务和团队调整到WorkBuddy所在的云产品六部;7月底,字节把飞书产品团队与豆包产品团队整合。到了8月,产品端也开始集中。8月3日,阿里推出由QoderWork、MuleRun、悟空整合而来的千问办公并开启公测;8月25日,字节发布豆包工作。此前跑在前面的WorkBuddy,则在7月iOS、Android和鸿蒙移动端三端同步上线。
这次测试也能看出这种变化。三家的基础功能已经越来越像:都能查资料、生成文档、分析数据、制作网页,也都在继续补连接器、Skills和电脑操作等能力。真正开始拉开差距的,是它们背后的工作环境。豆包工作的优势正在和飞书结合,企业里的群聊、文档、项目和组织关系,都可能成为Agent理解任务的上下文;WorkBuddy一边接入腾讯的IM、文档、邮箱、会议和知识库,一边把入口延伸到手机、眼镜和耳机;千问办公背后则是钉钉、阿里云和阿里的企业客户体系。所以办公Agent接下来比的,是谁能接触到更多真实工作的上下文,并且获得权限把任务真正做完。模型能力的领先可能几个月就被追平,但企业内部的数据、权限、业务系统和已经形成的工作流,没有那么容易复制。商业模式也随之变化。当写方案、做PPT、生成网页逐渐成为基础能力,真正更容易收费的部分,会变成企业席位、专业能力、私有数据和业务系统接入,以及由此带来的模型、云和第三方工具调用。这也在挤压通用办公Agent创业公司的空间。继续和大厂比入口、免费额度和功能更新,成本会越来越高;法律、金融、医药等需要专业数据和复杂流程的场景,则可能留下更多差异化空间。大厂把通用能力做得越便宜,创业公司的机会反而越需要往行业深处走。对腾讯、字节和阿里来说,再一次面临正面比拼,需要看谁能让自家的Agent接触更多的真实工作,完成过去必须跨软件、跨部门才能完成的任务。
加载中,请稍侯......