观点

千问说95%的办公任务标准模式就够了,实测结果有点微妙

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

作者|黄晓彬

原创首发|蓝字计划

卖大模型的,居然开始劝人别总用自家最好的模型了。

早些时间前,阿里旗下的AI办公工具千问办公上线了搭载Qwen3.8-Flash的标准模式,并随之给出了一个非常大胆的宣传方式:95%的日常办公任务,标准模式就能完成,只有少数复杂任务需要高级模式。

这就有点意思了。众所周知,旗舰大模型是模型公司们的脸面,无论是在宣传还是跑分里都是能力最强的。在实操中,除非是很赶时间,或者确实囊中羞涩,要不然Pro 模型肯定还是比 Flash 模型更有吸引力。

但现在千问却反过来告诉用户,大部分时候,用标准模式就够了。

如果真能做到,当然是好事。但“95%的日常任务”覆盖得这么广,总得拿一份实际工作,看看它说的“够用”到了什么程度。

所以,我们这次选择了一份看似简单,但操作起来实则挺复杂的工作:把9份券商研报整理成一份Word,再压成一页汇报PPT。

实际上,把券商研报交给AI 解读,难度确实比普通的文档、新闻、素材解读要麻烦得多。

不同机构会反复引用同一组财报数据,却可能给出不同的盈利预测和判断。AI得把散在正文、表格里的信息对起来,分清哪些只是重复,哪些确实存在分歧,还不能把不同年份、不同统计口径的数字简单粗暴地放到一起。

这次,我们把相同的材料和要求分别交给千问办公的标准和高级模式。看看千问拍胸口推荐的标准模式,究竟能不能把这份工作做好。

分析9份材料,用了10分钟

打开千问办公,任务入口和普通AI对话没有太大区别:文件从左下角的“+”号上传,具体要求直接写进输入框,下方则是模式选择按钮。

从我们测试时的界面看,“标准|Qwen3.8-Flash”已经处于选中状态。点开模式列表,它也被排在最上面,旁边还特意标上了“推荐”;下面才是擅长复杂任务的高级模式,以及Qwen3.8-Max等前沿模型。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

看来,“95%的日常办公任务都用标准模式”确实不只是一句宣传。既然千问打算“把饭喂到嘴边“,那就先照着它的推荐来。

我们通过左下角的“+”号,把9份券商研报全部传了进去,先让它分析这些研报都讲了什么,随后再按提示明确交付形式:把关键数据、各家机构的主要观点和分歧整理出来,生成一份Word文档。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

任务开始后,标准模式先读取了全部文件,并在执行过程中发现,其中两份研报虽然文件名不同,内容却完全一致。去掉这份重复材料,它最终确认,自己实际要处理的是8份独立研报

这其实是我专门为了千问设置的一个“坑”,看它会不会把不同文件名的同一份研报当成两份。从结果看来这种“小伎俩”的确难不倒千问。

我们接着看看千问的表现。在标准模式下,它没有按照文件顺序,把8份研报逐篇复述一遍,而是将分散在不同材料里的内容重新归类

阿里的经营表现放到一起,AI模型与产品进展单独展开,各家券商的共识和分歧也被集中整理,最后形成一份包含69个段落、两张表格的Word文档。整个过程用了10分24秒。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

从成品来看,这份Word已经有了相对完整的阅读主线。想了解阿里的AI云收入、利润变化,可以直接找到对应章节;想知道几家机构对后续表现怎么看,也不用再回到8份PDF里逐篇翻找。

其中,还有几个比较有意思,相对亮眼的特点值得一提。

在券商分歧部分,它把各家机构对未来利润的预测集中到了一起,并给出了918亿元至1284亿元的区间,同时提醒这些预测采用的口径并不完全相同。几家券商对阿里的整体方向基本看好,但在利润预测、即时零售的拖累程度,以及端侧业务能否形成新增量等问题上,判断并不一致。

这样的整理,其实已经足够让我快速看懂这批研报大致在讨论什么。不过,它仍然更像一份综合摘要。各家机构为什么得出不同判断、预测背后用了哪些假设,展开得相对有限。

如果后续准备引用具体数据或者观点,最好还是问清楚AI 这些材料出现在哪里,然后亲自回到对应研报里进一步核对。

Word整理完以后,我马不停蹄地提出第二项要求:把上面的内容做成一页能够直接汇报的PPT。

这一次,标准模式共花费了3分17秒。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

最终交出来的PPT采用蓝白配色,顶部用四个数字卡片摆出总营收、AI云与算力收入、集团经调整EBITA和MaaS等ARR,下面分别介绍AI模型与产品进展,以及券商的观点和分歧,底部还附上了资料来源。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

第一眼看过去,标题、数字和正文已经分出了层次,几块内容也被规整地放进了一页里。不过,再往下读,问题也比较明显:AI产品和券商观点部分塞了不少小字,放在电脑上都需要凑近了才能看到,要是真的放到会议室里投屏,那可能有些小字得用望远镜来看了

但无论如何,它确实完成了“一页PPT”的要求,只是在“取舍”上显得有点不够聪明。哪些信息应该被重点放大,哪些内容可以干脆删掉,还是需要用户自己在后续再手动调整一次。

至此,标准模式已经把读取PDF、整理Word、自检修复和制作PPT的整套流程完成了,交付成果给人的感觉是“能用,但还能更好”。

如果你是一个完美主义,或者输出完一点都不想手动调整的,或许对这个结果不会满意。那么,更加强大的高级模式,能实现真正的“交付即用”吗?

高级模式,能“交付即用”吗?

带着这个问题,我们把模式切换成“高级”,重新上传同一批研报,并给出完全相同的任务要求。

这一次,重复文件的这个坑自然也没能骗过它。高级模式同样发现,9份文件里有两份内容完全一致,最终按照8份独立研报进行分析。

不过,从这里开始,两种模式的处理方式逐渐拉开了差距。

标准模式更像是把散落的内容快速收拢起来,高级模式则先给这批材料建了一份“档案”。它在文档开头增加了一张研报清单,把券商名称、报告主题、发布日期和机构评级全部列了出来,哪份关注财报、哪份专门跟踪AI产品,非常清晰,一眼就能看清。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

完成清点以后,高级模式才开始进入正文。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

相比标准模式,高级模式交出的内容明显专业得多。标准模式主要告诉我,这批研报形成了哪些共识、又在哪些地方出现分歧;高级模式则继续深挖,把每家机构为什么得出不同判断,也尽可能放进了文档里。

比如同样讨论阿里未来的Non-GAAP净利润,华泰给出的预测最高,国信相对保守,两者相差接近400亿元。高级模式除了列出这个区间,还进一步指出,差异主要来自各家对AI实验室投入和云业务利润率的假设不同。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

这些提醒,恰好是标准模式相对薄弱的部分。标准模式能帮我快速看懂8份研报在讲什么,高级模式真的想一个高级分析师在上课:某些判断来自哪家机构,基于什么口径,引用时又要注意什么。

Word完成以后,我们继续让它把这些内容压成一页汇报PPT。

高级模式一共用了10分18秒,比标准模式多花了7分多钟。它没有直接把页面生成出来,而是在制作过程中加入了一轮排版检查。

从执行记录看,第一版PPT出现了几处问题:标题文本框与右侧说明框发生重叠,部分橙色文字放在白色背景上,对比度也不够明显。高级模式随后缩窄标题框、加深文字颜色,再把PPT导出成图片,重新检查页面有没有重叠和裁切。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

直接把PPT 导出成图片,看来高级模式的千问对自己的成品很有信心,一点用户自行修改的余地都不留。

那成品怎么样?

高级模式生成的PPT采用深蓝和橙色搭配,顶部同样放置了四个数字卡片,下面则被拆成业务全景、券商观点和AI产品矩阵三个区域,底部再用一条深色横栏放置核心结论。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

它和标准版的PPT 相比,内容确实详实了很多。

同一批材料、同样要求做成一页汇报,两种模式却替我选出了不同的重点。标准模式特意突出MaaS等ARR,更关注模型服务业务进展;高级模式则加入净利润和AI云利润,更强调阿里在加大AI投入以后,收入增长和利润承压之间的关系。

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

标准模式

 千问说95%的办公任务标准模式就够了,实测结果有点微妙

高级模式

除了券商观点和AI产品,高级模式还增加了云、电商与AI实验室的业务拆分,并在页面右上角标出财年口径和研报来源。

但是它依然出现了标准模式版本PPT 同样的问题。高级模式虽然解决了文字重叠和颜色对比度的问题,下面三个区域依然塞得比较满,部分内容投到大屏幕上,同样很难让人一眼抓住重点。

换句话说,多出来的7分钟,确实换来了更细的内容、更完整的口径提醒,以及一轮看得见的排版修复,但“更详细”和“更适合汇报”并不能直接画上等号。

高级模式离“交付即用”更近了一些,但也就一点而已。

95%场景可用,保真吗?

现在再回头看,千问宣传的“95%场景可用”,最关键的其实是“可用”这两个字,到底按什么标准来判断。

如果只看标准模式自己的表现,它的确算得上可用。9份研报能够全部读取,重复文件也成功找了出来;最后生成的Word有完整结构,主要数据、机构共识和分歧基本都在;PPT虽然小字不少,但好歹整体是能用的。

但看完高级模式以后,标准模式的成品好像又没那么“能用”了。

高级模式增加了研报清单,把机构观点、预测依据和数据口径交代得更清楚,还主动找出了研报里可能存在的笔误。原本觉得标准模式已经整理得挺完整,放到高级模式旁边,才会发现它省略了多少细节。

虽然这份“更好”,有不小的代价。

以制作同一页PPT为例,标准模式用了3分17秒,高级模式则用了10分18秒,耗时超过前者的三倍。而最终交付的产品,也还没有达到“交付即用”的级别。

这样看的话,如果平时大部分需求只是整理资料、提炼重点、生成初稿,标准模式的确够用;碰上正式汇报或者复杂材料,再切到高级模式也不迟。

说到底,标准模式负责把活干完,高级模式负责把活干得更像样。至于完全不用自己动手,千问暂时还没打算替你上班。

参考资料:

千问办公QwenWork:《首发!千问办公上线Qwen3.8-Flash,Agent迎来量大管饱时代》

第一财经:《千问办公划出Agent的新基准》

凤凰网财经:《阿里动真格,大模型新的“斩杀线”出现了》

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
《旅行青蛙》寄来的最后一张明信片
« 上一篇 09-14
下一篇 » 09-14

相关内容

千问说95%的办公任务标准模式就够了,实测结果有点微妙
《旅行青蛙》寄来的最后一张明信片
豆包手机选择了弹幕最多的打法
DeepSeek“推倒重来”