观点

下载了千问3.8之后,我发现网上都吹错了重点

 

文|蓝字计划,作者|Hayward

刚刚过去的一周,是让无数AI人夜不能寐的一周。

从8月13日的DeepSeek V4 Pro开始,再到后面的Gemini、智谱GLM 5.3和千问3.8 27B,每个大模型都很重磅,又偏偏挑在北京时间的凌晨时段发布,要出稿的媒体们,想睡都睡不了。

但在这一波新大模型热中,有一个大模型的热度始终贯穿整个8月:千问3.8系列

其实这一轮热度其实从8月初就开始了。千问先发布了旗舰模型千问3.8-Max,随后又把27B版本放上Hugging Face。模型开放两天,下载量便突破100万次,连续几天占着全球模型热榜第一。

 下载了千问3.8之后,我发现网上都吹错了重点

国外最大的本地大模型社区LocalLLaMA,很快被千问3.8系列的各种测试、部署和量化帖子淹没。重复话题实在太多,版主干脆专门开了一个集中讨论帖。

有人一本正经地发帖讨论,千问3.8的出现,是不是说明大模型的规模定律已经快走到头了;还有人看完测试结果,当场表示周一开盘就去买阿里股票

别以为反应激烈的只有网友,连一向对中国大模型不太对付的海外媒体,也有点陌生了。

比如,《连线》杂志把千问3.8放进了“中国开源AI正在挑战硅谷玩法”的报道里;欧洲新闻台认为,它已经开始追赶Claude一直对外宣传的复杂工作能力。就连X平台汇总相关讨论时,给出的标题也是“中国AI正在追上美国模型”。

虽然,在大模型社区,每次新模型发布,总少不了几句“改变游戏规则”,但这次热度只空前,讨论之热烈,好像还真不止来至于新模型发布的新鲜感。

特别是当我们亲自上手体验了整个千问3.8系列之后,才发现它真正牛的地方

写文章堪比Opus 4.6?

既然要体验千问3.8系列,那离不开的重头戏,自然是让无数国外友人震惊的千问3.8-Max

它是整个系列的旗舰,总参数达到2.4万亿,每次运行调用其中约950亿参数,最长可以处理100万token的内容。

至于老外为什么吹得这么猛,看着两个跑分其实就明白了。

Terminal-Bench 2.1考察模型能否独立操作命令行,完成安装软件、修改文件和运行程序等任务。千问3.8-Max的平均通过率为86.6%,距离GPT-5.6 Sol只差2.2个百分点。

IFBench考察模型能不能同时遵守多项要求。千问3.8-Max的提示词通过率达到82.8%,超过GPT-5.6 Sol的72.7%和Claude Fable 5的63.5%,在这一项直接完成反杀。

 下载了千问3.8之后,我发现网上都吹错了重点

一个证明它能办事,一个证明它听得懂人话。如今千问3.8-Max已经可以直接和最新的GPT、Claude同场较量,而且还有来有回。

而且这两个测试,对我们这些干编辑的来说也有价值,毕竟能乖乖根据提示词来生成内容,就是写出好内容的第一步。只不过相比跑分,其实我更关心它最后写出来的东西到底怎么样。

尤其是海外社区已经有人声称,千问3.8的写作能力可以接近Opus 4.6。后者一直是AI圈自媒体大神卡兹克心里写作最好的大模型。这个评价,可是连目前最牛的GPT和Claude都未曾拥有的。

所以,我准备了一道专门考验短文逻辑、段落组织和文风的题目,把它同时交给了千问3.8-Max和GPT-5.6 Sol。

 下载了千问3.8之后,我发现网上都吹错了重点

 下载了千问3.8之后,我发现网上都吹错了重点

|可以看到,同样一组材料交给两款模型,最后写出来的东西,风格确实很不一样。

GPT-5.6 Sol这一版,整体更像一篇已经搭好骨架的短文,铺垫、转折和前后承接都比较完整。

不过,GPT的老毛病同样存在。

像“问题也恰恰出在AI太认真了”“这让AI清理相册碰到了一个很典型的边界”,还是过于生硬了,文章的转折就显得很刻意,为了转折而转折。而且它还出现了个致命问题:

说好的500字,实际却生成了超过1000字,完全不听命令。

而千问3.8-Max的处理方式要简单粗暴不少。整个文章都跟着提示词的节奏来,反差转折?没有的。情感铺垫?没有的。甚至它还鼓捣出了个“金句”:

“按画质衡量都是差照片,按记忆衡量却都是绝版。”

但也正是少了技巧、技法,有些地方甚至像是想到哪写到哪,也因此少了几分过度整理的痕迹。

甚至像“那位差点失去父亲背影的用户,事先多半也不知道,最后一张会糊成这样。”这句,严格来说没有提供新的信息,按照大部分AI的标准来看,就是个废话。

不过,大部分人说话、写东西,就是会有一些废话出现。恰到好处的啰嗦,反而更有活人感。

而这点,在当前绝大部分的体验、评测中都没有提到,我甚至觉得那些狂吹的老外们,都没有吹到了重点上。

就在这个对比之前,我还试过让千问3.8 Max写过一段视频脚本的开头。它不仅独自构思了一个比较有意思的视频开头,而且还会自己营造“悬疑解谜”的画面,并藏住答案。

 下载了千问3.8之后,我发现网上都吹错了重点

|这显然要比GPT那种理工直男思维的线性叙事更有意思。

所以,至少从我自己的体验来看,只论写作,千问3.8-Max想要超过Opus 4.6还不现实。但它写出来的东西有时比GPT更像人,这一点确实出乎我的意料。

如果再迭代几个版本,把逻辑链和段落连接补上,它在日常写作里替代GPT,已经不是什么遥远的事。

不过,在这几天的体验中,其实比起千问3.8 Max的“活人感”,真正让我大受震撼的,是最近刚刚开放权重的千问3.8-27B。

顶级大模型,普通人也可以拥有了

千问3.8-Max确实很强,但它有2.4万亿参数。对普通人来说,这种体量基本只能在线使用。就算把权重下载回来,家里的电脑也跑不动。

千问3.8-27B就不一样了。

它只有270亿参数,能力比Max弱一些,但它最大的价值在于整个模型却可以下载回来,直接装进你家的电脑里。

而且它的性能可不弱。按照千问公布的成绩,千问3.8-27B在Terminal-Bench 2.1拿到73.0分,已经接近Claude Opus 4.6的78.2分。到了考验真实软件修复能力的SWE-bench Pro,它又拿到61.7分,超过Opus 4.6的53.4分。

也就是说,这款可以本地部署到你家里的模型,性能已经在部分测试中摸到了前代顶级闭源模型的边缘。

虽然并不是随便一台电脑都能装,但整体看来只要有一块一万元左右的显卡就能拥有这款旗舰级别的开源大模型,也难怪大家对这个版本的热情高得有点吓人。

就在当天,我也把千问3.8-27b下载到了电脑里。这是一个4-bit量化版本,模型文件占用大约16GB。我的电脑用的是一张16GB显存的RTX 4080,外加48GB内存。

 下载了千问3.8之后,我发现网上都吹错了重点

那装在本地的千问3.8 27B效果怎么样呢?实话说,有点超出我的预期。

关闭思考模式以后,千问3.8-27B的生成速度可以达到每秒26个token。屏幕上的字往外冒得比人阅读还快,一篇五百字左右的回答,通常不用等上一分钟。

 下载了千问3.8之后,我发现网上都吹错了重点

而且,在速度没问题的基础上,写出来的东西其实也可以。

我把同一道题同时交给了本地运行的千问3.8-27B、线上的千问3.8-Max和GPT-5.6 Sol。题目要求它们详细分析RTX 4080相比RTX 3080,在大模型本地推理上的优势,写五百字左右。

三家都用了一句翻案的话开头,先否定只看算力的思路,随后把重点转到显存容量。后面的论证也差不多,显存负责撑起主线,架构、带宽和功耗跟在后面补充,结尾再落到RTX 4080可以运行更大的模型。

 下载了千问3.8之后,我发现网上都吹错了重点

虽然结构类似,但风格却不一样。千问3.8-Max选择列清单,GPT-5.6 Sol写得更完整,本地27B则交付了一篇连续的短文。

只不过,其实从易读性来说,如果我想要的是一个“答案”,千问3.8 27B整出来的内容就足够清晰明了了,没有简单粗暴的参数堆叠,给出的答案也有理有据。

它还抓到了这道题最有价值的地方。其实RTX 4080最核心的优势是16GB的显存,它是目前高性能量化大模型能部署到本地的生命线,也是对比只有10GB显存的3080最核心的优势。

然而,正在我打算大夸特夸千问3.8 27B的时候,它又不可避免地翻车了。

它声称RTX 4080的显存带宽大约是1024GB/s,RTX 3080则是936GB/s,但实际上3.8-Max和GPT-5.6 Sol给出的参数:RTX 4080是716.8GB/s,RTX 3080 10GB版是760GB/s,才是对的。

部署在本地的千问3.8 27B,还是吃了没能联网搜索数据的亏。

这也说明了,除去了准确性之外,一个部署在本地的大模型,其实已经有了相当高的可用度。

而且它所组织的语言也还算流畅,特别是体现出了一种比较罕见的特质:回答技术问题时,知道什么该说详细点,什么可以一笔带过,哪怕对参数完全不懂,也能知道个高低好坏。

后续如果打算用它来修改文章、生成提示词,后者接入爱马仕等用来做一些简单的内容生成,已经足够了。

而且这个部署在本地的千问3.8 27B,甚至还支持多模态,你把一张图片丢给它,它还能帮你“看”这张图。

一个家用电脑里的27B,已经有资格和千问旗舰、GPT最新模型放在一起批改作业。哪怕最后输了一点,这件事本身也已经够离谱了。

好用,但也非毫无代价

可惜的是,随着使用的日益深入,我也有了更多的遗憾。

首先,前面提到千问3.8 27B每秒26个token的速度,有个重要前提:得关掉思考模式。

打开以后,速度会跌到每秒5个token左右。模型会先输出很长的思考过程,哪怕是一个很小的问题,也会先思考个一分钟再作答,很折磨人。

这甚至是整个千问3.8系列的弊病。海外社区里也有人吐槽,千问3.8-Max有时会在思考过程中反复绕圈,答案越写越长,和GPT那简单直接、真正的不绕圈子,形成了鲜明对比。

不过更多的遗憾,是来自电脑配置这件事上。

实际上,按照社区的反馈,千问3.8 27B最值得安装的版本,是NVFP4量化的版本。它同样把权重压到4位,NVIDIA还专门为这种格式做了硬件加速,尽量减少模型压缩后的能力损失。

可惜,我的RTX 4080属于上一代Ada架构,吃不到这项原生加速。想把NVFP4的优势用出来,至少要换到采用Blackwell架构的RTX 50系列。

但众所周知,当前的英伟达50系已经涨上天了。之前人厌狗嫌的RTX 5080 ,价格也涨到了12999元,已经比当年首发时的RTX 4090都要贵了,更不要说最适合部署NVFP4的显卡,RTX5090。

也就是说,最适合普通人用的,低成本又低成本的大模型实际上是离我们越来越近了;但又因为硬件涨价,又远离了普通人。

毫无疑问,千问3.8 Max值得吹上一番,3.8-27B更是值得留在硬盘里。只是这类好用开源模型的真正辉煌时刻,可能还是得看硬件价格什么时候肯放过普通人了。

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
英伟达、SK海力士:必须拿下CPO!
« 上一篇 08-21
超市货架上,摆满了三四年前的白酒
下一篇 » 08-21

相关内容

冰柜饮料洗牌,好自在领跑中式养生水,无糖茶成饮料市场新主流
亚朵集团二季度营收34.9亿元,零售收入同比增长63%
平台经济的“含实量”被严重低估了
天坑专业摘帽?DeepSeek开抢土木老哥