观点

GLM-5.3发布,基座没变,能力却涨了

过去的几个月,国内外大模型厂商都迎来了新一轮的版本更新,4月,OpenAI发布GPT-5.5版本,并于近日将免费用户默认模型升级为GPT-5.6 Luna;7月中旬,月之暗面发布Kimi K3;8月初,DeepSeek V4 Pro正式上线;阿里Qwen3.8-Max以2.4万亿参数规模开放API访问......

8月3日,ZCode官网短暂上线了“ZCode for GLM-5.3”页面,官方说明文档也对外开放了大约一个小时。那次“意外泄露”让智谱股价当天涨超8%。一周后,高盛上调智谱收入预期35%。直到

8月14日,智谱AI也正式发布了新一代基座模型GLM-5.3。该模型总参数规模7430亿,在编程能力和复杂工程执行等核心人物上取得突破。

让人意外的是,GLM-5.3的技术路径——基座模型没变,但能力却提升了不少。智谱在官方公告中明确写道:“与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界。”

此外,GLM-5.3在白盒代码审查与漏洞推理等安全任务中的表现接近Mythos 5,在网络安全防御场景中的表现让人眼前一亮。

GLM-5.3到底要“升”什么?

要理解GLM-5.3的分量,得先看看GLM-5.2走到了哪一步。

6月13日,智谱开源了旗舰模型GLM-5.2。这款模型交出了一份相当漂亮的成绩单:混合专家(MoE)架构,总参数量约7530亿,上下文窗口达100万token。在国际人工智能独立评测机构Artificial Analysis的综合能力评测榜单上,GLM-5.2拿下51分,位列开源模型最佳水平。富瑞发布研报称,GLM-5.2在Artificial Analysis模型智能指数中排名全球第三,为中国模型首次打入前三位,在编程及智能体能力上分别排名全球第四及第二。

换句话说,GLM-5.2已经是国产开源模型里跑得最快的那一个。但大模型这行,没有“守成”一说,直白点说,你不跑,别人就会超过你。

与GLM-5.2相比,GLM-5.3基座模型并没有改变,但通过极致的后训练Scaling大幅提升了模型的智能上界,主要体现在了数十倍的长程任务环境、更丰富的环境类型,以及超长的后训练时间。

具体到能力层面,在编程能力方面,相比GLM-5.2,GLM-5.3体感评测提升50%,据智谱AI方面透露,GLM-5.3在包括Terminal Bench 3.0在内的公开基准测试中,在开源模型方面排名第一。其中,在Terminal Bench 3.0上,GLM-5.3的得分从4.6提升到28.3;在DeepSWE v1.1上,得分从46.2提升至66.9;在Agents' Last Exam 上,得分也从23.8提升至28.5。在GDPval-AA v2中,GLM-5.3得分1769,展现基于编程能力涌现的专业任务执行能力。

这些结果表明,GLM-5.3不只擅长做出一个好看的Demo,更能接住复杂的大目标,在数万行代码、上百个文件和多个相互依赖的系统之间持续推进。在极少人工干预的情况下,它也能长时自主开发、反复验证,最终把项目推进到可交付状态。

从GLM-5.2开始,智谱引入了effort level(思考档位)控制。在相近Token预算下,GLM-5.3在任务完成质量、执行速度和使用成本之间取得了更好的平衡。

安全能力值得期待

如果说编程能力的提升是GLM-5.3的基本操作,那么网络安全能力的涌现就是一条更值得关注的惊喜。

在网络安全能力方面,GLM-5.3在白盒代码审查与漏洞推理等安全任务中的表现接近Mythos 5,相信后续再网络安全防御实战场景中能发挥比较大的价值。

智谱在官方公告中坦承:“安全能力的出现并不偶然,安全工作本质上是约束严格的编程能力。”从2025年9月开始,智谱就在这个方向投入研究,与国内多家头部安全实验室一同推进更多长程任务环境,构建更专业化的评测与执行框架。

在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为83.5%,高于GLM-5.2的77.2%,与Mythos 5的83.8%和GPT-5.6 Sol的83.6%基本相当。

在更考验深度推理能力的ExploitBench中,模型需要进一步理解真实漏洞的成因并完成相应的利用。GLM-5.3得分为54.4%,是GLM-5.2(24.4%)的两倍多,但仍低于Mythos 5的78.0%和GPT-5.6 Sol的73.5%。

在ExploitGym中,模型在限定时间内完成漏洞利用任务的数量。GLM-5.3在两小时内完成105项任务,六小时内完成130项,而GLM-5.2分别只完成29项和39项。Mythos 5仍然领先,两个时间段分别完成181项和247项。

这三个基准呈现出一个清晰的趋势:越接近漏洞利用链的前端,GLM-5.3的提升越明显;越深入完整的漏洞利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。

换句话说,GLM-5.3在发现漏洞这个环节已经追上了全球顶尖水平,但在利用漏洞这个更深的环节还有不小的距离。这既是差距,也是方向。

之所以让笔者对GLM-5.3在网络安全的能力有所期待的是,智谱AI官方发布的真实案例。GLM-5.3联合国内安全团队发现2404个漏洞,其中1088个为中高危,最早可追溯至约40年前,部分漏洞存在于Android、Windows、macOS、APP等人们每天使用的软件中。

GLM未来猜想

GLM-5.3交出了一份漂亮的成绩单,但它面前仍然摆着三个必须回答的问题。

首当其冲的就是视觉。GLM-5.3的升级有一个容易被忽略的细节:它依然是一个纯文本模型。

此前,智谱首席科学家唐杰在社交平台上发起全球意见征集,为GLM-5.3收集功能建议,浏览量超过40万。评论区被一个词刷屏了:视觉。

开发者想要的,是能看懂截图、能解析表格、能从UI设计图直接生成代码的模型。而GLM-5.2虽然性能强劲,但偏偏没搭载视觉编码器,看不了图,也造不出图。

智谱并非没有视觉技术。这家公司此前发布过CogVLM视觉编码器和GLM-5V-Turbo原生多模态模型。但唐杰此前认为多模态对提升AGI智能帮助有限,主张分开发展。这一策略如今看来需要调整了—开发者的呼声和市场的竞争态势都在迫使智谱做出改变。

其次是深度漏洞利用的差距怎么追?ExploitBench上54.4%对Mythos 5的78.0%,ExploitGym上130项对247项,这两组数字清晰地划出了GLM-5.3与全球顶尖水平之间的距离。

GLM-5.3在漏洞发现(CyberGym)上已经追平了Mythos 5,但在漏洞利用(ExploitBench、ExploitGym)上仍有显著差距。智谱自己也承认:“越深入完整利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。”

这个差距意味着什么?在真实的网络安全攻防中,“发现漏洞”只是第一步,“验证漏洞”和“修复漏洞”同样关键。如果模型只能发现而不能验证,安全团队的工作量依然巨大。智谱需要在这条路上继续追赶。

最后,也是很多大模型公司都需要面对的,商业价值如何体现?智谱2025年全年总营收达7.24亿元。这个数字放在大模型赛道里不算小,但对比其市值(即便是经历了大幅回撤之后)依然显得不成比例。资本市场对大模型公司的估值,本质上是在为未来的可能性买单。但这种可能性需要被不断验证。

国内排名前十的互联网公司中有9家深度集成了GLM系列模型。这是一个不错的起点,但远非终点。在政企市场之外,智谱需要在更广阔的商业化场景中证明自己。

不过,外部环境正在向有利于智谱的方向变化。8月6日,DeepSeek发布公告计划近期整体上调API服务定价。业内人士认为,这一动作打破了此前大模型行业以低价竞争为主的格局。智谱年内已多次上调API价格,如果行业整体涨价成为趋势,智谱的定价策略将不再显得“突兀”。

高盛已经上调了智谱今年的收入预期35%。但高盛同时将智谱的目标价下调,评级维持“中性”。上调收入预期、下调目标价——这组看似矛盾的操作传递了一个清晰的信号:市场看好行业的增长空间,但对具体公司的竞争位置仍持观望态度。

两个月的迭代周期放在大模型时代是一个不算慢的节奏,GLM-5.3的发布证明了后训练Scaling的潜力(在不更换基座的前提下,靠极致的长程任务训练和更丰富的环境交互,照样能榨出大模型更多的智能空间)。这对行业来说是一个值得留意的信号:参数竞赛或许不是唯一的路,把现有模型的能力“挖透”同样能带来可观的回报。

(文|Leo张ToB杂谈,作者|张申宇,编辑丨杨林)

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
摩尔线程:国产GPU最接近"翻过雪山"的时刻
« 上一篇 08-14
下一篇 » 08-14

相关内容

GLM-5.3发布,基座没变,能力却涨了
摩尔线程:国产GPU最接近"翻过雪山"的时刻
西北首家希尔顿再更名,神秘业主仍未亮相
株洲搞风电,凭什么?