GLM-5.3发布,基座没变,能力却涨了
过去的几个月,国内外大模型厂商都迎来了新一轮的版本更新,4月,OpenAI发布GPT-5.5版本,并于近日将免费用户默认模型升级为GPT-5.6 Luna;7月中旬,月之暗面发布Kimi K3;8月初,DeepSeek V4 Pro正式上线;阿里Qwen3.8-Max以2.4万亿参数规模开放API访问......
8月3日,ZCode官网短暂上线了“ZCode for GLM-5.3”页面,官方说明文档也对外开放了大约一个小时。那次“意外泄露”让智谱股价当天涨超8%。一周后,高盛上调智谱收入预期35%。直到
8月14日,智谱AI也正式发布了新一代基座模型GLM-5.3。该模型总参数规模7430亿,在编程能力和复杂工程执行等核心人物上取得突破。
让人意外的是,GLM-5.3的技术路径——基座模型没变,但能力却提升了不少。智谱在官方公告中明确写道:“与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界。”
此外,GLM-5.3在白盒代码审查与漏洞推理等安全任务中的表现接近Mythos 5,在网络安全防御场景中的表现让人眼前一亮。
GLM-5.3到底要“升”什么?
要理解GLM-5.3的分量,得先看看GLM-5.2走到了哪一步。
6月13日,智谱开源了旗舰模型GLM-5.2。这款模型交出了一份相当漂亮的成绩单:混合专家(MoE)架构,总参数量约7530亿,上下文窗口达100万token。在国际人工智能独立评测机构Artificial Analysis的综合能力评测榜单上,GLM-5.2拿下51分,位列开源模型最佳水平。富瑞发布研报称,GLM-5.2在Artificial Analysis模型智能指数中排名全球第三,为中国模型首次打入前三位,在编程及智能体能力上分别排名全球第四及第二。
换句话说,GLM-5.2已经是国产开源模型里跑得最快的那一个。但大模型这行,没有“守成”一说,直白点说,你不跑,别人就会超过你。
与GLM-5.2相比,GLM-5.3基座模型并没有改变,但通过极致的后训练Scaling大幅提升了模型的智能上界,主要体现在了数十倍的长程任务环境、更丰富的环境类型,以及超长的后训练时间。
具体到能力层面,在编程能力方面,相比GLM-5.2,GLM-5.3体感评测提升50%,据智谱AI方面透露,GLM-5.3在包括Terminal Bench 3.0在内的公开基准测试中,在开源模型方面排名第一。其中,在Terminal Bench 3.0上,GLM-5.3的得分从4.6提升到28.3;在DeepSWE v1.1上,得分从46.2提升至66.9;在Agents' Last Exam 上,得分也从23.8提升至28.5。在GDPval-AA v2中,GLM-5.3得分1769,展现基于编程能力涌现的专业任务执行能力。
这些结果表明,GLM-5.3不只擅长做出一个好看的Demo,更能接住复杂的大目标,在数万行代码、上百个文件和多个相互依赖的系统之间持续推进。在极少人工干预的情况下,它也能长时自主开发、反复验证,最终把项目推进到可交付状态。
从GLM-5.2开始,智谱引入了effort level(思考档位)控制。在相近Token预算下,GLM-5.3在任务完成质量、执行速度和使用成本之间取得了更好的平衡。
安全能力值得期待
如果说编程能力的提升是GLM-5.3的基本操作,那么网络安全能力的涌现就是一条更值得关注的惊喜。
在网络安全能力方面,GLM-5.3在白盒代码审查与漏洞推理等安全任务中的表现接近Mythos 5,相信后续再网络安全防御实战场景中能发挥比较大的价值。
智谱在官方公告中坦承:“安全能力的出现并不偶然,安全工作本质上是约束严格的编程能力。”从2025年9月开始,智谱就在这个方向投入研究,与国内多家头部安全实验室一同推进更多长程任务环境,构建更专业化的评测与执行框架。
在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为83.5%,高于GLM-5.2的77.2%,与Mythos 5的83.8%和GPT-5.6 Sol的83.6%基本相当。
在更考验深度推理能力的ExploitBench中,模型需要进一步理解真实漏洞的成因并完成相应的利用。GLM-5.3得分为54.4%,是GLM-5.2(24.4%)的两倍多,但仍低于Mythos 5的78.0%和GPT-5.6 Sol的73.5%。
在ExploitGym中,模型在限定时间内完成漏洞利用任务的数量。GLM-5.3在两小时内完成105项任务,六小时内完成130项,而GLM-5.2分别只完成29项和39项。Mythos 5仍然领先,两个时间段分别完成181项和247项。
这三个基准呈现出一个清晰的趋势:越接近漏洞利用链的前端,GLM-5.3的提升越明显;越深入完整的漏洞利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。
换句话说,GLM-5.3在发现漏洞这个环节已经追上了全球顶尖水平,但在利用漏洞这个更深的环节还有不小的距离。这既是差距,也是方向。
之所以让笔者对GLM-5.3在网络安全的能力有所期待的是,智谱AI官方发布的真实案例。GLM-5.3联合国内安全团队发现2404个漏洞,其中1088个为中高危,最早可追溯至约40年前,部分漏洞存在于Android、Windows、macOS、APP等人们每天使用的软件中。
GLM未来猜想
GLM-5.3交出了一份漂亮的成绩单,但它面前仍然摆着三个必须回答的问题。
首当其冲的就是视觉。GLM-5.3的升级有一个容易被忽略的细节:它依然是一个纯文本模型。
此前,智谱首席科学家唐杰在社交平台上发起全球意见征集,为GLM-5.3收集功能建议,浏览量超过40万。评论区被一个词刷屏了:视觉。
开发者想要的,是能看懂截图、能解析表格、能从UI设计图直接生成代码的模型。而GLM-5.2虽然性能强劲,但偏偏没搭载视觉编码器,看不了图,也造不出图。
智谱并非没有视觉技术。这家公司此前发布过CogVLM视觉编码器和GLM-5V-Turbo原生多模态模型。但唐杰此前认为多模态对提升AGI智能帮助有限,主张分开发展。这一策略如今看来需要调整了—开发者的呼声和市场的竞争态势都在迫使智谱做出改变。
其次是深度漏洞利用的差距怎么追?ExploitBench上54.4%对Mythos 5的78.0%,ExploitGym上130项对247项,这两组数字清晰地划出了GLM-5.3与全球顶尖水平之间的距离。
GLM-5.3在漏洞发现(CyberGym)上已经追平了Mythos 5,但在漏洞利用(ExploitBench、ExploitGym)上仍有显著差距。智谱自己也承认:“越深入完整利用,模型与Mythos 5等闭源前沿模型之间的差距也越大。”
这个差距意味着什么?在真实的网络安全攻防中,“发现漏洞”只是第一步,“验证漏洞”和“修复漏洞”同样关键。如果模型只能发现而不能验证,安全团队的工作量依然巨大。智谱需要在这条路上继续追赶。
最后,也是很多大模型公司都需要面对的,商业价值如何体现?智谱2025年全年总营收达7.24亿元。这个数字放在大模型赛道里不算小,但对比其市值(即便是经历了大幅回撤之后)依然显得不成比例。资本市场对大模型公司的估值,本质上是在为未来的可能性买单。但这种可能性需要被不断验证。
国内排名前十的互联网公司中有9家深度集成了GLM系列模型。这是一个不错的起点,但远非终点。在政企市场之外,智谱需要在更广阔的商业化场景中证明自己。
不过,外部环境正在向有利于智谱的方向变化。8月6日,DeepSeek发布公告计划近期整体上调API服务定价。业内人士认为,这一动作打破了此前大模型行业以低价竞争为主的格局。智谱年内已多次上调API价格,如果行业整体涨价成为趋势,智谱的定价策略将不再显得“突兀”。
高盛已经上调了智谱今年的收入预期35%。但高盛同时将智谱的目标价下调,评级维持“中性”。上调收入预期、下调目标价——这组看似矛盾的操作传递了一个清晰的信号:市场看好行业的增长空间,但对具体公司的竞争位置仍持观望态度。
两个月的迭代周期放在大模型时代是一个不算慢的节奏,GLM-5.3的发布证明了后训练Scaling的潜力(在不更换基座的前提下,靠极致的长程任务训练和更丰富的环境交互,照样能榨出大模型更多的智能空间)。这对行业来说是一个值得留意的信号:参数竞赛或许不是唯一的路,把现有模型的能力“挖透”同样能带来可观的回报。
(文|Leo张ToB杂谈,作者|张申宇,编辑丨杨林)
加载中,请稍侯......