观点

Sonnet 5.5发布,智能水平超越GPT-6 Astra,说好的减速呢?

文 | 字母AI

口口声声呼吁减速的阿莫迪,一脚踩满了油门。

2026年9月26日,Anthropic发布了Sonnet 5.5。不仅性能接近Opus 5.5,价格还只有Opus 5.5的一半。

在Artificial Analysis给出的智能水平评分榜上,Sonnet5.5更是超越了GPT-6 Astra以及Anthropic自己的旗舰模型Claude Fable 5.1。

 Sonnet 5.5发布,智能水平超越GPT-6 Astra,说好的减速呢?

关键在于性价比,目前,Sonnet 5.5几乎包圆了所有中等难度的任务,尤其是开发、科研和数学。除去那些非常简单的任务外,没有任何一款模型,能在性价比方面追上Sonnet 5.5。

所以,说好的减速呢?

为什么它这么强还这么便宜?

Sonnet 5.5的性能非常强。其在Terminal-Bench 4.0的成绩为70.6%,上代Sonnet 5只有10.3%。

在GDPval-AA v2.1上,它拿到1844分,距离Opus 5.5的1846分只差2分。CursorBench 4.0是55.5%对57.8%,同样接近于Opus 5.5。

 Sonnet 5.5发布,智能水平超越GPT-6 Astra,说好的减速呢?

Anthropic表示,虽然Sonnet 5.5性能和Opus 5.5接近,但是遇到需要持续判断、目标又不够明确的复杂工作,Opus 5.5的效果会更好。

Sonnet 5.5更适合日常任务,比如修bug、迭代功能,以及做文档、幻灯片和表格。

Sonnet是Claude家族里的轻量模型,它的性能本应该和旗舰模型差很多才对,但为什么Sonnet 5.5会突然变得这么能干?

从公开材料看,最明显的变化不是它记住了更多知识,而是它把任务做完的能力强了。

Anthropic从Sonnet 5开始,就强化了推理、工具使用和编程,做事时更愿意调用工具并检查结果。到了5.5,提升集中体现在智能体编程、电脑操作和视觉理解这些需要连续行动的环节。

它在OSWorld 2.1上从上代的57.0%提升至80.1%,在不使用工具的图表识别测试Chartography上从15.6%提升至61.6%。

也就是说,Sonnet 5.5已经掌握了从屏幕里收集信息,再据此推进任务。

拿修bug来说,读懂代码只是第一步,模型想要完成整个修bug的任务,它还得找到相关文件、判断改动会影响哪里、调用工具修改,再确认问题是否解决。

任何一步出错,整道题都可能失败。

这就是为什么Sonnet 5.5在Terminal-Bench上的得分能大幅提升,它不是那种简单的“代码智商”暴涨,是通过这种收集信息的能力,让模型能完成整个链条。

 Sonnet 5.5发布,智能水平超越GPT-6 Astra,说好的减速呢?

一个猜想,Sonnet 5.5可能也对Opus 5.5进行了蒸馏。在测试过程中发现,Sonnet 5.5会说一些Opus 5.5才会出现的口头禅,比如“You are right!”(你是对的)

Anthropic在发布Opus 5.5时,就明确说过它改进了写作与沟通方式,“You are right!”最具代表,Fable 5.1从来不会说这个口头禅,但是Sonnet 5.5也开始说这个口头禅了。

那它为什么便宜?先看标价:Sonnet 5.5每百万输入、输出token分别是2美元和10美元,正好是Opus 5.5的一半。5分钟缓存写入是2.50美元对5美元,缓存读取都是0.20美元。

所谓5分钟缓存写入,指的是通过API首次发送一段会重复使用的提示内容时,让系统把它缓存起来,这次写入,就是按“5分钟有缓存”档位来计费的。

同时,Anthropic还表示“每项任务最高便宜 30%”,来自完成同一件事通常消耗更少 token。用同一价格、少走一些弯路,账单自然会变薄。

还是以编程来举例。

早期测试者观察到,Sonnet 5.5比Sonnet 5更倾向于把工具调用成批处理。这就使得整体步骤更少,进而更省token。

Anthropic称,在FrontierCode的High档位上,它比上代同档位高约10%,单任务成本却约为后者的15分之1。

在一些评测中,Sonnet 5.5用Low或Medium档位,就能以大约十分之一的任务成本超过Sonnet 5的最好成绩。

便宜的关键不只在每个token卖多少钱,还在模型为完成任务究竟花掉多少token、绕过多少次工具。

此外,Sonnet 5.5的输出速度也比Sonnet 5提高了30%以上。

以下为Sonnet 5.5和Sonnet 5速度、性能对比。

模型之外还有什么?

比起性能,Anthropic如今更注重工程方面的提升。

比如Fable 5.1,它就引入过防止提取推理内容的Preserved Thinking。如今,这套机制也进入了Sonnet 5.5,并且向前走了一步。

Anthropic为Sonnet 5.5加上防止推理提取的安全分类器,同时把它产生的思考块绑定到创建它的账户或关联账户。

换一个不关联的账户重放,API会丢弃该思考块,模型看不到先前的推理。不过这套防护系统,普通开发者根本不用管这套防护系统,因为它并不影响你阅读整个思考过程,Anthropic主要想防的是那些想大规模蒸馏、反复调用来抽取模型能力的企业。

思考块的签名还与此前的对话绑定。

如果开发者改动已经发生的系统提示、工具定义或历史消息,再把旧思考块塞回去,新账户默认可能收到400错误。

正常追加对话通常不受影响,但那些习惯在后台悄悄改写历史的智能体框架,就得重新处理会话。

安全护栏也从“要不要拒绝用户过分的请求呢?”,变成了“我该把这个问题交给谁回答?”。

Sonnet 5.5的网络安全能力提升,因此高风险网络安全请求可能触发分类器,并被明显地回退给Sonnet 5。

正常找bug和修bug仍可使用Sonnet 5.5。

Claude API上的服务端自动回退目前处于测试阶段,需要开发者启用。

Sonnet 5.5遇到某些被安全系统拦下的请求时,不一定直接结束;如果开发者开启了“自动回退”,系统会尝试换成 Sonnet 5 来回答。

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
朋友定了8个闹铃抢票,我就知道今年双节不一般
« 上一篇 09-29
困于“数字金拱门”的麦当劳
下一篇 » 09-29

相关内容

【钛晨报】商务部公布中美贸易理事会和“300亿对300亿”对等降税框架有关情况;英伟达将股票回购授权增加1500亿美元,使回购计划总额达到2350亿美元吃;SpaceX“星舰”首次成功进入地球轨道
阿里AI高管的集体大考:谁担子最重?谁最焦虑?
等了三年,李斌把吉利等成了股东
定价最低,荣耀Magic9系列为IPO拼了