不出所料,Sonnet 5.5真的发布了!
就在OpenAI年度开发者大会开幕的前一天,Anthropic连夜推出了重磅产品——Claude Sonnet 5.5。
作为Opus 5.5的完美搭档,Sonnet 5.5的定位是:成为速度最快、成本最低、最贴合日常工作的「全能型助手」。

相比Sonnet 5,它的运行效率提高了30%,完成相同任务的花费最高可降低30%。
此外,它的定价仅为大杯Opus 5.5的一半,但性能几乎与其持平。
它不仅代码编写能力出色,还成为首个仅通过查看屏幕截图就能通关《宝可梦 红》的Sonnet模型。
更令人惊讶的是,在极富挑战性的智能体编程测试Terminal-Bench 4.0中,这个中杯版本竟然击败了大杯版本!
Sonnet 5.5的得分高达70.6%,大约是之前版本的7倍,比Opus 5.5的66.4%还要高出不少。
仅仅一代之间,它就从垫底位置跃升至自家榜首。

上线不久,第三方权威评测机构Artificial Analysis的智能指数榜单就被彻底改写:前三名全部被Claude系列占据,Sonnet 5.5位列第二。

而第三名,是A社四周前才发布的超大杯Fable 5.1,其定价是Sonnet 5.5的整整5倍!
短短一个月内,大杯级别的Claude直接变成了白菜价,按中杯出售。
而且,用户可以自由调节「Effort Level」。
选择低/中等: Claude响应迅速,消耗Token极少,适合日常简单任务。 选择高/最大: Claude会进入深思模式,反复验证自己的结果,用于攻克复杂难题。
Sonnet 5.5,打破「不可能三角」
这次,Sonnet 5.5的发布直接颠覆了「速度快、成本低、质量高」的传统矛盾。
输出速度比前代提升了超过30%,使其毫无悬念地成为迄今为止速度最快的Sonnet模型。
Sonnet 5.5的定价表面上看与Sonnet 5相同:每百万输入Token 2美元,每百万输出Token 10美元,缓存读取每百万Token 0.20美元。

但真正的关键在于效率!
Anthropic发现,由于模型变得更智能,Sonnet 5.5所需的Token大幅减少,每个任务的实际成本最多降低了30%。
用更少的Token,就能完成更大的任务。
以下是同一个prompt下,Sonnet 5和Sonnet 5.5的结果对比,差异非常明显。


半价追平Opus,自家顶配也被反超
在Artificial Analysis榜单上,Sonnet 5.5获得了64%的评分,高于Opus 5.5和GPT-6 Astra的60%。
在Terminal-Bench-Science测试中,它得到了53%,排名第三,仅落后于GPT-6 Astra和Opus 5.5。

在代码编写的另外两项测试中,同样表现出色。
在FrontierCode测试中,Sonnet 5.5最高获得了52.1%,超越了OpenAI的GPT-6 Sol(49.3%)。
在模拟真实Cursor编程会话的CursorBench测试中,Sonnet 5.5得到了55.5%,仅比大杯版本低2个多点,而上一代只有34.1%。
早期参与内测的开发者表示:「它理解庞大代码库的速度快得惊人!」
它的工具调用效率同样令人印象深刻:在连续的测试中,Sonnet 5.5学会了将工具调用「打包」批量处理,步骤更少、错误更少、花费也更少。

不仅在代码方面,办公能力也达到了同等水平。
GDPval-AA测试评估的是模型在44种职业中直接交付成品的能力。Sonnet 5.5获得了1844分,大杯Opus 5.5是1846分。
在评估长程知识工作的AA-Briefcase测试中,Sonnet 5.5得到了1811分,与Opus 5.5的1822分基本持平,比GPT-6 Sol高出300多分。

最令人惊喜的是它展现出的「设计天赋」。
这次,Sonnet 5.5 懂得了审美!它能够主动美化UI,甚至能完美遵循幻灯片模板,生成几乎不需要人类修改的PPT。
Anthropic内部有一个硬核案例:测试人员将一家上市公司的季度财报资料、电话会议记录以及一个PPT模板交给Sonnet 5.5,要求它生成一份10页的运营审查幻灯片。
结果,它生成的初稿被两位人类专家评价为:「完美,可以直接发送。」
在带工具的「人类最后的考试」中,它获得了64.5%,比上一代高了将近10个百分点。
另一个第三方榜单Vals Index上,Sonnet 5.5首次上榜就排名第二,仅比Opus 5.5低0.47分。

四周前,Fable 5.1发布时,还是全球最强的编程和知识工作模型。
现在,Sonnet 5.5在Terminal-Bench 4.0上比它高出将近15个百分点,GDPval-AA高出109分,智能指数也高出3分。
科技博主@synthwavedd在发布当天发帖说,Anthropic正在疯狂上菜。

在复杂办公测试Box中,Sonnet 5.5的整体准确率达到65%,而Sonnet 5为61%。
它完成交付成果的速度也快了约2.4倍,总token消耗量还降低了12%。在智能体工作中,速度和准确性通常会相互制约,因此一个能同时兼顾两者的模型确实是实实在在的进步。

它搭建的旧金山,着火了会自己派消防车
实测显示,Sonnet 5.5强大得超乎想象。
AI博主Matthew Berman获得了Sonnet 5.5的提前测试资格,发布当天一口气放出了一系列实测。

他让Sonnet 5.5在虚幻引擎中实时搭建了一座旧金山。街道上车流不息,甚至还有骑自行车的人穿过路口。
输入一句「泛美金字塔起火」,系统立即将火情评为4.6级(满分10级),随即自主派出5辆消防车和3辆警车。
远处的大楼冒出滚滚黑烟,警车闪着灯赶到路口,当场拉起警戒线。

甚至连星舰V3,也被它制成了可交互的爆炸图。整艘飞船一层层拆开,一直拆到底部的猛禽3发动机。

他还用Claude Sonnet生成了在线乐高游戏。

Matthew Berman感慨3D模拟已被Claude攻克。
但也有人表达了不同意见。
Robbert van Empel维护了一个LEGO积木星球挑战,要求创建一个带有《南方公园》剧情的可互动游戏:
Create a 3D world as a globe with a South Park theme. I want to be able to walk through the world using WSAD, interact via 'e', and jump using the spacebar. I also want to be able to rotate the mouse and move objects. I want the world to be made of Lego bricks. Also, make it a game where the characters make typical South Park jokes, and the game must really have a South Park storyline.
Claude Sonnet 5.5这次被测试了,但它未能通过:它无法一次性构建出整个世界。而GPT Luna则成功做到了。

另一个卖点,就是快。
同一个题目,让两代模型并排编写一段鸟群模拟代码。Sonnet 5.5写完代码、鸟群已经飞了9秒,上一代还在逐行输出代码。
困住Claude一年多的宝可梦,这回只看截图就通关
Sonnet 5.5也打破了纪录,成为首个仅通过查看游戏截图就通关《宝可梦 红》的中杯模型。
此前,Claude已经和宝可梦较劲一年多了。
2025年2月,A社就开始让Claude玩《宝可梦 红》,每一代都被不同关卡卡住。
Opus 4.5在一栋楼里困了好几周,硬是不去捡关键的钥匙卡;Opus 4.6一路打到接近冠军,结果被某个机关卡了几个月,因为看不清地上的开关在哪。
直到今年5月,Opus 4.7才终于通关,依靠两个外挂:一个能放大截图,一个能把截图存成记忆。
四个月后,Sonnet 5.5仅靠看截图就一次性通关了!

关键原因,就是它「长出」了眼睛。
在不借助工具强读复杂图表的Chartography测试中,它从上一代的15.6%暴涨到61.6%,翻了近4倍。
在看着屏幕截图去操作电脑的OSWorld 2.1测试中,它涨到了80.1%,与Opus 5.5的81.8%仅差1.7个百分点。
这刺激到了网友Goody,要求Sonnet 5.5开发一款属于他自己的游戏。

这是一款墨西哥怪物风格的Game Boy游戏。
Sonnet 5.5将其命名为《Nahual》:一只火属性的墨西哥无毛犬,可以进化成Xolcán、一株仙人掌、一只美西螈、一只凤尾绿咬鹃。
单个文件2342行代码,连音乐都有。
一个提示词,Sonnet 5.5就创造出了一个全新的类《宝可梦》游戏,简直疯狂至极。
档位开到最高,中杯反而比大杯还贵?
不过,Sonnet 5.5标价便宜,最终能否省钱,完全取决于你把「努力档」开到哪一格。
努力档(effort)是Claude留给开发者调节脑力的开关,从Low到Max一共五档,档位越高越烧钱。
如上文所述,官方表示:和上一代相比,Sonnet 5.5单个任务最多便宜30%。
在很多测试中,Sonnet 5.5仅开启Low或Medium档,就能超越上一代的满档成绩,成本更是只有十分之一。

但Artificial Analysis将档位推到Max一测,结果就有些吓人了。
在Max档下,Sonnet 5.5每做一道题,平均要生成19.3万个输出Token!这是该机构测过的历史最高纪录。比大杯Opus 5.5的Max档多出了六成,大约是GPT-6 Astra的7倍。
因此,即使单价减半,Sonnet 5.5满档运行一个任务也要花费7.60美元。不仅比上一代贵了50%,甚至比大杯Opus 5.5(5.98美元)还要贵,直接逼近了超大杯Fable 5.1的7.63美元!

满档甚至可能帮倒忙。
在测试代码合并的FrontierCode上,Sonnet 5.5开启Max档仅获得46.2%,反而比低一档的Xhigh(52.1%)还低。
原因是满档状态下它过于依赖代码审查工具,将任务分派给大量子智能体。结果要么运行超时,要么擅自修改了任务范围之外的代码,直接被扣分。
因此,要真正省钱,修Bug、写文档这类日常任务,Sonnet 5.5开启Medium或High档最划算。复杂的长任务,直接交给大杯Opus 5.5的High档,千万别盲目把中杯开满。
护城河升级,继续防蒸馏
这次,A社一如既往地采取了防蒸馏机制。

官方原话是:「由于Sonnet 5.5的能力远超其前代版本,它是首款搭载安全分类器以防止推理提取的Sonnet模型。」
这意味着Claude脑子里的「思考过程」无法与账户解绑。

