AI 日报hiw3c.com

Anthropic再推Claude 5.5:Sonnet 5.5速度提升超三成,单任务成本最高降三成,性能逼近Opus - 全天候科技

Google News AI awtmt.com 网页快照

Anthropic再推Claude 5.5:Sonnet 5.5速度提升超三成,单任务成本最高降三成,性能逼近Opus

继上周发布旗舰模型Claude Opus 5.5后,Anthropic再次扩充Claude 5.5家族,推出Opus 5.5的低成本替代互补方案Sonnet 5.5。

美东时间28日周一,Anthropic推出Claude Sonnet 5.5,称这是Claude 5.5家族的第二款模型。与上一代Sonnet 5相比,新模型输出速度提升超过30%,在保持API价格不变的情况下,由于完成相同任务通常所需的Token更少,单项任务成本最高可下降30%。

在多项基准测试中,Sonnet 5.5 在低或中等努力水平下,以大约Sonnet 5十分之一的成本就超过了Sonnet 5的最佳得分。

Anthropic表示,Sonnet 5.5尤其适合日常知识工作、修复代码、制作文档、幻灯片和电子表格等“边界清晰”的任务,是更强大的Opus 5.5之外、更快且成本更低的工作伙伴。公司同时称,新模型是迄今速度最快的Sonnet模型。

值得注意的是,第三方AI基准测试平台Artificial Analysis的数据显示,在最高推理强度下,Sonnet 5.5的综合智能指数达到56分,仅比Opus 5.5低2分,并在部分智能体和知识工作测试中与Opus 5.5基本持平。不过,要达到接近Opus 5.5的表现,Sonnet 5.5也付出了较高的Token消耗代价。

Sonnet 5.5此次最直接的卖点并不是降低API标价,而是 用更少的Token和更快的生成速度完成相同任务 。

Anthropic表示,Sonnet 5.5的API价格与Sonnet 5保持一致,为每百万Token输入2美元、输出10美元;但在内部测试中,新模型完成相同工作通常需要明显更少的Token,因此单任务成本最高可以下降30%。

与此同时,Sonnet 5.5的输出速度比Sonnet 5快30%以上。Anthropic称,这意味着用户不仅能够以相同的Token单价获得更快响应,还能够在更多任务中减少模型调用和工具调用次数,从而进一步压低实际使用成本。

媒体指出,Anthropic此次强调的“30%成本下降”实际上更多来自 效率提升,而非价格下调 :模型通过更少的工具调用、更少的Token以及更快的输出速度完成工作,因此实际每项任务的成本下降。

Anthropic还表示,在部分基准测试中,Sonnet 5.5在Low或Medium推理强度下,就可以超过Sonnet 5此前的最佳成绩,而成本约为后者的十分之一;在另一项编程测试中,Sonnet 5.5在High模式下的成绩比Sonnet 5高约10个百分点,但单任务成本约为后者的十五分之一。

这意味着,Anthropic此次升级的重点并不是简单地把模型推向“更强”,而是试图扩大 性能—成本曲线上的可用区间 :对于不需要旗舰模型的日常任务,用户可以用较低的推理强度换取更快、更便宜的结果;而在复杂任务上,则可以提高推理强度,进一步逼近Opus级别的能力。

该平台表示,Sonnet 5.5在其Intelligence Index中获得56分,在最高推理强度下较Sonnet 5提升18分,排名仅次于Opus 5.5。其在Terminal-Bench 4.0中的得分达到64%,高于Opus 5.5和GPT-6 Astra的60%;在AA-Briefcase、GDPval-AA和AutomationBench-AA等测试中,也与Opus 5.5达到近似水平。

但Artificial Analysis同时指出,Sonnet 5.5为获得这样的成绩消耗了非常多的输出Token。

在最高推理强度下,Sonnet 5.5每个Intelligence Index任务平均使用约19.3万个输出Token,这是该平台测试过的模型中最高的水平,比Opus 5.5或Sonnet 5高出约60%,更是GPT-6 Astra的约7倍。

这也形成了此次发布一个颇值得关注的反差: Sonnet 5.5的API标价没有上涨,但如果用户选择最高推理强度,模型为了追求更高性能所消耗的Token可能大幅增加。

Artificial Analysis据此认为,在“智能水平—单任务成本”的比较中,Sonnet 5.5并非所有推理强度都处于最具成本优势的位置;高强度模式下,其性能已经非常接近Opus 5.5,但Token消耗也随之明显上升。

不过,这些测试是在Sonnet 5.5正式发布前的版本上进行的。Artificial Analysis表示,Anthropic后来发现该预发布版本存在一个可能影响结构化输出请求的Bug,并已在正式版本中修复,因此相关评测还将重新进行。由此来看,目前第三方数据更适合作为参考,而非最终性能定论。

相比Opus 5.5主要面向复杂编程、智能体和知识工作,Anthropic对Sonnet 5.5的定位明显更加偏向日常生产力。

Anthropic称,新模型擅长修复Bug、制作经过润色的文档、幻灯片和电子表格,同时具备更强的设计能力,可以进一步完善用户界面,并根据模板制作只需少量人工修改的演示文稿。

公司还特别强调了模型的文字表达能力。Anthropic表示,和上一代模型相比,Sonnet 5.5能够写出更加清晰的内容,而更快的速度也使其适合快速迭代和多人协作。

从产品策略来看,这意味着Anthropic并没有试图让Sonnet 5.5完全替代Opus 5.5,而是进一步拉开两者的产品定位: Opus承担最复杂、最需要能力的任务,Sonnet则争夺规模更大的日常工作和高频任务。

TechCrunch也将Sonnet 5.5描述为Anthropic更偏向日常工作的“更快、更便宜的工作伙伴”,并指出其重点应用场景包括编程和办公文档处理。

Anthropic表示,Sonnet 5.5在自动化行为审计中,大多数alignment和诚实性指标都优于或持平Sonnet 5。同时,新模型首次拥有与Anthropic最强模型类似的网络安全防护机制和fallback机制。

当模型面对特定高风险网络安全任务时,可以启用更严格的安全护栏并将部分请求转交给其他模型;而对于普通软件开发任务,Anthropic称这一机制不会产生影响。

这一变化尤其值得关注,因为此前Sonnet系列与Opus系列在网络安全能力和安全防护上的定位存在明显区别。Anthropic此次让Sonnet 5.5获得更接近旗舰模型的安全机制,也意味着随着中端模型能力越来越接近前沿水平, 安全控制正在从旗舰模型向更广泛的模型层级下沉 。

而这也延续了Anthropic此前发布Opus 5.5时的产品思路:模型能力提升与安全护栏同步推进。上周发布的Opus 5.5同样强调了网络安全等高风险场景的安全机制。

Sonnet 5.5是Claude 5.5家族继Opus 5.5之后的第二款模型。

Anthropic表示,Sonnet 5.5现已全面上线,未来几周还将推出Claude Haiku 5.5。届时,Claude 5.5家族将进一步覆盖从高端复杂任务到日常高频任务、再到更强调速度和成本的不同应用场景。

这也是Anthropic近期连续更新模型家族的延续。9月22日发布的Opus 5.5定位于更高端的智能体编程和知识工作,运行成本较Opus 5下降40%;如今Sonnet 5.5则在保持原有价格的基础上,通过降低Token消耗和提升速度来降低单任务成本。

从商业化角度看,Anthropic正在将模型竞争的重点从单纯的“谁的基准测试分数更高”,进一步推向 单位任务成本、响应速度、Token效率和安全性 。

而Artificial Analysis此次测试暴露出的另一个趋势同样值得关注:当中端模型通过提高推理强度不断逼近旗舰模型时,“模型本身的API价格”可能已经不足以衡量真实使用成本, 完成一项任务究竟需要多少Token、多少次工具调用以及多长时间,正在成为AI模型商业竞争的新变量。