导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

Anthropic 发布 Claude Sonnet 5.5:编码超越 Opus 5.5、价格减半,但 token 成本存隐忧

Anthropic 周一发布 Claude Sonnet 5.5,作为 6 月 Sonnet 5 的升级版,定位为面向编码和日常专业工作的更快、更便宜的中端模型。公司称,Sonnet 5.5 运行速度较前代提升逾 30%,在范围明确的任务、漏洞修复以及生成精致文档、幻灯片和表格方面表现最强,并对设计有敏锐感知。

Myriad: How low will Nvidia go? Click to make your prediction.

Myriad:Nvidia 会跌到多低?点击做出你的预测。

价格与效率

Sonnet 5.5 定价维持每百万输入 token 2 美元、每百万输出 token 10 美元,为 Opus 5.5 费用的一半。Anthropic 表示,该模型每项任务使用的 token 数量减少近三分之一,因此运行成本低于 Sonnet 5。

编码性能

在测试 AI 智能体能否自行输入命令完成复杂专业任务的 Terminal-Bench 4.0 上,Sonnet 5.5 得分 70.6%。Opus 5.5 为 66.4%,Sonnet 5 仅为 10.3%。独立测试机构 Artificial Analysis 报告了类似结果:Sonnet 5.5 为 63.6%,Opus 5.5 为 59.6%,OpenAI 的 GPT-6 Astra 为 59.1%。

得分也取决于 effort 设置。该设置会让模型思考更久以给出更好答案,但也会增加账单。Anthropic 称,Sonnet 5.5 在 High effort 下的 FrontierCode 表现可匹配 GPT-6 Sol,而每项任务成本约为后者的五分之一。在按 Elo 评分衡量 44 种职业真实专业工作的 GDPval-AA 上,Sonnet 5.5 得分 1844,与 Opus 5.5 的 1846 基本持平。GPT-6 Sol 得分为 1487。

竞品定价

竞争对手正在跟进价格。OpenAI 上周将 GPT-6 Sol 降至 2 美元和 10 美元,其中端模型 GPT-5.6 Terra 标价为 2 美元和 12 美元。Anthropic 未公布 Terra 的基准测试。

隐忧:token 用量

Sonnet 5.5 也是一款“话多”的模型。在 max effort 下,它在每个测试任务中约写入 193,000 个 token,为 Artificial Analysis 测得最多,比 Opus 5.5 多约 60%。这相当于每项任务 7.60 美元,比 Sonnet 5 高约 50%,与 Anthropic 宣称最高节省 30% 的说法相悖。

Anthropic Launches Claude Sonnet 5.5: Beats Opus 5.5 in Coding at Half the Price, With a Token-Cost Caveat

Anthropic 的节省来自较低设置。在 Medium effort,即其应用默认设置下,公司称 Sonnet 5.5 以不到十分之一的成本超越 Sonnet 5 的最佳编码成绩。Artificial Analysis 表示,High effort 最具性价比。对日常用户而言,只要把拨盘调低,就能以较低价格获得接近旗舰级的编码能力。

Anthropic 的表格为自行报告。Artificial Analysis 测试的是预发布版本,其中有一个 Anthropic 预计影响很小或略微低估其分数的漏洞。Anthropic 表示,Opus 5.5 在需要持续判断的复杂工作上仍明显更强。面向高用量、成本敏感应用的 Claude Haiku 5.5 预计将在未来几周推出。