Claude Sonnet 5.5上线:半价、程序跑分胜Opus

2026-09-29分类:人工智能 阅读()


Anthropic 在9 月28 日发布Claude Sonnet 5.5,这是Claude 5.5 系列的第二款模型,距离旗舰Opus 5.5 上线还不到一周。官方表示,Sonnet 5.5 比前代Sonnet 5 快30% 以上,多数工作的成本最多可再降30%;价格维持每百万输入token 2 美元、输出10 美元,只有Opus 5.5 的一半。

跑分:写程序小胜Opus,其余项目紧追

根据Anthropic 公布的数据,Sonnet 5.5 最亮眼的是代理型程式测试Terminal-Bench 4.0,拿下70.6%,不但远高于Sonnet 5 的10.3%,也超过Opus 5.5 的66.4%。在衡量知识工作的GDPval-AA 上,Sonnet 5.5 拿到1,844 分,与Opus 5.5 的1,846 分几乎打平。

不过在其他项目上,Sonnet 5.5 仍略逊于旗舰:电脑操作测试OSWorld 2.1 为80.1%(Opus 5.5 为81.8%)、跨领域推理的Humanity's Last Exam 为64.5%(Opus 5.5 为67.7%)、程式测试FrontierCode 1.1 为46.2%(Opus 5.5 为54.4%)。换句话说,它不是全面超越Opus,而是在「明确范围的日常任务」上,用一半的价格拿到接近旗舰的表现。

Anthropic 研究产品经理Theo Chu 在接受CNBC 访问时说:「Sonnet 是给在意成本、不一定需要那么多智慧的客户。可能是只需要执行、不需要Opus 那种判断力的例行工作。」官方的定位也很清楚:Opus 处理需要审慎判断的复杂工作,Sonnet 5.5 则擅长范围明确的日常任务、修bug,以及制作精美的文件、简报与试算表。

更省token?官方与第三方说法不同

Anthropic 强调Sonnet 5.5 完成每项任务所需的token 明显减少,并引用避险基金Balyasny 的金融任务测试:Sonnet 5.5 每个答案约用12.1 万个token,Sonnet 5 则要49.7 万个。

但第三方评测机构Artificial Analysis 的结果不太一样。Decrypt 报导,Artificial Analysis 发现Sonnet 5.5 每项任务用掉的token 是它测过的模型中最多的,在最高推理强度下约19.3 万个,比Opus 5.5 多约60%,每项任务成本约7.6 美元。也就是说,单价只有一半,不代表实际帐单就是一半,开发者仍要依自己的工作量实测。

放慢呼声下的发布:不推进前沿,但加上资安防护

CNBC 指出,这是Anthropic 执行长Dario Amodei 本月稍早呼吁业界放慢模型开发后,公司推出的第二款模型。 Anthropic 表示,Sonnet 5.5 并未推进其模型能力的前沿,因此对齐测试主要聚焦在适用于各能力等级模型的特定风险;官方自动化行为稽核涵盖约1,850 个情境,结果显示Sonnet 5.5 在多数对齐指标上优于或持平Sonnet 5。

不过Anthropic 也承认,Sonnet 5.5 的资安能力比前代「大幅提升」,因此它成为第一款搭载与Opus 等级相同资安防护的Sonnet 模型,高风险的资安任务会改由Sonnet 5 处理。它也是第一款加入防蒸馏分类器的Sonnet 模型,用来防止推理过程被撷取。

Sonnet 5.5 即日起在Claude 平台、AWS、Google Cloud 与Microsoft Azure 上线,最便宜的Haiku 5.5 则将在未来几周推出。这次发布正好落在Anthropic公开说明书揭露庞大算力支出之际,中阶模型能否以更低价格吸引更多企业用量,将是市场观察的重点之一。

Tags: