2026-07-01-星期三 · Anthropic · ClaudeSonnet5

收录于 第 19 期(2026-07-01) · 本期共 11 条

❯ Anthropic 发布 Claude Sonnet 5:性能逼近 Opus 4.8,价格更低,主打跑智能体

新模型Anthropic 周二发布 Claude Sonnet 5,自称”迄今最能跑智能体的 Sonnet”,定位是用更低价格逼近旗舰 Opus 4.8 的表现,并在智能体任务上大幅超过上一代 Sonnet 4.6。它已直接成为免费版和 Pro 用户的默认模型,同时上线 Max、团队版、企业版、Claude Code 和 API。

逼近到什么程度此前 Sonnet 4.6 与旗舰 Opus 之间一直隔着一截明显的能力差,这次官方给的对照很具体:在拉满”超高”推理档时,Sonnet 5 在 OSWorld-Verified 和智能体搜索 BrowseComp 两项基准上,大致追平 Opus 4.8 的中到高档表现;在知识工作基准 GDPval-AA v2 上,Sonnet 5 甚至以 1618 分微超 Opus 4.8 的 1615 分。官方说测试者发现,它常能啃完那些”以前的 Sonnet 会半路停手”的复杂任务,提升集中在推理、工具调用、写代码和知识工作。价格上,Sonnet 5 给出每百万 token 输入 2 美元、输出 10 美元的限时尝鲜价,8 月后回到 Sonnet 一贯的 3 美元 / 15 美元。

省钱这件事把次旗舰的价钱压到旗舰六七成的水平、性能却几乎不掉,瞄准的是企业那本越来越紧的算力账。智能体要反复调用模型、动辄烧掉成百上千次推理,单价每降一截,能跑得起的场景就多一批。对正在选型的开发者,这把账算法改了:以前为复杂智能体任务默认上 Opus,现在多了一个便宜一截、活儿基本干得动的选项,要不要为那最后几个百分点的性能多掏一倍多的钱,得重新掂量。

signal: 当次旗舰能干八九成旗舰的活、价钱只要六七成,贵的那一档就得自己证明溢价。