一句话重点
Anthropic 在 2026 年 9 月 28 日推出 Claude Sonnet 5.5,是 Claude 5.5 系列的第二款(第一款是 Opus 5.5)。Anthropic 说它比 Sonnet 5 明显进步,输出快 3 成以上,多数工作每个任务最多省 3 成成本,价格跟 Sonnet 5 一样。 API 价格是每百万 token 输入 2 美元、输出 10 美元,缓存读取 0.20 美元,model ID 是 claude-sonnet-5-5。Anthropic 把它定位成 Opus 5.5 的“更快、更低成本”搭档,主要用在范围明确的日常工作、修 bug,以及制作文档、演示文稿和电子表格。
这次升级重点
一般用户最该知道的是这几点:
- 更快、更省 token:Anthropic 表示输出比 Sonnet 5 快 3 成以上,是截至 9 月 28 日公告时最快的 Sonnet。价格跟 Sonnet 5 一样,但同样的工作需要的 token 少很多,官方测试中每个任务最多比 Sonnet 5 便宜 3 成。
- 编程大幅进步:在 Terminal-Bench 4.0(让 AI 在终端里完成多步骤任务的测试),Sonnet 5 是 10.3%,Sonnet 5.5 是 70.6%(Anthropic 公布的数据)。
- 知识工作接近 Opus 5.5:在 GDPval-AA(涵盖 44 种职业的真实工作任务测试),Sonnet 5.5 是 1844 分,Opus 5.5 是 1846 分。
- 写得更清楚,对设计也更有眼光:Anthropic 说它跟 Opus 5.5 一样,比上一代写得更清楚。内部测试里,官方给它一家上市公司的季报数据、业绩说明会逐字稿与演示文稿模板,请它做 10 页运营回顾,两位专家认为第一版就能直接发出去。Slack 的工程师也提到,没改任何 prompt,Slackbot 几乎所有离线评测都比 Sonnet 5 好,步骤也更少,输出 token 少约 14%。
- 默认思考力度不同:Claude 回答前会先“想”一下,想得越深通常越准,也越慢越贵,这个深度叫 effort(力度)。Claude Code 和 Claude 的 App 默认 Medium,Claude Platform(API)默认 High。
- 知识截止在 2026 年 6 月:模型页写它可靠的知识大约到 2026 年 6 月,比 9 月 28 日上线早了 3 个月,问最新消息时要注意。
- Haiku 5.5 在后面:Anthropic 在 9 月 28 日的公告说,Haiku 5.5 会在“未来几周”加入 Claude 5.5 系列,主打大量、在乎成本的应用程序。
跑分怎么看

跑分是什么?拿同一组任务让不同模型做,再按表现打分数,分数越高代表那项工作做得越好。
表中八项测试,Sonnet 5.5 只有 Terminal-Bench 4.0 拿下最高(70.6%,Opus 5.5 是 66.4%)。这里要留意,Anthropic 在脚注说明 Opus 5.5 的数字是它开到 Xhigh 力度的最高分。其他七项都是 Opus 5.5 领先,多数差距在 1 到 3 个百分点左右,例如 CursorBench 4.0 是 55.5% 对 57.8%,OSWorld 2.1(电脑操作测试)是 80.1% 对 81.8%,GDPval-AA 只差 2 分。差距最大的是 FrontierCode 1.1 的 Max 力度分数。
FrontierCode 1.1 那一行有两个 Sonnet 5.5 分数:Max 力度 46.2%,Xhigh 力度 52.1%,开到最高反而比较低。Anthropic 在脚注解释,FrontierCode 看的是“这次改动能不能不经人工修改就合并”,超出任务范围的修改会被扣分。Max 力度下,Sonnet 5.5 比较常启动 Claude Code 的代码审查功能,那会把审查分给很多子 agent,Cognition 检查的两个案例里造成超时或多做了范围外的修改,所以分数较低。
Anthropic 自己也提醒:Sonnet 5.5 在几项测试里开到 Max 力度可以跟 Opus 5.5 相当,但跑分只反映能力的一面,根据他们自己与外部测试者的经验,“Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment”(Opus 5.5 在需要持续判断的复杂、开放式工作上仍明显较强)。
Sonnet 5.5 还是 Opus 5.5?

这张图把每个模型在不同力度下的分数,对照每次尝试的成本画出来,越靠左上角代表花得少、分数高。照 Anthropic 图表读起来:同样花费下,Opus 5.5 的分数比较高,Sonnet 5.5 要开到最高力度才超过 Opus。Sonnet 5 最好的成绩大约只有 10%,Sonnet 5.5 在低力度就远远超过它。
Anthropic 自己的说法是,Sonnet 5.5 在较低力度最能搭配 Opus 5.5,因为每个任务成本更低;力度拉高时,它可以在相近的成本做出相近的表现。
第三方评测的结果也指向同一个方向(截至 2026 年 9 月 29 日查询):
- Artificial Analysis:同样的力度下,Opus 5.5 的 Intelligence Index 都比较高,例如 Claude Code 与 App 默认的 Medium 是 41 对 51。Sonnet 5.5 要开到 Max 才接近(56 对 58,排第 2 名),但这时它每个任务用掉约 19.3 万个输出 token,比 Opus 5.5 多约 6 成,每个任务成本 7.60 美元,比 Opus 5.5 的 5.98 美元还高。
- Vals.ai Index:Sonnet 5.5 是 69.2%,Opus 5.5 是 69.7%,几乎打平(页面标示 9 月 27 日更新,未标明力度)。同一个网站的 Terminal-Bench 4.0 则是 Opus 5.5 较高(61.6% 对 53.0%),跟官方表的方向相反。
- Arena:截至 2026 年 9 月 29 日,Sonnet 5.5 在各排行榜都还没有名次。
给新手的实用建议:例行、目标明确的工作,或是讲究速度的场合,用 Sonnet 5.5 默认力度。复杂、开放式、需要大量判断的工作,交给 Opus 5.5。把 Sonnet 开到最高力度去追 Opus 的成绩,成本不会比较低。
价格与方案
| 项目(每百万 token) | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 输入 | $2 | $4 |
| 输出 | $10 | $20 |
| 缓存写入(5 分钟) | $2.50 | $5 |
| 缓存读取 | $0.20 | $0.20 |
Batch API 输入输出各打 5 折。单位是“每百万 token”(MTok)。打个比方,一个任务用了 100 万个输入 token、又生成 100 万个输出 token,用 Sonnet 5.5 是 12 美元(2 加 10),用 Opus 5.5 是 24 美元(4 加 20)。缓存读取指重复使用同一段内容时的收费,通常比第一次输入便宜很多。
谁能用:
- claude.ai 方案:claude.com/pricing(截至 2026 年 9 月 29 日)把 Sonnet 在 Free、Pro、Max、Team、Enterprise 都标成“Yes”,但价格页没有写各方案用的是哪个 Sonnet 版本,所以无法确认免费版跑的是 Sonnet 5.5。
- API 与云平台:Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry 都有。
- GitHub Copilot:Pro、Pro+、Max、Business、Enterprise 用户可用,GitHub 在 9 月 28 日公告会逐步开放。
- Claude Code:根据 2.1.284 版更新记录,Sonnet 5.5 已是 Anthropic API 上的默认 Sonnet 模型。
要注意的是,上面的价目表是给开发者用 API 接入时看的计费方式。如果你是订阅 claude.ai 的 Pro、Max 这类方案,是每月固定收费,不用自己算 token,只是用量有上限。两种付费方式不一样,别搞混了。
开发者要注意的变更
以下是给有在写代码、接 API 的开发者看的,一般用户可以跳过:
- thinking 关不掉:要关掉前置思考,改用
between_tools,只能搭配 low、medium、high 力度,xhigh 或 max 会返回 400 错误。 - 强制指定工具会出错:以前可以强制要求模型一定要调用某个工具,现在会返回错误。
- thinking blocks 绑定模型与对话:思考记录绑定产生它的模型与那一条对话,也只能在产生它的账号或关联账号使用。多数人不会发现差别,跨账号搬对话、或在 Claude Code 中途换账号时才会碰到。
- 旧版 computer use 工具被拒:在 Claude API 和 Google Cloud 上,
computer_20251124不再接受。 - advisor 工具限制:advisor 工具不接受 Opus 4.8、Opus 4.7、Sonnet 5 当顾问。
另外,把 sampling 参数(temperature、top_p、top_k)设成非默认值,或使用 assistant prefill、thinking budget,也都会返回 400。effort 等级重新校准过,同一个等级的思考量跟 Sonnet 5 不同,升级前请重测。根据 9 月 29 日查询的迁移指南,Amazon Bedrock 上的 Sonnet 5.5 还不支持 structured outputs。
安全重点
Anthropic 每次发新模型都会公布系统卡,说明做过哪些安全测试。这次的重点如下,以系统卡与官方公告的说法为准:
- 第一款有网络安全防护的 Sonnet:因为网络安全能力接近 Opus 5,Sonnet 5.5 是第一款带着网络安全防护上线的 Sonnet。日常写代码、找 bug 不受影响,但风险较高的网络安全任务会明显改由 Sonnet 5 回答。
- 防止能力被“蒸馏”:蒸馏攻击(distillation)是用大量假账号,大规模榨取模型的能力。Sonnet 5.5 是第一款配有安全分类器、拦下“提取推理过程”请求的 Sonnet。
- 更能抵抗提示注入:系统卡说它是目前最能抵抗提示注入(prompt injection,在内容里藏恶意指令)的 Sonnet,特别是在编程与浏览器操作场景。
- 很少尝试逃出沙盒:在 Anthropic 的沙盒封闭评测中,它尝试逃出的频率接近表现最好的 Opus 5.5,Anthropic 也说,它是自家所有模型里最不会去试探容器限制的。
- 官方自己列的退步:在追踪、监控类等部分多轮对话测试出现退步;思考内容比许多先前模型更难读懂;电脑操作环境中对有害任务的拒绝率与 Opus 5.5 相当,但比部分更早的模型差。
- 门槛:系统卡表示没有跨过任何新的 RSP(Responsible Scaling Policy,负责任扩展政策)门槛。
小企鹅的总结
受益最直接的有三种人:通过 API 用 Sonnet 5 的人,同样价格拿到更快、更省 token 的新版;想要速度的 Claude Code 用户,Claude Code 2.1.284 已经把 Anthropic API 上的默认 Sonnet 换成 Sonnet 5.5;常做演示文稿与文档的人,官方特别强调这块。
需要长时间判断、方向不明确的工作,还是留在 Opus 5.5。开发者升级前记得重测 effort 等级,也留意上面那几个破坏性变更。免费版到底跑哪个 Sonnet 版本,价格页没写,想确认可以直接看 App 里的模型菜单。
延伸阅读
参考资料
封面图片来源:Anthropic(anthropic.com/claude-sonnet-5-5)
- Anthropic 官方公告:https://www.anthropic.com/claude-sonnet-5-5
- Claude Sonnet 5.5 System Card:https://www.anthropic.com/claude-sonnet-5-5-system-card
- Model overview:https://platform.claude.com/docs/en/models/sonnet-5-5/overview
- What’s new in Sonnet 5.5:https://platform.claude.com/docs/en/models/sonnet-5-5/whats-new-sonnet-5-5
- Migration guide:https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide
- API pricing:https://platform.claude.com/docs/en/about-claude/pricing
- Plans pricing:https://claude.com/pricing
- Claude Code CHANGELOG:https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md
- GitHub Changelog:https://github.blog/changelog/2026-09-28-claude-sonnet-5-5-in-github-copilot/
- Artificial Analysis:https://artificialanalysis.ai/articles/claude-sonnet-5-5
- Vals.ai Index:https://www.vals.ai/benchmarks/vals_index
本文为 AI 模型 API 计费与订阅方案的消费信息,不涉及证券或投资建议。实际定价以 Anthropic 官方最新公告为准,本文信息截至 2026 年 9 月 29 日,可能已经过时。