06:00
Claude Sonnet 5.5 发布:Terminal-Bench 4.0 从 10.3% 跳到 70.6%
Claude Sonnet 5.5 launches with 70.6% on Terminal-Bench 4.0
Anthropic 发布 Claude 5.5 家族的第二款模型 Sonnet 5.5,定位为 Opus 5.5 更快、更便宜的补充:输出速度提升 30% 以上,同一任务成本最多降低 30%。在 agentic coding 评测 Terminal-Bench 4.0 上,Sonnet 5.5 得 70.6%,而 Sonnet 5 只有 10.3%;FrontierCode、CursorBench、GDPval-AA、OSWorld 2.1 等评测同样提升,部分项目已接近 Opus 5.5。定价与 Sonnet 5 持平(输入 $2、输出 $10 / 每百万 token,缓存读取 $0.20),但完成同一任务所需 token 更少。这也是首个带网络安全防护与降级的 Sonnet 模型:高风险 cyber 请求会回退到 Sonnet 5,并首次加入阻止推理提取的蒸馏分类器和 preserved thinking。适合关注模型选型与 agent 编码成本的工程师。