Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,定价与 Sonnet 5 持平,但完成同等任务所需 token 更少,官方测算单任务成本最多降低30%,生成速度提升30%以上;在 Terminal-Bench 4.0 编程测试中得分从10.3%升至70.6%。
Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,是 Claude 5.5 家族的第二款模型,官方称是对 Sonnet 5 的明显升级:速度提升 30% 以上,多数任务成本最多降低 30%。Sonnet 5.5 定位为 Opus 5.5 更快、更便宜的补充——Opus 5.5 面向需要审慎判断的复杂工作,Sonnet 5.5 更擅长边界清晰的日常任务、修 bug,以及制作文档、幻灯片和表格。面向高并发场景的 Claude Haiku 5.5 也将在未来几周内加入这个家族。
在智能体编程测试 Terminal-Bench 4.0 上,Sonnet 5.5 得分 70.6%,Sonnet 5 只有 10.3%;在覆盖 44 个职业、9 大行业的真实工作测试 GDPval-AA 上,比 Sonnet 5 高出约 400 分,仅比 Opus 5.5 低两分,还是首个仅凭截图就打通《精灵宝可梦:红》的 Sonnet 模型。
编程方面,在 FrontierCode 高强度档位下,Sonnet 5.5 比同档位 Sonnet 5 高 10 分,单任务成本约为后者的十五分之一;在 CursorBench(取自真实 Cursor 编程会话)上,最高分与 Opus 5.5 相差约 2 分。早期测试者反馈它理解代码库更快,打包工具调用更多,步骤更少、成本更低。知识工作方面,官方举例:给它一家上市公司财报、会议纪要和幻灯片模板,要求生成 10 页经营回顾,两位专家认为初稿可直接发送。
Sonnet 5.5 定价与 Sonnet 5 相同:每百万输入 token 2 美元、每百万输出 token 10 美元,缓存读取每百万 token 0.20 美元。价格没变,但完成同等任务所需 token 更少,单任务成本最多降低 30%,速度也快 30% 以上。Claude Code 和官方应用默认把"effort"(推理强度)设为 Medium,Claude Platform 默认为 High——调低更快更省 token,适合日常任务;调高则让模型推理更久、更充分地核查结果。
在约 1850 个场景组成的自动化行为审计中,Sonnet 5.5 在对齐、抗滥用、诚实度等多数指标上优于或持平 Sonnet 5。网络安全能力已接近 Opus 5,因此成为首个上线网络安全防护机制的 Sonnet 模型,但只针对少数高风险请求,常规软件开发和大多数生命科学工作不受影响。
Anthropic 表示 Claude Haiku 5.5 将于未来几周内发布,届时 Claude 5.5 家族三款模型全部到位;实际使用中的成本节省幅度仍待更广泛验证。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断