周三,Anthropic 正式发布 Claude Haiku 5.5,称其为公司迄今最高效、成本最低且性能最强的小型语言模型。该版本专为高并发任务设计,如文档摘要、数据库查询,以及对延迟敏感的应用,例如实时客户支持与网页自动化操作。
对于集成 Claude 的开发者,若提示词长度在 10 万 token 以内,输入费用为每百万 token 0.10 美元,输出为 0.50 美元。这一费率与 OpenAI 新推出的 GPT-6 Luna 相当。相较此前 Haiku 4.5 的 1 美元和 5 美元标准,新费率降幅达 90%;超过限额的请求也减少 50%。由于约 90% 的实际调用均低于此阈值,且新版本文本分段更细,整体平均节省比例接近 75%。
尽管主要面向重复性、非创造性工作,但实测数据表明其能力远超预期。在 OSWorld 2.1 测试中(评估 AI 通过多步骤操作真实系统的能力),Haiku 5.5 成功率达 72.4%,显著高于 GPT Luna 的 48.9%。在 Terminal-Bench 4.0 中,要求代理自主执行专业命令,首次成功率为 39.2%,远超 Luna 的 16.4% 和前代 Haiku 4.5 的 0%。相比之下,旗舰模型 Sonnet 5.5 得分为 70.6%。
在逻辑推理测试中,模型响应极快,几乎瞬时完成,但曾出现错误答案,提示用户需谨慎对待其输出内容。
根据 GDPval-AA v2.1 测试(基于国际象棋 Elo 体系评估 44 种职业任务表现),Haiku 5.5 获得 1620 分,优于 Luna 的 1437 分与旧版 735 分。这是首款支持“努力程度”调节的 Haiku 模型,允许用户在响应速度与回答深度之间灵活权衡。
同时,Anthropic 还将 Sonnet 5.5 的缓存读取价格下调至每百万 token 0.10 美元,针对已处理文本提供折扣,进一步优化长期使用成本。
Haiku 5.5 的发布紧随 Opus 5.5(9月22日)与 Sonnet 5.5(9月28日)之后,标志着 Anthropic Claude 5.5 系列收官。该系列发布背景是 CEO Dario Amodei 呼吁行业放缓模型能力跃升步伐。
目前,claude-haiku-5-5 已在 Claude 官网及 AWS、Google Cloud、Microsoft Azure 平台上线。为吸引用户,Anthropic 同步推出月度 API 额度优惠:Max 5x 用户可获 100 美元额度,Max 20x 为 200 美元,团队计划用户则可共享最高 500 美元的免费配额。