Anthropic 发布 Claude Haiku 5.5,定价对标 GPT-6 Luna
[AINews] Claude Haiku 5.5 — better than GPT-6 Luna at the same pricing
Anthropic 发布 Claude Haiku 5.5,这是约一年后的 Haiku 层级更新,定价对标 OpenAI 的 GPT-6 Luna,并已上线 Claude Platform 和 Claude Code。
原文汇总了发布信息、第三方评测和价格细节,可用于比较 Haiku 5.5 与低成本模型的取舍。
距离 Anthropic 推出 Haiku 4.5已经大约一年了。随着 Sonnet、Opus 和 Fable 接连升级到 5.5,它似乎有些被遗忘了,尤其是 OpenAI 推出 Luna 6、Astra 和 Sol 6 之际。
好了,它终于来了,而且是一次令人欣喜的更新。更多内容请见下方摘要。
2026/10/06-2026/10/7 的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter 账号,没有查看其他 Discord。AINews 网站可搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择订阅或退订不同频率的邮件!
AI Twitter 摘要
头条:Anthropic 发布 Claude Haiku 5.5
发生了什么
Anthropic 发布了 Claude Haiku 5.5,这是近一年来首次更新 Haiku 系列。其定价与 OpenAI 的 GPT-6 Luna 看齐,Anthropic 还在同一天下调了 Sonnet 5.5 和订阅计划的价格。
发布前的信号。 @scaling01 在公告发布前发文称“Haiku 5.5 日快乐”。@kimmonismus 表示,该模型已出现在 Claude Code 更新中,并预测定价会“看齐 Luna”。随后,他在官方帖子发布前公布了价格(@kimmonismus),并在正式上线时予以确认(@kimmonismus)。
正式发布。 @claudeai 和 @AnthropicAI 称它是“我们迄今发布的最便宜、最快、能力最强的小型模型”,平均运行成本比 Haiku 4.5 低约 75%。
可用性和预期用途。它现已在 Claude Platform 和 Claude Code 中上线(@ClaudeDevs)。Anthropic 将其定位为与 Opus 5.5 或 Sonnet 5.5 搭配使用的子代理,适用于摘要、上下文压缩和数据库查询等高吞吐量、对成本敏感的工作。@mikeyk 将这种分工描述为:“Opus 负责深度思考,Haiku 负责高吞吐量工作。”
分级定价(@ClaudeDevs):
提示长度输入 / 输出(每 1M 个 token)缓存读取(每 1M 个 token)低于 100K 个 token$0.10 / $0.50$0.01高于 100K 个 token$0.50 / $2.50$0.05
Sonnet 5.5 降价。缓存读取价格从每 1M 个 token $0.20 降至 $0.10,降幅为一半。Anthropic 表示,这使 Sonnet 5.5 在大多数长时间运行或代理式工作中的成本降低约 20%(@claudeai)。
订阅用户可获 API 额度。现在,Max 5x($100)、Max 20x($200)和 Team(最高 $500,可共享)方案均包含每月 Claude Platform API 额度。这些额度适用于任何模型,包括 Haiku 5.5,也可用于第三方运行框架(@ClaudeDevs)。
同日 SDK 更新。Python 和 TypeScript 版 Claude SDK 现已内置计算机操作和浏览器操作工具集。SDK 会运行操作循环,并将点击和按键操作发送给来自 browser_use、Browserbase、E2B 或 Daytona 的驱动程序,因此开发者不必再自行编写该循环(@ClaudeDevs,快速入门)。
首日合作伙伴上线情况:
Cursor:@cursor_ai 声称,对于较短请求,其成本“比 Haiku 4.5 低 10 倍”,并发布了 CursorBench 对比结果(@cursor_ai)。
VS Code 中的 GitHub Copilot:@code 表示,它“在许多编程任务中达到 Claude Sonnet 5 的水平,同时使用的 token 和步骤更少”。
Devin:@cognition 报告称,Devin 在 FrontierCode 1.1 上取得 58.4% 的成绩,领先 Sonnet 5,而每项任务的成本约为其八分之一;并建议将其作为 Opus 5.5 在 Fusion 中的“副手”。
Arena:已加入 Agent Arena、Code Arena WebDev、Text、Document 和 Vision,评分待公布(@arena)。
OpenDocRouter:同日已加入(详情见下文)。
独立评测:Artificial Analysis
@ArtificialAnlys 发布了最详尽的第三方数据(各项评测细分、对比页面)。
智能指数:43,最高 effort 设置下的成绩,比上一代 Haiku 高 26 分。
略高于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)。
与 Kimi K3(44)相当,后者是一款拥有 2.8T 参数的开放权重模型。
最高 effort 设置下,比 Claude Sonnet 5.5(56)低 13 分。
新增控制选项。 这是首款支持 Anthropic effort 设置和自适应思考的 Haiku。
Token 用量是主要缺点。
最高 effort 设置下,每项指数任务约使用 162k 个输出 token,约为 GPT-6 Luna 最高 effort 设置下(约 50k)的 3 倍。
从 xhigh 提升到 max,成绩增加 2 分,但 token 用量约增至 1.8 倍。
即使成绩相同,它的输出仍更冗长:Haiku 5.5 在 high effort 设置下以约 55k 个 token 得到 38 分;Luna 在 max 设置下以约 50k 个 token 得到 38 分。在较低 effort 设置下,差距会扩大。
成本数据暂定。 Artificial Analysis 尚未纳入超过 100K 个 token 后价格上涨 5 倍的情况。每项任务的成本数据之后会公布。
AA-Briefcase(私有智能体知识工作评测):1578 Elo。高于 Kimi K3 和 GLM-5.3,与最高设置下的 Muse Spark 1.3 相当。
Terminal-Bench 4.0:33%,高于 Haiku 4.5 的 0%。
与 GLM-5.3 Flash 持平。
高于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。
知识与幻觉(AA-Omniscience):
模型准确率幻觉率Haiku 5.536%40%Gemini 3.8 Flash55%55%GPT-6 Luna44%77%
Haiku 准确率较低,部分原因是它更愿意承认自己不知道。
AutomationBench-AA:35%,而 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。发布前的安全漏洞导致模型过度拒答。Anthropic 正在修复,Artificial Analysis 将重新进行评测,并预计分数会提高。
规格:
上下文长度为 1M token,高于 Haiku 4.5 的 200k。
输入支持文本和图像,输出为文本。
5 分钟缓存写入费用为每 1M 个 token $0.125(超过 100K 后为 $0.625)。
其他基准测试成绩(多为厂商提供或转述)
@ShayneRedford 总结了 Anthropic 报告的成绩提升:
OSWorld(计算机使用):15% → 72%。
TerminalBench:0% → 39%。这与 Artificial Analysis 在 Terminal-Bench 4.0 上独立测得的 33% 不同。
知识工作和推理能力提升 10–50%。
在上述大多数项目中胜过 Luna。
上下文长度为 1M,最大输出 token 约为 12k。
@alexalbert__(Anthropic)强调,Haiku 4.5 于 2025 年 10 月 15 日发布,因此对比跨度不到一年。
@TheRundownAI 报告称,它“在多项基准测试中”胜过 GPT-6 Luna。
文档解析(ParseBench 独立评测):
@LoganMarkewich:总体上与 Luna 接近,表格处理略好,图表理解较弱。
@jerryliu0:每 1,000 页约 $1.2。以这个价格而言,表格处理和阅读顺序表现不错;图表、语义格式和边界框处理较弱。
轶闻:
@simonw 撰写了定价说明,并进行了他的“骑自行车的鹈鹕”测试。他表示,这比 Haiku 4.5“好太多了”,而后者的价格贵 10 倍(对比)。
@AI_Screening 表示,在一次 Three.js 斑马模拟中,Haiku 5.5“碾压”了 Luna(单次提示,并非系统性测试)。
观点与反应
看好
@kimmonismus:“比 GPT-6-Luna 好得多,接近 Sonnet 5.5……便宜又聪明。”
@theo 喜欢分层定价:对 100K 个 token 以下的请求收取五分之一的价格,“让人非常清楚这个模型适合做什么”。他还表示,看到 Anthropic 的模型“在成本/智能图表上远远偏左”令人印象深刻(@theo),并在直播中介绍了这次发布(@theo)。
@draecomino:“Haiku 在最大努力模式下的表现就像前沿模型。”
@kipperrii 认为,如今小型廉价模型能完成“大量有用的事情”,因此变得更加重要。
@scaling01(“便宜得离谱”)随后又表示(@scaling01):“5.5 系列模型表现不错。”
@NotTomBrown(“小而强大”)和来自 Anthropic 的 @edwinarbus 都发布了庆祝动态。
竞争格局
这次发布普遍被视为瞄准 OpenAI 的 GPT-6 Luna:“GPT-6 Luna 完了”(@dejavucoder),“该碾压 Luna 了”(@scaling01)。
@kimmonismus 将 Sonnet 缓存读取价格下调解读为 Anthropic 向 OpenAI 施压。谈到 API 额度时,他补充道:“OpenAI,该你了”(@kimmonismus)。
@teortaxesTex 表示,Anthropic 现在“拥有所有实验室中最全面的产品阵容”(Haiku/Sonnet/Opus/Fable 加上 Mythos),而 OpenAI 则有 Luna/Sol/Astra。他仍认为 Anthropic“对产品没那么上心”,并将此视为它在 2026 年一直拥有很大余裕的表现。
ThursdAI 的 @altryne 对中间档定位提出质疑:“Opus 价格昂贵时,Sonnet 才说得通。”节目计划介绍 Haiku 5.5(@thursdai_pod)。
注意事项(主要来自数据,而非直言不讳的批评者)
宣传中的价格可能夸大了实际节省幅度。
高 token 用量(最大努力模式下约为 Luna 的 3 倍)抵消了部分单 token 折扣。
超过 100K token 的提示需支付 5 倍费用,这对长上下文智能体循环很重要。
这两种影响可能解释了为何 Cursor 所说的“短请求便宜 10 倍”与 Anthropic 所说的“平均便宜 75%”有所不同。
事实回忆能力弱于 Gemini 3.8 Flash 和 Luna。
过度拒绝的 bug目前拉低了自动化评分。
尚无基准测试:Arena 评分仍待公布,独立的单任务成本数据则有待分层定价支持。
背景
Haiku 4.5 自 2025 年 10 月以来一直是 Anthropic 的小型模型。此后,OpenAI 的 GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash 和 DeepSeek V4.1 Flash 一直在低成本市场展开竞争。
Haiku 5.5 的标价与 Luna 完全相同。它新增了努力程度控制和 1M 上下文。
它被明确定位为多模型智能体框架中的廉价工作模型:Claude Code 子智能体、Devin Fusion、Copilot 子智能体,以及压缩或摘要步骤。
Anthropic 同时下调了 Sonnet 的缓存读取价格,并提供订阅制 API 额度,协同推动智能体经济性。这一举措正值关于 token 账单的更广泛讨论之际(见下文 @theo)。
其他新闻
OpenAI 的 722 篇数学手稿:规模、效率与影响
来源:Latent Space · latent.space