跳到正文
Latent Space·· 3 小时前精选AI 评分81

Anthropic 发布 Claude Haiku 5.5,定价对标 GPT-6 Luna

[AINews] Claude Haiku 5.5 — better than GPT-6 Luna at the same pricing

AI 导读

Anthropic 发布 Claude Haiku 5.5,这是约一年后的 Haiku 层级更新,定价对标 OpenAI 的 GPT-6 Luna,并已上线 Claude Platform 和 Claude Code。

推荐理由

原文汇总了发布信息、第三方评测和价格细节,可用于比较 Haiku 5.5 与低成本模型的取舍。

正文 · AI 翻译

距离 Anthropic 推出 Haiku 4.5已经大约一年了。随着 Sonnet、Opus 和 Fable 接连升级到 5.5,它似乎有些被遗忘了,尤其是 OpenAI 推出 Luna 6、Astra 和 Sol 6 之际。

好了,它终于来了,而且是一次令人欣喜的更新。更多内容请见下方摘要。

2026/10/06-2026/10/7 的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter 账号,没有查看其他 Discord。AINews 网站可搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择订阅或退订不同频率的邮件!


AI Twitter 摘要

头条:Anthropic 发布 Claude Haiku 5.5

发生了什么

Anthropic 发布了 Claude Haiku 5.5,这是近一年来首次更新 Haiku 系列。其定价与 OpenAI 的 GPT-6 Luna 看齐,Anthropic 还在同一天下调了 Sonnet 5.5 和订阅计划的价格。

  • 发布前的信号。 @scaling01 在公告发布前发文称“Haiku 5.5 日快乐”。@kimmonismus 表示,该模型已出现在 Claude Code 更新中,并预测定价会“看齐 Luna”。随后,他在官方帖子发布前公布了价格(@kimmonismus),并在正式上线时予以确认(@kimmonismus)。

  • 正式发布。 @claudeai 和 @AnthropicAI 称它是“我们迄今发布的最便宜、最快、能力最强的小型模型”,平均运行成本比 Haiku 4.5 低约 75%。

  • 可用性和预期用途。它现已在 Claude Platform 和 Claude Code 中上线(@ClaudeDevs)。Anthropic 将其定位为与 Opus 5.5 或 Sonnet 5.5 搭配使用的子代理,适用于摘要、上下文压缩和数据库查询等高吞吐量、对成本敏感的工作。@mikeyk 将这种分工描述为:“Opus 负责深度思考,Haiku 负责高吞吐量工作。”

  • 分级定价(@ClaudeDevs):

    提示长度输入 / 输出(每 1M 个 token)缓存读取(每 1M 个 token)低于 100K 个 token$0.10 / $0.50$0.01高于 100K 个 token$0.50 / $2.50$0.05

  • Sonnet 5.5 降价。缓存读取价格从每 1M 个 token $0.20 降至 $0.10,降幅为一半。Anthropic 表示,这使 Sonnet 5.5 在大多数长时间运行或代理式工作中的成本降低约 20%(@claudeai)。

  • 订阅用户可获 API 额度。现在,Max 5x($100)、Max 20x($200)和 Team(最高 $500,可共享)方案均包含每月 Claude Platform API 额度。这些额度适用于任何模型,包括 Haiku 5.5,也可用于第三方运行框架(@ClaudeDevs)。

  • 同日 SDK 更新。Python 和 TypeScript 版 Claude SDK 现已内置计算机操作和浏览器操作工具集。SDK 会运行操作循环,并将点击和按键操作发送给来自 browser_use、Browserbase、E2B 或 Daytona 的驱动程序,因此开发者不必再自行编写该循环(@ClaudeDevs,快速入门)。

  • 首日合作伙伴上线情况:

    • Cursor:@cursor_ai 声称,对于较短请求,其成本“比 Haiku 4.5 低 10 倍”,并发布了 CursorBench 对比结果(@cursor_ai)。

    • VS Code 中的 GitHub Copilot:@code 表示,它“在许多编程任务中达到 Claude Sonnet 5 的水平,同时使用的 token 和步骤更少”。

    • Devin:@cognition 报告称,Devin 在 FrontierCode 1.1 上取得 58.4% 的成绩,领先 Sonnet 5,而每项任务的成本约为其八分之一;并建议将其作为 Opus 5.5 在 Fusion 中的“副手”。

    • Arena:已加入 Agent Arena、Code Arena WebDev、Text、Document 和 Vision,评分待公布(@arena)。

    • OpenDocRouter:同日已加入(详情见下文)。

独立评测:Artificial Analysis

@ArtificialAnlys 发布了最详尽的第三方数据(各项评测细分、对比页面)。

  • 智能指数:43,最高 effort 设置下的成绩,比上一代 Haiku 高 26 分。

    • 略高于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)。

    • 与 Kimi K3(44)相当,后者是一款拥有 2.8T 参数的开放权重模型。

    • 最高 effort 设置下,比 Claude Sonnet 5.5(56)低 13 分。

  • 新增控制选项。 这是首款支持 Anthropic effort 设置和自适应思考的 Haiku。

  • Token 用量是主要缺点。

    • 最高 effort 设置下,每项指数任务约使用 162k 个输出 token,约为 GPT-6 Luna 最高 effort 设置下(约 50k)的 3 倍。

    • 从 xhigh 提升到 max,成绩增加 2 分,但 token 用量约增至 1.8 倍。

    • 即使成绩相同,它的输出仍更冗长:Haiku 5.5 在 high effort 设置下以约 55k 个 token 得到 38 分;Luna 在 max 设置下以约 50k 个 token 得到 38 分。在较低 effort 设置下,差距会扩大。

  • 成本数据暂定。 Artificial Analysis 尚未纳入超过 100K 个 token 后价格上涨 5 倍的情况。每项任务的成本数据之后会公布。

  • AA-Briefcase(私有智能体知识工作评测):1578 Elo。高于 Kimi K3 和 GLM-5.3,与最高设置下的 Muse Spark 1.3 相当。

  • Terminal-Bench 4.0:33%,高于 Haiku 4.5 的 0%。

    • 与 GLM-5.3 Flash 持平。

    • 高于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。

  • 知识与幻觉(AA-Omniscience):

    模型准确率幻觉率Haiku 5.536%40%Gemini 3.8 Flash55%55%GPT-6 Luna44%77%

    Haiku 准确率较低,部分原因是它更愿意承认自己不知道。

  • AutomationBench-AA:35%,而 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。发布前的安全漏洞导致模型过度拒答。Anthropic 正在修复,Artificial Analysis 将重新进行评测,并预计分数会提高。

  • 规格:

    • 上下文长度为 1M token,高于 Haiku 4.5 的 200k。

    • 输入支持文本和图像,输出为文本。

    • 5 分钟缓存写入费用为每 1M 个 token $0.125(超过 100K 后为 $0.625)。

其他基准测试成绩(多为厂商提供或转述)

  • @ShayneRedford 总结了 Anthropic 报告的成绩提升:

    • OSWorld(计算机使用):15% → 72%。

    • TerminalBench:0% → 39%。这与 Artificial Analysis 在 Terminal-Bench 4.0 上独立测得的 33% 不同。

    • 知识工作和推理能力提升 10–50%。

    • 在上述大多数项目中胜过 Luna。

    • 上下文长度为 1M,最大输出 token 约为 12k。

  • @alexalbert__(Anthropic)强调,Haiku 4.5 于 2025 年 10 月 15 日发布,因此对比跨度不到一年。

  • @TheRundownAI 报告称,它“在多项基准测试中”胜过 GPT-6 Luna。

  • 文档解析(ParseBench 独立评测):

    • @LoganMarkewich:总体上与 Luna 接近,表格处理略好,图表理解较弱。

    • @jerryliu0:每 1,000 页约 $1.2。以这个价格而言,表格处理和阅读顺序表现不错;图表、语义格式和边界框处理较弱。

  • 轶闻:

    • @simonw 撰写了定价说明,并进行了他的“骑自行车的鹈鹕”测试。他表示,这比 Haiku 4.5“好太多了”,而后者的价格贵 10 倍(对比)。

    • @AI_Screening 表示,在一次 Three.js 斑马模拟中,Haiku 5.5“碾压”了 Luna(单次提示,并非系统性测试)。

观点与反应

看好

  • @kimmonismus:“比 GPT-6-Luna 好得多,接近 Sonnet 5.5……便宜又聪明。”

  • @theo 喜欢分层定价:对 100K 个 token 以下的请求收取五分之一的价格,“让人非常清楚这个模型适合做什么”。他还表示,看到 Anthropic 的模型“在成本/智能图表上远远偏左”令人印象深刻(@theo),并在直播中介绍了这次发布(@theo)。

  • @draecomino:“Haiku 在最大努力模式下的表现就像前沿模型。”

  • @kipperrii 认为,如今小型廉价模型能完成“大量有用的事情”,因此变得更加重要。

  • @scaling01(“便宜得离谱”)随后又表示(@scaling01):“5.5 系列模型表现不错。”

  • @NotTomBrown(“小而强大”)和来自 Anthropic 的 @edwinarbus 都发布了庆祝动态。

竞争格局

  • 这次发布普遍被视为瞄准 OpenAI 的 GPT-6 Luna:“GPT-6 Luna 完了”(@dejavucoder),“该碾压 Luna 了”(@scaling01)。

  • @kimmonismus 将 Sonnet 缓存读取价格下调解读为 Anthropic 向 OpenAI 施压。谈到 API 额度时,他补充道:“OpenAI,该你了”(@kimmonismus)。

  • @teortaxesTex 表示,Anthropic 现在“拥有所有实验室中最全面的产品阵容”(Haiku/Sonnet/Opus/Fable 加上 Mythos),而 OpenAI 则有 Luna/Sol/Astra。他仍认为 Anthropic“对产品没那么上心”,并将此视为它在 2026 年一直拥有很大余裕的表现。

  • ThursdAI 的 @altryne 对中间档定位提出质疑:“Opus 价格昂贵时,Sonnet 才说得通。”节目计划介绍 Haiku 5.5(@thursdai_pod)。

注意事项(主要来自数据,而非直言不讳的批评者)

  • 宣传中的价格可能夸大了实际节省幅度。

    • 高 token 用量(最大努力模式下约为 Luna 的 3 倍)抵消了部分单 token 折扣。

    • 超过 100K token 的提示需支付 5 倍费用,这对长上下文智能体循环很重要。

    • 这两种影响可能解释了为何 Cursor 所说的“短请求便宜 10 倍”与 Anthropic 所说的“平均便宜 75%”有所不同。

  • 事实回忆能力弱于 Gemini 3.8 Flash 和 Luna。

  • 过度拒绝的 bug目前拉低了自动化评分。

  • 尚无基准测试:Arena 评分仍待公布,独立的单任务成本数据则有待分层定价支持。

背景

  • Haiku 4.5 自 2025 年 10 月以来一直是 Anthropic 的小型模型。此后,OpenAI 的 GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash 和 DeepSeek V4.1 Flash 一直在低成本市场展开竞争。

  • Haiku 5.5 的标价与 Luna 完全相同。它新增了努力程度控制和 1M 上下文。

  • 它被明确定位为多模型智能体框架中的廉价工作模型:Claude Code 子智能体、Devin Fusion、Copilot 子智能体,以及压缩或摘要步骤。

  • Anthropic 同时下调了 Sonnet 的缓存读取价格,并提供订阅制 API 额度,协同推动智能体经济性。这一举措正值关于 token 账单的更广泛讨论之际(见下文 @theo)。

其他新闻

OpenAI 的 722 篇数学手稿:规模、效率与影响

阅读更多

来源:Latent Space · latent.space