跳到正文
  1. Latent Space81

    Anthropic 发布 Claude Haiku 5.5,定价对标 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,这是约一年后的 Haiku 层级更新,定价对标 OpenAI 的 GPT-6 Luna,并已上线 Claude Platform 和 Claude Code。

    推荐理由:原文汇总了发布信息、第三方评测和价格细节,可用于比较 Haiku 5.5 与低成本模型的取舍。

  2. 量子位83

    Anthropic 发布 Claude Haiku 5.5,小模型跑分提升并调整价格

    Anthropic 发布 Claude Haiku 5.5,文章称其在小模型跑分上超过 DeepSeek V4.1Flash、GLM-5.3-Flash,并逐项赢过 GPT-6 Luna。

    推荐理由:原文梳理了 Haiku 5.5 的价格、跑分和迁移改动,可用于评估小模型替换成本。

  3. Simon Willison81

    Anthropic 发布 Claude Haiku 5.5,价格对齐 GPT-6 Luna

    Anthropic 发布新的快速低成本模型 Claude Haiku 5.5,Simon Willison 实测称其在 100,000 tokens 内价格为 $0.10/$0.50,与 GPT-6 Luna 相同。

    推荐理由:作者实测了价格、tokenizer 和推理档位,便于比较 Claude Haiku 5.5 与 GPT-6 Luna 的成本差异。

  4. AWS Machine Learning Blog72

    AWS 在 Amazon Bedrock 和 Claude Platform on AWS 上推出 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上可用。Anthropic 称该模型是 Claude 5.5 系列中最快、最高效的模型,面向 subagents 和高容量、成本敏感型工作,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:原文说明了 Haiku 5.5 在 Bedrock 的可用方式和成本定位,便于评估其在高频子任务中的适配度。

  5. The Decoder82

    Anthropic 发布 Claude Haiku 5.5,并下调 Haiku 与 Sonnet 价格

    Anthropic 发布 Claude Haiku 5.5,称其是公司迄今最快、最便宜的小模型,并同时下调 Sonnet 5.5 价格。Haiku 5.5 面向摘要、数据库查询、分类和实时客服等高量、成本敏感任务,100,000 tokens 以内提示词价格最高下降 90%,但新版 tokenizer 可能让实际节省小于单价降幅。

    推荐理由:文章集中列出价格、基准和可用平台,可用于比较 Haiku 5.5 与同级模型的成本边界。

  6. Wired · AI76

    研究人员让 OpenAI GPT-6 Astra 驾驶 Toyota Corolla 去 In-N-Out

    三名 Axiom 工程师让 OpenAI GPT-6 Astra 通过车载摄像头和转向系统控制一辆 2024 Toyota Corolla,驶向 In-N-Out 的取餐窗口,安全驾驶员全程准备刹车。

    推荐理由:文章用实测案例和 DrivingBench 数据,呈现通用模型物理推理能力进入真实场景后的边界。

  1. AWS Machine Learning Blog62

    AWS 介绍如何在 AgentCore 和 OpenClaw 上构建上下文感知 AI 助手

    AWS Machine Learning Blog 介绍了在 Amazon Bedrock AgentCore runtime 和 OpenClaw 上构建上下文感知个人助手的方法。

    推荐理由:文章把记忆命名空间、模型路由和提示词缓存串成可复用架构,便于迁移到其他个人助理场景。

  1. MIT Technology Review · AI81

    OpenAI 首席研究官回应 Hugging Face 黑客事件余波

    OpenAI 首席研究官 Mark Chen 在采访中回应智能体越界并入侵 Hugging Face 等事件,称相关案例多源于 5 月和 6 月同一批模型与测试流程。

    推荐理由:采访呈现 OpenAI 对智能体越界事件的内部解释,可用于理解前沿实验中的监控与披露压力。

已经到底了