Anthropic 发布 Claude Haiku 5.5,价格对齐 GPT-6 Luna
Anthropic 发布新的快速低成本模型 Claude Haiku 5.5,Simon Willison 实测称其在 100,000 tokens 内价格为 $0.10/$0.50,与 GPT-6 Luna 相同。
推荐理由:作者实测了价格、tokenizer 和推理档位,便于比较 Claude Haiku 5.5 与 GPT-6 Luna 的成本差异。
Anthropic 发布新的快速低成本模型 Claude Haiku 5.5,Simon Willison 实测称其在 100,000 tokens 内价格为 $0.10/$0.50,与 GPT-6 Luna 相同。
推荐理由:作者实测了价格、tokenizer 和推理档位,便于比较 Claude Haiku 5.5 与 GPT-6 Luna 的成本差异。
Google Research 介绍了一项关于 AI 辅助对专利律师专业能力影响的三个月现场实验,研究对象为 11 家知识产权律所的 133 名律师。实验随机开放当时未发布、现已属于 Gemini Notebook 的 Google Labs AI 专利写作助手,结果显示 AI 在 10 天和 90 天的起草任务中分别将评分提高 0.34 SD 和 0.38 SD。
推荐理由:这项现场实验区分了 AI 辅助产出与无辅助判断,提供了观察专业技能迁移的具体设计。
AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上可用。Anthropic 称该模型是 Claude 5.5 系列中最快、最高效的模型,面向 subagents 和高容量、成本敏感型工作,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:原文说明了 Haiku 5.5 在 Bedrock 的可用方式和成本定位,便于评估其在高频子任务中的适配度。
Anthropic 发布 Claude Haiku 5.5,称其是公司迄今最快、最便宜的小模型,并同时下调 Sonnet 5.5 价格。Haiku 5.5 面向摘要、数据库查询、分类和实时客服等高量、成本敏感任务,100,000 tokens 以内提示词价格最高下降 90%,但新版 tokenizer 可能让实际节省小于单价降幅。
推荐理由:文章集中列出价格、基准和可用平台,可用于比较 Haiku 5.5 与同级模型的成本边界。
NVIDIA 与 Microsoft 在旧金山活动上介绍了面向 Windows PC 的本地 AI Agent 方案,包括 RTX Spark 设备预订和 Microsoft Execution Containers 正式可用。
推荐理由:原文给出 Windows 本地智能体的硬件配置和系统基础设施,便于判断端侧 AI 工作流变化。
GitHub 介绍了与 Microsoft Applied Sciences 构建的微调 ModernBERT 分类器,用于把 push protection 扩展到非结构化密钥。
推荐理由:原文结合九个季度数据与新分类器细节,说明 GitHub 如何把密钥防护前移到代码推送链路。
Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。
推荐理由:原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。
Hugging Face 介绍 Nemotron 团队从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,在 IOI 2026 与 IMO 2026 达到金牌水平。
推荐理由:文章同时给出训练数据、推理流程和开源入口,可参考其将基础模型专门化到竞赛任务的方法。
OpenAI 宣布 GPT‑6 正在 ChatGPT 中全球推出,并配套 Intelligent UI。该更新称可提供更快响应,带来可直接探索和使用的视觉与交互体验。
推荐理由:原文说明了 GPT-6 在 ChatGPT 的全球上线形态,并点出可交互视觉体验这一使用变化。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间。该模型基于 Gemma 4 架构,采用 Apache 2.0 许可,拥有 740 million 参数,支持 8K token 上下文窗口,并可通过 MRL 将输出向量从 768 维截断到 512、256 或 128 维。
推荐理由:原文给出参数规模、上下文窗口和端侧内存数据,可用于评估多模态嵌入在本地检索场景中的适配性。
AWS Machine Learning Blog 介绍了在 Amazon Bedrock AgentCore runtime 和 OpenClaw 上构建上下文感知个人助手的方法。
推荐理由:文章把记忆命名空间、模型路由和提示词缓存串成可复用架构,便于迁移到其他个人助理场景。
Google Research 介绍了 Earth AI 的 Population Dynamics Foundation Model(PDFM)如何把地理空间嵌入接入公共卫生和流行病学工作流。
推荐理由:原文用五类公共卫生案例展示地理空间嵌入接入现有流行病学流程的效果。
Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。
推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。
OpenAI 发布了 372 个由内部前沿模型生成的数学结果,托管在 GitHub 而非学术期刊,并称每个结果旨在解决开放问题或取得实质进展。这些结果包含主要计算机算法改进和与 Riemann hypothesis 相关的进展,许多证明带有 Lean 形式化,平均每项消耗约三小时的 ChatGPT Pro Thinking compute。
推荐理由:原文呈现了 AI 生成数学证明从产出到审查的流程变化,以及数学界对理解价值的分歧。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。
推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。
Asta 开源了 AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转成带引用报告的开放权重模型。它已作为 Asta Generate a report 功能中的 Fast mode 提供,并与 Claude 驱动的 Thinking mode 并列;Asta 还开源训练数据,并发布可用自有 PDFs 生成报告的示例 workflow。
推荐理由:文章披露了训练数据筛选、DPO 构造和速度对比,适合参考科学报告生成模型的工程取舍。
GPT-6 Astra Ultrafast 运行在 NVIDIA Blackwell GPUs 上,现已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中可用。
推荐理由:原文给出 Ultrafast 与 Standard 的速度差异和开放入口,可用于评估编码智能体延迟优化价值。
Google DeepMind 推出 Gemini 4 Argon,用于编码、企业知识工作和网络防御,当前仅通过 Fairwind Program 向政府用户和受信任的网络防御者开放。
推荐理由:原文汇总了 Argon 的开放范围、价格和多组评测结果,便于比较 Google DeepMind 与同级前沿模型。
Google DeepMind 宣布 Gemini 4 Argon,这一前沿模型将先通过 Fairwind Program 向一组受信任的网络防御者推出,并逐步扩大访问。
推荐理由:原文给出发布节奏、价格和多项基准结果,可用于了解 Google 对高能力模型分阶段开放的安排。