Anthropic 发布 Claude Haiku 5.5,小模型跑分提升并调整价格
Anthropic 发布 Claude Haiku 5.5,文章称其在小模型跑分上超过 DeepSeek V4.1Flash、GLM-5.3-Flash,并逐项赢过 GPT-6 Luna。
推荐理由:原文梳理了 Haiku 5.5 的价格、跑分和迁移改动,可用于评估小模型替换成本。
Anthropic 发布 Claude Haiku 5.5,文章称其在小模型跑分上超过 DeepSeek V4.1Flash、GLM-5.3-Flash,并逐项赢过 GPT-6 Luna。
推荐理由:原文梳理了 Haiku 5.5 的价格、跑分和迁移改动,可用于评估小模型替换成本。
Hugging Face 介绍 Nemotron 团队从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,在 IOI 2026 与 IMO 2026 达到金牌水平。
推荐理由:文章同时给出训练数据、推理流程和开源入口,可参考其将基础模型专门化到竞赛任务的方法。
Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。
推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
GPT-6 Astra Ultrafast 运行在 NVIDIA Blackwell GPUs 上,现已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中可用。
推荐理由:原文给出 Ultrafast 与 Standard 的速度差异和开放入口,可用于评估编码智能体延迟优化价值。
Google DeepMind 推出 Gemini 4 Argon,用于编码、企业知识工作和网络防御,当前仅通过 Fairwind Program 向政府用户和受信任的网络防御者开放。
推荐理由:原文汇总了 Argon 的开放范围、价格和多组评测结果,便于比较 Google DeepMind 与同级前沿模型。
Google DeepMind 宣布 Gemini 4 Argon,这一前沿模型将先通过 Fairwind Program 向一组受信任的网络防御者推出,并逐步扩大访问。
推荐理由:原文给出发布节奏、价格和多项基准结果,可用于了解 Google 对高能力模型分阶段开放的安排。
GitHub Security Lab 介绍了 Fuzzing Taskflow,这是一个面向 C/C++ 项目的自主 fuzzing 流水线,基于 GitHub Security Lab Taskflow Agent 构建。
推荐理由:文章拆解了 LLM agent 接管 fuzzing 覆盖改进和崩溃分诊的流程,对安全自动化工作流有参考价值。
GitHub Blog 介绍了 GitHub Copilot app 为超大 pull request 重建视图的工程方案。团队用一个包含 2,200 个文件、超过 100 万行变更、400 多条行内评论的开源 pull request 压测,通过代码行虚拟化、评论动态高度测量、滚动锚定、增量数据管线和自动化测量循环,让大 diff 与多线程评论保持可滚动和可阅读。
推荐理由:原文拆解了大规模 diff 与评论渲染的工程取舍,可迁移到其他长列表和动态内容界面。
Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 迁移到 C++,对象是一个物理密集型油藏模拟器,原项目没有测试套件和集中化文档。
推荐理由:案例给出从校验基准到人机协作流程的迁移路径,可迁移到复杂遗留系统改造。