Mistral 发布 Mistral Large 4 预览版 Le chonk
Mistral 发布 Mistral Large 4 预览版 Le chonk,这是一个 1 trillion parameter、49 billion active parameter 模型,可通过 Mistral API 使用。
Mistral 发布 Mistral Large 4 预览版 Le chonk,这是一个 1 trillion parameter、49 billion active parameter 模型,可通过 Mistral API 使用。
OpenAI 发布了 372 个由内部前沿模型生成的数学结果,托管在 GitHub 而非学术期刊,并称每个结果旨在解决开放问题或取得实质进展。这些结果包含主要计算机算法改进和与 Riemann hypothesis 相关的进展,许多证明带有 Lean 形式化,平均每项消耗约三小时的 ChatGPT Pro Thinking compute。
推荐理由:原文呈现了 AI 生成数学证明从产出到审查的流程变化,以及数学界对理解价值的分歧。
OpenAI 发布了一批由未发布前沿模型生成的数学手稿,共 722 篇,覆盖 372 个相关结果族,据称包含“数百个”开放问题的解法。发布内容包括部分模型推理摘要、所用 compute 估计和尝试问题数量统计,OpenAI 称“平均结果”相当于 3 小时 ChatGPT Pro thinking。
同一新闻,精选展示《OpenAI 在 GitHub 发布 372 个 AI 生成数学证明》
Anthropic 发布 Claude Haiku 5.5,文章称其在小模型跑分上超过 DeepSeek V4.1Flash、GLM-5.3-Flash,并逐项赢过 GPT-6 Luna。
推荐理由:原文梳理了 Haiku 5.5 的价格、跑分和迁移改动,可用于评估小模型替换成本。
Anthropic 发布新的快速低成本模型 Claude Haiku 5.5,Simon Willison 实测称其在 100,000 tokens 内价格为 $0.10/$0.50,与 GPT-6 Luna 相同。
推荐理由:作者实测了价格、tokenizer 和推理档位,便于比较 Claude Haiku 5.5 与 GPT-6 Luna 的成本差异。
Hugging Face 介绍 Nemotron 团队从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,在 IOI 2026 与 IMO 2026 达到金牌水平。
推荐理由:文章同时给出训练数据、推理流程和开源入口,可参考其将基础模型专门化到竞赛任务的方法。
量子位讨论 Claude、GPT、Gemini 等 AI 在 Coding 场景中输出黑话化、文言化的问题,认为 Coding 过拟合和 CoT 压缩可能是重要原因。
OpenAI 公开 722 篇数学手稿,全部出自一个尚未发布的内部模型,归成 372 组结果,并上传论文、源码和部分 Lean 证明到 GitHub。材料称这些结果覆盖准黎曼猜想、霍奇猜想、BSD猜想、π的无理性指数、唯一游戏猜想等 17 个方向,模型此前尝试约 4000 个研究问题,平均每项结果消耗约相当于 ChatGPT Pro 思考 3小时。
推荐理由:原文梳理了手稿覆盖范围、核验状态和数学界反应,可帮助理解AI产出数学成果后的同行消化压力。
Microsoft Research 访谈 Jennifer Neville,讨论评估如何推动 AI 系统性能边界,并揭示传统 benchmark 之外的“意外失败”。Neville 研究交互式领域与结构化数据中的机器学习和 AI,已发表 130 多篇论文、获 10,000 多次引用,并分享当前 AI 系统使用建议。
OpenAI 公布了一个内部前沿模型在数学开放问题上的新结果。OpenAI 还在 GitHub 分享了 Lean 证明形式化内容和研究细节。
Thore Graepel 认为,当今 LLM 主要依赖 next-token prediction 和 CoT 延长生成过程,并不具备 AlphaGo 式的独立推理机制。他以 AlphaGo 的政策网络与搜索机制解释第 37 手,指出真正推理需要显式、持久、可检查的认知状态,以及知识与操作知识方式的分离。他主张未来 AI 应维护可审计的证据、推理和信念修订序列,用于科学、医学、工程等高风险领域。
Latent Space 访谈 MIT 的 Alex Zhang,讨论 RLMs、GPU Mode、KernelBench、AI 生成 GPU kernels 与多智能体集群。
Google DeepMind 推出 Gemini 4 Argon,用于编码、企业知识工作和网络防御,当前仅通过 Fairwind Program 向政府用户和受信任的网络防御者开放。
推荐理由:原文汇总了 Argon 的开放范围、价格和多组评测结果,便于比较 Google DeepMind 与同级前沿模型。
Google DeepMind 宣布 Gemini 4 Argon,这一前沿模型将先通过 Fairwind Program 向一组受信任的网络防御者推出,并逐步扩大访问。
推荐理由:原文给出发布节奏、价格和多项基准结果,可用于了解 Google 对高能力模型分阶段开放的安排。
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,用于近实时推理、语音智能体和更自然的 AI 对话。
推荐理由:原文同时给出语音模型能力、评测结果和开放入口,便于判断其在语音智能体中的适用场景。
Import AI 470 讨论 METR 对 AI 加速科研的分析、SPADE 合成可执行环境,以及 Hawkeye 改进 GPU kernels。METR 称 AI 对 cyber 漏洞发现加速明显,对数学贡献较小,对 AI 研究优化暂无可测加速;SPADE 在 Qwen3-30B-A3B 上游戏套件平均达 58.3,比 base 高 +8.1。
Import AI 469 讨论 DiG-bench、RSI Simulator 和 Inherent 的 AI 科学家模型 Faraday 等 AI 研究进展。
BAIR 庆祝 2026 届 Ph.D. 毕业生,他们的研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成建模、AI 安全、人机交互、AI for science and healthcare 等领域。毕业生将前往高校任教或从事博士后研究、加入产业研究实验室,或创办自己的初创公司。
Berkeley AI Research 文章分析 Adaptive Parallel Reasoning,认为它让模型在推理时自行决定何时拆解任务、启动多少并行线程以及如何协调。
Berkeley AI Research 介绍 GRASP,一种用于学习动态系统“世界模型”的梯度式规划器,旨在让长时域规划更实用。GRASP 将轨迹提升为虚拟状态以并行优化时间维度,在状态迭代中直接加入随机性用于探索,并重塑梯度,让动作获得更清晰信号,同时避免穿过高维视觉模型的脆弱“state-input”梯度。