跳到正文
Hugging Face Blog·· 21 小时前精选AI 评分82

Hugging Face 介绍 Nemotron 微调后在 IOI 2026 和 IMO 2026 达到金牌水平

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO

AI 导读

Hugging Face 介绍 Nemotron 团队从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,在 IOI 2026 与 IMO 2026 达到金牌水平。

推荐理由

文章同时给出训练数据、推理流程和开源入口,可参考其将基础模型专门化到竞赛任务的方法。

正文 · AI 翻译

国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)考察的是不同技能。IOI 要求算法和代码能在严格的时间与提交限制下通过隐藏测试。IMO 则要求严谨的自然语言证明。在任一竞赛中取得成功都很困难。同时在两者中成功,则说明了更广泛的能力。

我们近期的结果表明,Nemotron 是一个强大且适应性强的基础模型,可用于构建世界级的专门模型。从 Nemotron 3 开始,我们的团队使用监督微调(SFT)、强化学习(RL)以及反馈驱动的推理,创建了在 IMO 2026 和 IOI 2026 中都达到金牌水平的系统。

fig_ioi_imo_gold_results_headline

竞赛 Nemotron 专门化 结果
IOI 2026 采用 SFT 和 GenCorrect 的 Nemotron-3-Ultra-CC 535.4/600,高于 361.12 的金牌门槛,也高于 498.27 的人类最高分
IMO 2026 Nemotron 3 Ultra 通用模型、SFT 和 RL 检查点组成的生成-验证-改进系统 30/42,高于官方 29 分的金牌门槛

IOI 的结果来自一次实时的前瞻性运行,遵循与人类参赛者相同的时间、互联网访问和提交约束。这是一次非官方、无监督的基准测试,未被纳入 IOI 官方排名。IMO 系统提交的证明由 IMO 官方评分人员评定。

可复用的专门化方案

“易于微调”的含义不应只是让一个检查点可训练。它应当意味着,一个能力强大的基础模型可以通过清晰、可复用的方案适配到要求苛刻的领域。

在这两个项目中,该方案包含四个部分:

  1. 从强大的 Nemotron 基础模型开始。
  2. 整理特定领域的问题和高质量推理轨迹。
  3. 应用 SFT 等标准后训练方法,并在有用时应用 RL。
  4. 将专门模型与一个推理循环配对,用于生成、评估并改进候选答案。

训练和推理运行规模很大,但底层方法是熟悉且可复现的。我们不需要为每一个挑战构建新的基础模型。我们针对任务对 Nemotron 进行了专门化。

从通用编码能力到 IOI 金牌

对于竞技编程,我们整理了 22,000 道题目,并生成了合成推理轨迹来训练两个专门模型。Nemotron-3-Nano-CC 拥有 300 亿总参数和 30 亿活跃参数,接受了 SFT 和 RL。Nemotron-3-Ultra-CC 拥有 5500 亿总参数和 550 亿活跃参数,接受了 SFT。

在 IOI 2025 上的进展清晰地体现了专门化的价值。Nano 的分数从后训练前的 130 分提升到 SFT 后的 280 分,并在 RL 后达到 291 分。借助 GenCorrect——我们的迭代式生成-评估-改进策略——它达到 468 分,跨过了 438.3 的金牌门槛。Ultra-CC 使用相同的测试时策略达到 502 分。

fig_main_capability_progression_previous_style

这些实验还表明,不同规模下的适配方式不必相同。SFT 带来了 Nano 大部分提升,RL 则带来较小但稳定的改进。对于更强的 Ultra 模型,一个 SFT 轮次就足以在 IOI、ICPC 和 LiveCodeBench Pro 上全面超过完全后训练的 Nano 模型。这一发现指导了用于 IOI 2026 的竞赛专用 Ultra-CC 系统,该系统取得了 600 分中的 535.4 分。

教会 Nemotron 证明、检查与修订

IMO 项目将同样的思路应用到了奥林匹克数学。从 Nemotron 3 Ultra 开始,我们用 SFT 训练了一个专用模型,又用 RL 训练了另一个专用模型。

SFT 语料包含 414,890 个经过质量过滤的示例,覆盖 15,818 道独特的证明题。它所做的不只是教授最终答案。数据覆盖了证明生成、改进、验证和元验证,因此模型学会了构建论证、识别漏洞、回应批评,并判断一个证明是否完整。RL 模型在 9,597 道证明题上训练,这些题目被选择在接近模型能力前沿的位置。

在开发实验中,两个后训练检查点的表现都优于通用可用模型。SFT 检查点在第一轮搜索中最强,而 RL 检查点取得了最佳的单检查点总体结果。它们的优势互补,因此最终系统将这两个专用模型与通用模型一起使用。

对于每道 IMO 题目,模型都会生成候选证明、为其评分、产生评审意见,并改进最有希望的尝试。一个单独的高计算量阶段会选择最终提交。整个系统以自然语言工作,不使用形式化证明器、外部工具或互联网访问。它获得了 42 分中的 30 分,包括在 6 道题中的 4 道获得满分,并超过了官方金牌门槛。

image

微调与测试时计算协同工作

我们此前的 IOI 2025 Hugging Face 文章 展示了测试时计算如何将开放权重模型推向金牌级表现。新的结果补充了一个重要环节:更好的专门化会为推理系统带来更好的候选方案、更好的评审者和更好的改进。

在 IOI 中,GenCorrect 将微调带来的收益转化为多轮反馈中的更大提升。在 IMO 中,使用互补的 SFT 和 RL 检查点,比仅仅从一个检查点抽取更多样本更有价值。在这两种情况下,最佳结果都来自将一个强大的专用模型与能够搜索、验证和改进的系统相结合。

这一区别很重要。这些奖牌既不是单靠微调获得的,也不是单靠暴力采样获得的。它们来自对模型、数据和推理循环的协同设计。

Hugging Face 上的开放模型、数据和方案

我们希望这些结果在竞赛之外也能发挥作用。Nemotron Labs IMO 2026 集合汇集了 SFT 和 RL 检查点、两套训练数据集,以及 Nemotron-IMO-Bench——一个包含 200 道奥林匹克级题目的新基准。IMO 论文描述了训练方法和生成-验证-改进系统,而 NeMo-Skills 代码库包含 IMO 推理流水线、提示词、提交的证明,以及可复现的快速入门。对于竞技编程,Nemotron-3-Ultra-CC 模型已在 Hugging Face 上提供,IOI 论文提供了训练方案和 GenCorrect 方法。IOI 评估和推理流水线也可在 NeMo-Skills 中获取。

IMO 和 IOI 共同为一个简单想法提供了异常严苛的证据:Nemotron 可以被微调成世界级领域专家,然后与透明的推理工作流组合起来,解决处在人类竞赛前沿的问题。

我们很期待看到 Hugging Face 社区接下来会构建什么。

来源:Hugging Face Blog · huggingface.co