Overview of Nemotron series

Author

Updated

Jul, 31, 2026

Category

Introduction

Nemotron 3 Nano

Nvidia 在 25 年 12 月发布了 Nemotron 3 Nano (NVIDIA et al., 2025)

Data

Training

Post-training

Infra

  1. NVIDIA, :, Blakeman, A., Grattafiori, A., Basant, A., Gupta, A., Khattar, A., Renduchintala, A., Vavre, A., Shukla, A., Bercovich, A., Ficek, A., Shaposhnikov, A., Kondratenko, A., Bukharin, A., Milesi, A., Taghibakhshi, A., Liu, A., Barton, A., … Yan, Z. (2025). Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning. https://arxiv.org/abs/2512.20848

Nemotron-cascade

NVIDIA 在 25 年 12 月提出了 cascaded RL 以及训练得到的模型 Nemotron-Cascade (Wang et al., 2026), 模型包含 instruct 以及 thinking 两种模式。 cascaded RL 使用了 sequential, domain-wise RL 来提高模型的数学和代码能力。

现有的 RLHF 主要分为了 RLHF 和 RLVR 两种范式,前者用于提高模型的 alignment 能力,后者用于提高模型的 reasoning 能力。

但是提高模型的 reasoning 能力涉及到多个 domain, 每个 domain 的 verification 方式不一致,比如 math reasoning 依赖 symbolic rule-based verification, code generation 依赖于 execution based verification, alignment 依赖与 reward model based score.

AceReason-nemotron 中,作者提出了使用 Cascade RL 的方式来提高模型的数学和代码能力,作者发现这样做有以下优势:

  1. rule-based math verification 比 execution based verification 效率更高,可以在训练早期提高模型训练效率
  2. math reasoning 能力可以泛化到其他 domain 上
  3. math RL 之后,我们可以通过 code RL 提高模型的 code 能力而不损失模型的 math reasoning 表现

因此,在本文中,作者基于 Qwen3 (Yang et al., 2025) 的 Qwen3-8B-Base 以及 Qwen3-14B-Base 构建了一个开源的 post training recipe.

本文贡献如下:

Data

SFT

stage 1 数据构造

stage 2 数据构造

RLHF

reward model 训练数据包括 82k preference pairs: HelpSteer2 (10k), HelpSteer3 (36K)

数据合成:使用 stronger LLM 生成 bad response, weaker LLM 生成 good responses.

RLHF 训练数据与 reward model 一致,并过滤掉 code 和 math reasoning prompts.

IF RL

数据包括

  1. LLaMA-Nemotron, 包括 40k samples,
  2. LMSYS-Chat-1M: 40K samples
  3. IF-RLVR training data
  4. Tulu3-SFT

domain-RL

Training

SFT

SFT 包含了两个阶段,分别覆盖 reasoning domain 和 general domain.

对于 chat template, 作者使用了 ChatML 格式,然后使用了 /think/no_think 两个 flag 来控制是否进行思考。 作者通过实验发现,Qwen3 的 explicit flags 效果更好,并且可以覆盖所有场景,因此,作者舍弃了 <think></think> block. 作者还用了 <tools></tools>, <tool_call></tool_call> tags 来表明可用工具以及模型的工具调用

训练的超参数如下所示

RLHF

reward model 训练数据集为 D={(x,y+,y)}\mathcal{D}=\{(x,y^+,y^-)\},

P(y+yx)=exp(rθ(x,y+))exp(rθ(x,y+))+exp(rθ(x,y))P(y^+\succ y^-\mid x) = \frac{\exp(r_{\theta}(x,y^+))}{\exp(r_{\theta}(x,y^+))+\exp(r_{\theta}(x,y^-))}

损失函数为

L(θ)=E(x,y+,y)D[logP(y+yx)]\mathcal{L}(\theta) = \mathbb{E}_{(x,y^+,y^-)\sim \mathcal{D}}\left[\log P(y^+\succ y^-\mid x)\right]

setup: batch size 256, lr 2e62e-6, 1 epoch.

RLHF

基于 GRPO 进行训练,发现模型在下游任务上,除了 instruction following 之外,都有提升,作者认为这是由于 RLHF 要求模型输出较短的,符合人类偏好的回答,而 IF 则严格要求模型遵循输出格式。

IF-RL

两个阶段:第一个阶段关注 IFEval 相关数据,第二个阶段关注 IF-Bench-Train 相关数据。

  1. unified models: apply IF-RL only in the non-thinking mode
  2. thinking model: IF-RL with combined reward function

domain-RL

math-RL 训练包括三阶段:

  1. 24k, compression: 压缩 SFT checkpoint 输出长度
  2. 32k, extension: 扩展模型的输出长度和表现
  3. 40k, long reasoning stage: 提升模型解决复杂问题的难度

Code RL 训练使用了 async reward computation.

SWE RL reward function 定义为 generated patch p^\hat{p} 和 ground truth pp^* 之间的相似性

r(p^,p)={1, if slex(p^,p)=10, if p^ is identical to the original code snippet1, if p^ cannot be parsedssem(p^,p), otherwiser(\hat{p},p^*) = \begin{cases} 1,&\text{ if } s_{lex}(\hat{p},p^*)=1\\ 0,&\text{ if } \hat{p}\text{ is identical to the original code snippet}\\ -1, &\text{ if } \hat{p}\text{ cannot be parsed}\\ s_{sem}(\hat{p},p^*), &\text{ otherwise} \end{cases}

其中 slex(p^,p)s_{lex}(\hat{p},p^*) 是基于 Unidiff library 的 lexical similarity, ssem(p^,p)s_{sem}(\hat{p},p^*) 是 LLM 给出的语义相似度。

训练包括 2 个阶段, 第一阶段将输入初始化为 16k 作为 warmup, 第二阶段将输入扩展到 24k.

Experiments

作者对比了 Qwen3 提出的 Qwen3-8B, Qwen3-14B, 表现如下表所示

BenchmarkQwen3 8BQwen3 14BNemotron Cascade-8BNamotron Cascade 14B-Thinking
MMLU83.084.983.785.1
MMLU-Pro75.177.675.777.0
GPQA-Dimond62.064.066.569.6
ArenaHard85.891.787.989.5
IFEval85.085.490.281.9
IFBench34.433.740.841.7
AIME 202476.079.389.589.7
AIME 202567.370/480.183.3
LiveCodeBench v561.265.274.377.5
SWE-verified20.527.437.243.1

Analysis

reward model:

  1. benchmark score 低的表现一定差,但是高也不一定好
  2. 小模型更关注输出的风格而不是质量
  3. 使用 pre-trained reward model 和基于 SFT model 表现差不多
  4. reasoning model 比 instruction model 表现差

RLHF

  1. RLHF 可以降低模型输出重复的概率和 verbosity
  2. RLHF 可以提高模型在 math 和 code benchmark 上的表现

作者认为 cascaded RL 没有灾难性遗忘的原因:

  1. Wang, B., Lee, C., Lee, N., Lin, S.-C., Dai, W., Chen, Y., Chen, Y., Yang, Z., Liu, Z., Shoeybi, M., Catanzaro, B., & Ping, W. (2026). Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models. https://arxiv.org/abs/2512.13607
  2. Yang, A., Li, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Gao, C., Huang, C., Lv, C., Zheng, C., Liu, D., Zhou, F., Huang, F., Hu, F., Ge, H., Wei, H., Lin, H., Tang, J., … Qiu, Z. (2025). Qwen3 Technical Report. https://arxiv.org/abs/2505.09388