在AI领域,英伟达最近推出的Nemotron3模型家族无疑是一个令人瞩目的新动态。2025年12月24日,该公司在arXiv上发布了Nemotron3的白皮书,标志着开源模型的玩法进入了一个全新的阶段。在当前闭源模型占主导地位的市场环境下,英伟达的这一举措不仅出乎意料,也为开发者带来了新的希望。
开源诚意满满
Nemotron3并非单一的模型,而是由Nano、Super和Ultra三个不同型号组成,各自定位明确。Nano型号专注于低成本高效推理,Super则适合协作代理和大量工作负载处理,例如IT工单自动化,而Ultra则致力于提供顶尖的精度和推理性能。更值得一提的是,英伟达将模型权重、预训练和后训练软件,以及超过10万亿token的训练数据全部公开,展现出极高的透明度。这一做法在开源领域中显得尤为突出,过去很多开源模型往往只开放部分权重,核心数据和训练方法却封闭不明,限制了开发者的二次优化。
性能与架构创新
在性能方面,Nemotron3同样没有令人失望。Nano型号在常见推理场景中的吞吐量明显优于同类产品Qwen3-30B-A3B,尤其在处理长文本时,100万token的输入长度下,表现大幅优于前代产品Nemotron2Nano12B。传统Transformer模型普遍面临的一个问题是,处理长文本时计算开销显著增加,而Nemotron3采用了创新的Mamba-2层结构,取代了大部分自注意力层。Mamba层在生成内容时仅需存储固定大小的状态,避免了文本长度对计算的影响,这使得在长文本处理上既高效又稳定。
对于Super和Ultra型号,英伟达采用了LatentMoE架构,以解决传统MoE架构在部署时遇到的瓶颈问题。通过将token先投影到更低维度的空间进行计算,再投影回原始维度,LatentMoE显著降低了权重加载和通信的开销。这种创新架构为高吞吐量场景下的AI应用提供了有力支持。
低精度训练与后训练策略
在训练过程中,Nemotron3还引入了NVFP4格式,这是一种4位浮点格式,能够在保持精度的同时实现大规模稳定训练。与常用的BF16训练方式相比,Nano模型的损失控制得相对较好,更大的模型损失差距也更小。这种灵活的精度调整策略有效地保证了模型的稳定性和准确性。
Nemotron3的后训练采用了多环境强化学习,覆盖了数学推理、竞赛编程、指令遵循和软件工程等多种任务类型。与传统的分阶段训练方法不同,英伟达选择同时训练所有任务,增强了训练的稳定性,并有效避免了能力退化的问题。通过高效的推理吞吐量,Nemotron3能够生成大量样本,加速了强化学习的进程。
开源生态的构建
值得一提的是,Nemotron3的后训练软件栈全部以Apache2.0协议开源,包括NeMo-RL和NeMo-Gym两个仓库。这样,开发者不仅可以使用模型,还能借鉴其训练方法,进行进一步优化。此外,Nemotron3还支持推理时的思维预算控制,用户可以根据不同场景调整思维链的最大token数,从而在效率和精度之间取得平衡。
结论
总的来说,Nemotron3凭借其架构创新、低精度训练和全面开源,树立了开源模型的新标杆。这一系列举措不仅解决了传统模型的多项痛点,更是降低了AI研发的门槛。随着越来越多的开发者参与其中,二次优化和场景落地的进程将会加速,未来开源模型与闭源模型的竞争将愈加激烈,最终受益的将是整个AI行业以及广大用户。