Nemotron

NVIDIA推出的开源大语言模型系列,开放权重和训练数据用于构建专用AI代理

深度报告

  • NVIDIA Nemotron是一系列最开放的AI大语言模型,配备开放的权重、训练数据和方案,提供业内领先的效率和准确性,用于构建专用的AI代理。

  • Nemotron系列的核心创新在于开放性,训练数据和模型权重完全开放,可在Hugging Face免费下载。架构上采用混合Mamba-Transformer MoE架构,支持高达100万token的上下文窗口。在部署方面支持vLLM、SGLang、Ollama、llama.cpp等开源框架,提供超高吞吐量推理,降低推理成本。

  • Nemotron产品线分为多个型号满足不同需求:Nemotron 3 Nano 30B定位高性价比,适用于目标任务的最高准确性和效率;Nemotron 3 Super 120B在效率和准确性之间取得平衡,适合多智能体环境处理复杂任务;Llama Nemotron Ultra 253B提供最高准确率,适用于多智能体企业工作流;Nemotron Nano VL 12B专注视觉语言,适用于文档智能和视频理解;Nemotron RAG提供检索增强功能,包括提取、嵌入和重排序;Nemotron Safety提供安全审核功能,包括越狱检测、内容审核、PII检测;Nemotron语音提供完整语音AI能力,包括ASR、TTS和语音翻译。

  • Nemotron的多模态能力涵盖视觉理解、信息检索、语音处理和安全功能,支持RAG和智能体应用等场景。

  • 当前页面未提供具体的定价信息。可用的部署和试用方式包括通过OpenRouter免费试用部分模型,NVIDIA NIM提供推理端点API服务,以及第三方推理提供商包括Baseten、DeepInfra、Fireworks AI、FriendliAI、Together AI等。

用户评论

  • 头像
    Jason_221
    Nemotron 3 Ultra 的 SWE-Bench 71.9% 挺猛的,关键是训练配方和数据集全开源,这点英伟达比 Meta 大方多了。

  • 头像
    MAjac
    试了一下 Nano Omni,30B 激活 3B 就能跑多模态,视频理解吞吐是对标模型的 9 倍,25GB 显存本地就能跑,这个效率确实离谱。

  • 头像
    MarilynCooper00728
    那个 Nemotron 委员会模式被 SemiAnalysis 喷得够呛,说是群体思维拖累进度。不过模型本身是不错的,委员会搞烂了不代表技术不行。

  • 头像
    史鹏
    用 Nemotron 3 Super 做代码审查,12 秒审完 19 个文件的 PR,抓出一个 CORS regression,比我手动快多了。不过对跨文件上下文的建议偏浅。

  • 头像
    Amanda.Cruz_2021
    本地用 Nano 30B 跑了一段时间,编码任务确实强,但聊天太机器人了,像跟一个正经的工程师说话,没得感情。

  • 头像
    AbigailSchuster
    Ultra 的 PinchBench 91% 跟 Kimi K2.6 打平,但推理速度快了 4 倍多,实用性上我觉得英伟达的优化思路更实在。

  • 头像
    Pamela.Scott_20237
    Mamba 生态还是不够成熟,llama.cpp 和 Ollama 对 Nemotron 的支持半残不残的,非 N 卡用户慎入。

  • 头像
    James185
    Nemotron 3 Super 的 SWE-Bench Multilingual 45.78% 吊打 GPT-OSS 的 30.8%,多语言代码修复场景下差距真大。

  • 头像
    ABell520155
    跑了一下 1M context,真的能塞进整个代码库做分析,官方说的 100 万 token 不是吹的。不过加载时间有点长。

  • 头像
    Linda.Roberts_Plus
    话说 OpenRouter 上 Nemotron 3 Super 免费,0 美元 / 百万 token,薅羊毛搞 agent 开发挺香的。

  • 头像
    crazybird811
    太啰嗦了这个模型,同样的任务它输出的 token 比别的模型多一大截,做生产环境要掂量一下 token 成本。之前用 Super 搭过一个小型 agent 服务,同样一个客服工单分类的任务,Super 输出 800 token,Qwen3.5 只要 300 token,量级差了将近三倍,虽然准确率差不多但成本翻倍了。

  • 头像
    JanetNeal
    NVFP4 量化真的是黑科技,精度几乎不掉,但吞吐翻了好几倍。Blackwell 上跑应该更爽。

  • 头像
    RobertSimmonsJr
    Ultra 跑智能体能撑 80 轮不掉链子,没出现过幻觉论文标题的情况。同任务 DeepSeek V4 编了一个不存在的论文出来,高下立判。不过我用的 DeepInfra 收费,跑了完整 research pipeline 下来花了大概十几刀,如果自建的话前期 infra 成本也不小,得看团队有没有这个部署能力。

  • 头像
    dOUGLAS892
    Nemotron 3 Ultra 搭配 LangChain 的 Harness Engineering 方案,推理成本比 Opus 4.8 便宜 10 倍,差距只有 0.01。对中小企业来说够用了。

  • 头像
    RebeccaGomez1685
    用 Cascade 跑 HumanEval 97.6%,ClassEval 88%,30B 总参 3B 激活能有这个编码能力,红迪上那哥们说得对,确实被低估了。

  • 头像
    CosmosCris915
    搞深度研究的瓶颈已经不在模型本身了,英伟达把整个工具箱都开源了,什么 Nemoclaw、OpenShell 一套下来,搭 agent 比之前舒服太多。之前搭多智能体系统从零开始搞 agent 框架搭了好几天,现在直接拿 OpenShell 的沙盒加编排框架,半天就搭起来了,门槛确实降了很多。

  • 头像
    JoseBaileyII
    中文理解能力跟国产模型比差距还是挺明显的,毕竟主要优化的是英文 Agent 场景,做中文产品的话优先考虑 Qwen 或者 DeepSeek。

  • 头像
    Patricia.Cox
    Greptile 测完说 Super 是「一流的初轮审查工具」,我自己用下来也是这样,代码审查场景是真的强。

  • 头像
    MelissaGray
    联网搜索配合 Nemotron Nano 30B 本地跑,那篇 OpenWebUI 上的评测说得在理,体验比很多云端小模型还好。

  • 头像
    IFlores168
    英伟达搞的这个开源协议比 Llama 那些伪开源清爽多了,没有月活限制,商业部署不用提心吊胆。之前公司想用 Llama 做产品,法务一看那个商用协议里一堆附加条款,折腾了好久才放行。Nemotron 的 OpenMDW-1.1 虽然也有 patent termination clause,但整体限制少很多。

  • 头像
    A_Lriv
    Super 在 RULER @1M 上 91.75%,对比 GPT-OSS 的 22.30% 简直是降维打击,长上下文场景选 Nemotron 没毛病。

  • 头像
    purplegoose369
    用 Ultra 写了一个 FPS 小游戏试水,从零开始生成代码搞了好几天才跑起来,debug 能力倒是不错,但创造性编码真不是它的强项。

  • 头像
    AmellyDa luz
    模型回复一股子 RLHF 过度优化的味道,太保守太工整了,适合企业部署但不好玩。开箱即用选这个没错。

  • 头像
    MStephens_77
    Cadence 用 Nemotron 3 Ultra 做芯片验证,把 RTL 验证从几周缩短到几小时,这才是模型的正确用法。

  • 头像
    JoseRoss_Max3
    Mamba-2 + Transformer 混搭架构真的是被低估的设计,长序列内存效率拉满,纯 Transformer 做 1M context 根本吃不消。我试过用同样参数量级的纯 attention 模型加载 500K context,显存直接爆炸,Nemotron 的 Mamba 层在长序列上只存固定大小的状态,这个设计差异在实际部署时是天壤之别。

  • 头像
    MsChristopherCarpenter_dev
    Nemotron 3 Nano Omni 六个多模态榜单第一,MediaPerf 上视频标注吞吐比 GPT 5.1 还高,这你受得了吗。

  • 头像
    DorothyBrooksK
    试了试角色的扮演功能——本来以为这种企业级模型不会写故事,结果写了个赛博朋克修电脑的剧情,细节丰富到让我有点吃惊。从叮咚作响的店门铃铛到货架上那些坏掉的 Seagate 硬盘,再到那个戴老花镜的老板,整个氛围描写很在线,完全没想到一个面向企业部署的模型能有这种叙事能力。

  • 头像
    redmouse606
    Ultra 的 structured output 可靠性真不错,200 次 JSON 请求只有 1 次格式错误,做 pipeline 很稳。

  • 头像
    Eugene.Evans_Pro678
    卡在 Arena-Hard 73.88% 这个成绩上,跟 GPT-OSS 的 90.26% 差了快 17 个点,聊天质量确实不如其他模型。

  • 头像
    Harold84
    Super 的 120B 模型 Q4_K 量化后能在 M1 Ultra 上跑 1M context,虽然速度降得厉害但至少能跑,这一点已经领先很多同尺寸模型了。实测下来 prompt processing 从零 context 的 255 t/s 降到 200K context 时的 142 t/s,token generation 也从 26.7 降到 20.6 t/s,虽然慢但可用,这在半年前根本不敢想。