詳細レポート
-
NVIDIA Nemotron是一系列最开放的AI大语言模型,配备开放的权重、训练数据和方案,提供业内领先的效率和准确性,用于构建专用的AI代理。
-
Nemotron系列的核心创新在于开放性,训练数据和模型权重完全开放,可在Hugging Face免费下载。架构上采用混合Mamba-Transformer MoE架构,支持高达100万token的上下文窗口。在部署方面支持vLLM、SGLang、Ollama、llama.cpp等开源框架,提供超高吞吐量推理,降低推理成本。
-
Nemotron产品线分为多个型号满足不同需求:Nemotron 3 Nano 30B定位高性价比,适用于目标任务的最高准确性和效率;Nemotron 3 Super 120B在效率和准确性之间取得平衡,适合多智能体环境处理复杂任务;Llama Nemotron Ultra 253B提供最高准确率,适用于多智能体企业工作流;Nemotron Nano VL 12B专注视觉语言,适用于文档智能和视频理解;Nemotron RAG提供检索增强功能,包括提取、嵌入和重排序;Nemotron Safety提供安全审核功能,包括越狱检测、内容审核、PII检测;Nemotron语音提供完整语音AI能力,包括ASR、TTS和语音翻译。
-
Nemotron的多模态能力涵盖视觉理解、信息检索、语音处理和安全功能,支持RAG和智能体应用等场景。
-
当前页面未提供具体的定价信息。可用的部署和试用方式包括通过OpenRouter免费试用部分模型,NVIDIA NIM提供推理端点API服务,以及第三方推理提供商包括Baseten、DeepInfra、Fireworks AI、FriendliAI、Together AI等。
ユーザーレビュー
-
Jason_221—Nemotron 3 Ultra 的 SWE-Bench 71.9% 挺猛的,关键是训练配方和数据集全开源,这点英伟达比 Meta 大方多了。 -
MAjac—试了一下 Nano Omni,30B 激活 3B 就能跑多模态,视频理解吞吐是对标模型的 9 倍,25GB 显存本地就能跑,这个效率确实离谱。 -
MarilynCooper00728—那个 Nemotron 委员会模式被 SemiAnalysis 喷得够呛,说是群体思维拖累进度。不过模型本身是不错的,委员会搞烂了不代表技术不行。 -
史鹏—用 Nemotron 3 Super 做代码审查,12 秒审完 19 个文件的 PR,抓出一个 CORS regression,比我手动快多了。不过对跨文件上下文的建议偏浅。 -
Amanda.Cruz_2021—本地用 Nano 30B 跑了一段时间,编码任务确实强,但聊天太机器人了,像跟一个正经的工程师说话,没得感情。 -
AbigailSchuster—Ultra 的 PinchBench 91% 跟 Kimi K2.6 打平,但推理速度快了 4 倍多,实用性上我觉得英伟达的优化思路更实在。 -
Pamela.Scott_20237—Mamba 生态还是不够成熟,llama.cpp 和 Ollama 对 Nemotron 的支持半残不残的,非 N 卡用户慎入。 -
James185—Nemotron 3 Super 的 SWE-Bench Multilingual 45.78% 吊打 GPT-OSS 的 30.8%,多语言代码修复场景下差距真大。 -
ABell520155—跑了一下 1M context,真的能塞进整个代码库做分析,官方说的 100 万 token 不是吹的。不过加载时间有点长。 -
Linda.Roberts_Plus—话说 OpenRouter 上 Nemotron 3 Super 免费,0 美元 / 百万 token,薅羊毛搞 agent 开发挺香的。 -
crazybird811—太啰嗦了这个模型,同样的任务它输出的 token 比别的模型多一大截,做生产环境要掂量一下 token 成本。之前用 Super 搭过一个小型 agent 服务,同样一个客服工单分类的任务,Super 输出 800 token,Qwen3.5 只要 300 token,量级差了将近三倍,虽然准确率差不多但成本翻倍了。 -
JanetNeal—NVFP4 量化真的是黑科技,精度几乎不掉,但吞吐翻了好几倍。Blackwell 上跑应该更爽。 -
RobertSimmonsJr—Ultra 跑智能体能撑 80 轮不掉链子,没出现过幻觉论文标题的情况。同任务 DeepSeek V4 编了一个不存在的论文出来,高下立判。不过我用的 DeepInfra 收费,跑了完整 research pipeline 下来花了大概十几刀,如果自建的话前期 infra 成本也不小,得看团队有没有这个部署能力。 -
dOUGLAS892—Nemotron 3 Ultra 搭配 LangChain 的 Harness Engineering 方案,推理成本比 Opus 4.8 便宜 10 倍,差距只有 0.01。对中小企业来说够用了。 -
RebeccaGomez1685—用 Cascade 跑 HumanEval 97.6%,ClassEval 88%,30B 总参 3B 激活能有这个编码能力,红迪上那哥们说得对,确实被低估了。 -
CosmosCris915—搞深度研究的瓶颈已经不在模型本身了,英伟达把整个工具箱都开源了,什么 Nemoclaw、OpenShell 一套下来,搭 agent 比之前舒服太多。之前搭多智能体系统从零开始搞 agent 框架搭了好几天,现在直接拿 OpenShell 的沙盒加编排框架,半天就搭起来了,门槛确实降了很多。 -
JoseBaileyII—中文理解能力跟国产模型比差距还是挺明显的,毕竟主要优化的是英文 Agent 场景,做中文产品的话优先考虑 Qwen 或者 DeepSeek。 -
Patricia.Cox—Greptile 测完说 Super 是「一流的初轮审查工具」,我自己用下来也是这样,代码审查场景是真的强。 -
MelissaGray—联网搜索配合 Nemotron Nano 30B 本地跑,那篇 OpenWebUI 上的评测说得在理,体验比很多云端小模型还好。 -
IFlores168—英伟达搞的这个开源协议比 Llama 那些伪开源清爽多了,没有月活限制,商业部署不用提心吊胆。之前公司想用 Llama 做产品,法务一看那个商用协议里一堆附加条款,折腾了好久才放行。Nemotron 的 OpenMDW-1.1 虽然也有 patent termination clause,但整体限制少很多。 -
A_Lriv—Super 在 RULER @1M 上 91.75%,对比 GPT-OSS 的 22.30% 简直是降维打击,长上下文场景选 Nemotron 没毛病。 -
purplegoose369—用 Ultra 写了一个 FPS 小游戏试水,从零开始生成代码搞了好几天才跑起来,debug 能力倒是不错,但创造性编码真不是它的强项。 -
AmellyDa luz—模型回复一股子 RLHF 过度优化的味道,太保守太工整了,适合企业部署但不好玩。开箱即用选这个没错。 -
MStephens_77—Cadence 用 Nemotron 3 Ultra 做芯片验证,把 RTL 验证从几周缩短到几小时,这才是模型的正确用法。 -
JoseRoss_Max3—Mamba-2 + Transformer 混搭架构真的是被低估的设计,长序列内存效率拉满,纯 Transformer 做 1M context 根本吃不消。我试过用同样参数量级的纯 attention 模型加载 500K context,显存直接爆炸,Nemotron 的 Mamba 层在长序列上只存固定大小的状态,这个设计差异在实际部署时是天壤之别。 -
MsChristopherCarpenter_dev—Nemotron 3 Nano Omni 六个多模态榜单第一,MediaPerf 上视频标注吞吐比 GPT 5.1 还高,这你受得了吗。 -
DorothyBrooksK—试了试角色的扮演功能——本来以为这种企业级模型不会写故事,结果写了个赛博朋克修电脑的剧情,细节丰富到让我有点吃惊。从叮咚作响的店门铃铛到货架上那些坏掉的 Seagate 硬盘,再到那个戴老花镜的老板,整个氛围描写很在线,完全没想到一个面向企业部署的模型能有这种叙事能力。 -
redmouse606—Ultra 的 structured output 可靠性真不错,200 次 JSON 请求只有 1 次格式错误,做 pipeline 很稳。 -
Eugene.Evans_Pro678—卡在 Arena-Hard 73.88% 这个成绩上,跟 GPT-OSS 的 90.26% 差了快 17 个点,聊天质量确实不如其他模型。 -
Harold84—Super 的 120B 模型 Q4_K 量化后能在 M1 Ultra 上跑 1M context,虽然速度降得厉害但至少能跑,这一点已经领先很多同尺寸模型了。实测下来 prompt processing 从零 context 的 255 t/s 降到 200K context 时的 142 t/s,token generation 也从 26.7 降到 20.6 t/s,虽然慢但可用,这在半年前根本不敢想。