深度报告
-
Nemotron Ultra 253B 是英伟达在 Llama Nemotron 开源模型家族里体量与定位最高的「质量旗舰」,全称 Llama-3.1-Nemotron-Ultra-253B-v1。它基于 Meta 的 Llama-3.1-405B-Instruct 做蒸馏与神经架构搜索压缩,把 405B 压成 253B 的稠密模型,主打企业级复杂推理与智能体工作流。模型权重完全开放、允许商用,在 GPQA 科学推理、IFEval 指令遵循、LiveCodeBench 编码上压过了参数量大得多的 DeepSeek-R1。代价是它的工具调用与视觉能力实测几乎为零,且跑满血需要一整台 8 卡 H100 节点。
-
英伟达在 2025 年 GTC 上首次预告这款模型,并于 2025 年 4 月 7 日正式开源发布。它的母体是 Meta 的 Llama-3.1-405B-Instruct,但英伟达没有简单微调,而是用一套叫 Puzzle 的神经架构搜索(NAS)把模型「重新设计」了一遍:部分层直接跳过注意力、换成线性层,前馈网络(FFN)在不同块里用不同的扩展比,连续的 FFN 还会被融合成更宽更少的层。这套操作把显存占用压下来,让 253B 能在单台 8xH100 节点上推理,而不是必须多机。 训练上它走了三段后训练:先用 650 亿 token 做知识蒸馏、再用 880 亿 token 做持续预训练「重新打底」,然后是覆盖数学、代码、推理、对话、工具调用的监督微调,最后用 GRPO 强化学习做对齐。整个过程的数据、配方和技术报告也都开源,开发者能复现和改造。模型知识截止在 2023 年,这是 Llama-3.1 底模带来的硬限制。
-
Nemotron Ultra 253B 是一个稠密解码器 Transformer,253B 参数每个 token 全部激活,上下文窗口 128K。它最大的特点是「推理开关」:通过系统提示词里的 detailed thinking on 一句话就能在推理模式和非推理模式之间切换,不需要换模型。开启推理后性能暴涨——MATH500 从 80.40% 冲到 97.00%,AIME25 从 16.67% 一路拉到 72.50%,LiveCodeBench 从 29.03% 跳到 66.31%,GPQA 从 56.60% 升到 76.01%。换句话说,它是一个把「要不要多想一会儿」交给用户控制的推理模型。 和竞品比,它的定位很清晰。相比 DeepSeek-R1(671B),它在 GPQA(76.01 vs 71.5)、IFEval(89.45 vs 83.3)、LiveCodeBench(66.31 vs 65.9)上略胜,吞吐量是前者的约四倍;但在 AIME25(72.50 vs 79.8)和 MATH500(97.00 vs 97.30)上稍逊。相比同门小弟 Nemotron Super 49B/120B,Ultra 是纯粹的质量优先,靠堆参数把天花板顶高。
-
模型权重本身免费、开放、可商用,遵循 NVIDIA Open Model License 叠加 Llama 3.1 社区许可。花钱的地方在算力。第三方聚合平台 OpenRouter 上它的 API 定价是输入每百万 token 0.60 美元、输出 1.80 美元,和英伟达自家 NIM 微服务基本同档。本地部署按 8xH100 SXM 节点约 19.92 美元/小时(Lambda Labs 报价)算,FP8 量化下每百万 token 成本约 1.04 美元(峰值)、3.31 美元(生产并发),质量性价比(每质量分成本 0.35 美元)优于 BF16 的 0.53 美元。
-
社区里玩这个模型的人,关注点几乎都集中在「怎么塞进自己能负担的硬件」。Hugging Face 上已经有一堆社区量化版:llama.cpp 的 Q4_K_M、EXL3 的 3.6bpw(能塞进 128GB 显存但上下文很受限)、还有 unsloth 等一键拉起方案。开发者普遍认可它在纯文本推理和代码生成上的硬实力,把它当作本地替代 GPT-4/Claude 做企业内网推理的选项。但也有人直白吐槽:253B 实在太重,没 8 卡 H100 根本跑不动满血版,量化到能单卡跑又得牺牲上下文长度,体验打折明显。
-
第三方评测机构 InferenceBench 在 8xH100 上用 vLLM 做了 12 项基准,结论很有参考价值。MT-Bench 上 BF16 拿 9.2、FP8 拿 9.47,推理项满分 10.0、代码生成 15/15 满分、长上下文和多语言都是 100%。但他们挖出一个反直觉的「FP8 悖论」:FP8 量化不仅没掉点,质量反而比 BF16 更高,吞吐还快 40%、显存省一半,结论是直接用 FP8 部署,别碰 BF16。 更刺眼的是两个零分。工具调用 0/15 全挂,视觉理解 0/12 全挂。这意味着它名义上写着「支持 tool calling、RAG、agent」,实测却进不了真正的智能体工作流,也根本不是多模态模型。行业普遍认为它是一枚被精心调校过的「文本质量利器」,但离 NVIDIA 宣传的 agentic 叙事还有明显落差。
-
最需警惕的是能力宣传与实际表现的落差。官方文档和模型卡把 tool calling、RAG、agent 列为核心卖点,可独立评测里函数调用是零分。如果团队冲着「自建智能体」去选它,会踩坑。其次是硬件门槛:8xH100 的部署基线把绝大多数中小团队挡在门外,性价比优势只在「已经拥有这张卡」的前提下才成立。 命名也是个坑。2025 年 12 月英伟达又发了「Nemotron 3 Ultra」,那是 MoE 混合架构的新一代,和这款 253B 稠密模型不是一回事;部分第三方榜单还把本文这款标成「2026-02-01 发布、32K 上下文」,与官方 2025-04 发布、128K 上下文对不上,属于元数据混乱。另外知识截止停在 2023 年,对时事类和近期事实类问答天然偏弱。
-
它适合有 H100 算力、需要高质量纯文本推理和代码生成的团队:企业内部知识问答、法律/科研长文档分析、代码助手后端、对隐私和可控性要求高的本地部署场景。它也适合把 FP8 当默认精度、追求每美元质量最大化的推理服务。 不适合它的人也很明确。想做真智能体、要稳定函数调用的,去看 Gemma 4、Qwen 或 Claude;要图文多模态的,它直接出局;没高端 GPU、只想在消费级显卡上跑的,253B 体量与你的硬件不在一个量级。务实做法是:把它当一枚顶配文本推理引擎用,别被「agent 模型」的标签带偏。
-
Nemotron Ultra 253B 是英伟达把 405B 底模压成 253B、再把质量和开放度都顶到很高的代表作,文本推理与编码硬实力对标闭源旗舰,权重开源可商用。但只要记住两件事:它本质是「单卡跑不动、工具调用为零」的纯文本质量模型,用对场景是利器,用错场景是负担。
用户评论
-
Aaron.Wood—权重开源可商用,这点真香。 -
剑客645—在r/LocalLLaMA看了好久,大家共识是硬件门槛太高,消费级根本跑不动,好多人都在等HP DGX Station那个GB300出来才敢碰桌面级Ultra。西方开放模型里它算最强,但原始推理分还是低于Kimi和DeepSeek。 -
LSanders4—视觉能力为零,别拿它做多模态。 -
TIand—写作风格有点干涩,列表化太重。 -
PRamos1684—我们公司用它在内网做法律文档分析,长上下文和推理确实顶,比之前用API省钱还合规。 -
redelephant725—NIM微服务一键部署挺省心,OpenRouter上6毛输入1块8输出,比自己养8卡便宜多了。 -
CRcol—8张H100才能跑满血,消费级显卡直接劝退。 -
余贞—Unsloth的动态量化真不错,GGUF跑起来比想象中顺,虽然上下文得砍。 -
Doris_Simmons_2022—FP8比BF16还猛,这量化悖论有点反直觉,部署直接上FP8了。 -
Judith_Henderson007—推理开关这个设计很实用,复杂数学题开detailed thinking on能从80%拉到97%,平时关掉省token。就是知识截止在2023年,问最近的事会翻车,用之前得想清楚场景。 -
Sarah.Barnes_X403—上周帮一家金融风控客户做选型,他们之前跑DeepSeek-R1单节点显存峰值98%动不动就OOM雪崩,换成Ultra 253B之后同样的8卡H100稳多了,每天百万级请求扛得住。它不是拿来刷榜的,是真正解决部署工程痛点的。 -
SAgut—对比同门Super 120B,Ultra就是纯粹堆质量,吞吐慢一截但文本质量对标GPT-4级别。 -
iGuillermoCortes_dev—老实说规格表很漂亮但实际谁在用是个问题。我们测试下来代码生成15/15满分很离谱,长文档摘要和RAG也稳,可一旦涉及函数调用就直接歇菜,真要做agent还不如上Claude或者Qwen。把它当纯文本推理引擎用最舒服,别被官方agent叙事带偏。