Nemotron Ultra 253B

英偉達 253B 開放權重推理模型,文字推理與編碼對標閉源旗艦,可商用

深度報告

  • Nemotron Ultra 253B 是英偉達在 Llama Nemotron 開源模型家族裡體量與定位最高的「質量旗艦」,全稱 Llama-3.1-Nemotron-Ultra-253B-v1。它基於 Meta 的 Llama-3.1-405B-Instruct 做蒸餾與神經架構搜尋壓縮,把 405B 壓成 253B 的稠密模型,主打企業級複雜推理與智慧體工作流。模型權重完全開放、允許商用,在 GPQA 科學推理、IFEval 指令遵循、LiveCodeBench 編碼上壓過了引數量大得多的 DeepSeek-R1。代價是它的工具呼叫與視覺能力實測幾乎為零,且跑滿血需要一整臺 8 卡 H100 節點。

  • 英偉達在 2025 年 GTC 上首次預告這款模型,並於 2025 年 4 月 7 日正式開源釋出。它的母體是 Meta 的 Llama-3.1-405B-Instruct,但英偉達沒有簡單微調,而是用一套叫 Puzzle 的神經架構搜尋(NAS)把模型「重新設計」了一遍:部分層直接跳過注意力、換成線性層,前饋網路(FFN)在不同塊裡用不同的擴充套件比,連續的 FFN 還會被融合成更寬更少的層。這套操作把視訊記憶體佔用壓下來,讓 253B 能在單臺 8xH100 節點上推理,而不是必須多機。 訓練上它走了三段後訓練:先用 650 億 token 做知識蒸餾、再用 880 億 token 做持續預訓練「重新打底」,然後是覆蓋數學、程式碼、推理、對話、工具呼叫的監督微調,最後用 GRPO 強化學習做對齊。整個過程的資料、配方和技術報告也都開源,開發者能復現和改造。模型知識截止在 2023 年,這是 Llama-3.1 底模帶來的硬限制。

  • Nemotron Ultra 253B 是一個稠密解碼器 Transformer,253B 引數每個 token 全部啟用,上下文視窗 128K。它最大的特點是「推理開關」:透過系統提示詞裡的 detailed thinking on 一句話就能在推理模式和非推理模式之間切換,不需要換模型。開啟推理後效能暴漲——MATH500 從 80.40% 衝到 97.00%,AIME25 從 16.67% 一路拉到 72.50%,LiveCodeBench 從 29.03% 跳到 66.31%,GPQA 從 56.60% 升到 76.01%。換句話說,它是一個把「要不要多想一會兒」交給使用者控制的推理模型。 和競品比,它的定位很清晰。相比 DeepSeek-R1(671B),它在 GPQA(76.01 vs 71.5)、IFEval(89.45 vs 83.3)、LiveCodeBench(66.31 vs 65.9)上略勝,吞吐量是前者的約四倍;但在 AIME25(72.50 vs 79.8)和 MATH500(97.00 vs 97.30)上稍遜。相比同門小弟 Nemotron Super 49B/120B,Ultra 是純粹的質量優先,靠堆引數把天花板頂高。

  • 模型權重本身免費、開放、可商用,遵循 NVIDIA Open Model License 疊加 Llama 3.1 社群許可。花錢的地方在算力。第三方聚合平臺 OpenRouter 上它的 API 定價是輸入每百萬 token 0.60 美元、輸出 1.80 美元,和英偉達自家 NIM 微服務基本同檔。本地部署按 8xH100 SXM 節點約 19.92 美元/小時(Lambda Labs 報價)算,FP8 量化下每百萬 token 成本約 1.04 美元(峰值)、3.31 美元(生產併發),質量價效比(每質量分成本 0.35 美元)優於 BF16 的 0.53 美元。

  • 社群裡玩這個模型的人,關注點幾乎都集中在「怎麼塞進自己能負擔的硬體」。Hugging Face 上已經有一堆社群量化版:llama.cpp 的 Q4_K_M、EXL3 的 3.6bpw(能塞進 128GB 視訊記憶體但上下文很受限)、還有 unsloth 等一鍵拉起方案。開發者普遍認可它在純文字推理和程式碼生成上的硬實力,把它當作本地替代 GPT-4/Claude 做企業內網推理的選項。但也有人直白吐槽:253B 實在太重,沒 8 卡 H100 根本跑不動滿血版,量化到能單卡跑又得犧牲上下文長度,體驗打折明顯。

  • 第三方評測機構 InferenceBench 在 8xH100 上用 vLLM 做了 12 項基準,結論很有參考價值。MT-Bench 上 BF16 拿 9.2、FP8 拿 9.47,推理項滿分 10.0、程式碼生成 15/15 滿分、長上下文和多語言都是 100%。但他們挖出一個反直覺的「FP8 悖論」:FP8 量化不僅沒掉點,質量反而比 BF16 更高,吞吐還快 40%、視訊記憶體省一半,結論是直接用 FP8 部署,別碰 BF16。 更刺眼的是兩個零分。工具呼叫 0/15 全掛,視覺理解 0/12 全掛。這意味著它名義上寫著「支援 tool calling、RAG、agent」,實測卻進不了真正的智慧體工作流,也根本不是多模態模型。行業普遍認為它是一枚被精心調校過的「文字質量利器」,但離 NVIDIA 宣傳的 agentic 敘事還有明顯落差。

  • 最需警惕的是能力宣傳與實際表現的落差。官方文件和模型卡把 tool calling、RAG、agent 列為核心賣點,可獨立評測裡函式呼叫是零分。如果團隊衝著「自建智慧體」去選它,會踩坑。其次是硬體門檻:8xH100 的部署基線把絕大多數中小團隊擋在門外,價效比優勢只在「已經擁有這張卡」的前提下才成立。 命名也是個坑。2025 年 12 月英偉達又發了「Nemotron 3 Ultra」,那是 MoE 混合架構的新一代,和這款 253B 稠密模型不是一回事;部分第三方榜單還把本文這款標成「2026-02-01 釋出、32K 上下文」,與官方 2025-04 釋出、128K 上下文對不上,屬於後設資料混亂。另外知識截止停在 2023 年,對時事類和近期事實類問答天然偏弱。

  • 它適合有 H100 算力、需要高質量純文字推理和程式碼生成的團隊:企業內部知識問答、法律/科研長文件分析、程式碼助手後端、對隱私和可控性要求高的本地部署場景。它也適合把 FP8 當預設精度、追求每美元質量最大化的推理服務。 不適合它的人也很明確。想做真智慧體、要穩定函式呼叫的,去看 Gemma 4、Qwen 或 Claude;要圖文多模態的,它直接出局;沒高階 GPU、只想在消費級顯示卡上跑的,253B 體量與你的硬體不在一個量級。務實做法是:把它當一枚頂配文字推理引擎用,別被「agent 模型」的標籤帶偏。

  • Nemotron Ultra 253B 是英偉達把 405B 底模壓成 253B、再把質量和開放度都頂到很高的代表作,文字推理與編碼硬實力對標閉源旗艦,權重開源可商用。但只要記住兩件事:它本質是「單卡跑不動、工具呼叫為零」的純文字質量模型,用對場景是利器,用錯場景是負擔。

使用者評論

  • 頭像
    Aaron.Wood
    權重開源可商用,這點真香。

  • 頭像
    劍客645
    在r/LocalLLaMA看了好久,大家共識是硬體門檻太高,消費級根本跑不動,好多人都在等HP DGX Station那個GB300出來才敢碰桌面級Ultra。西方開放模型裡它算最強,但原始推理分還是低於Kimi和DeepSeek。

  • 頭像
    LSanders4
    視覺能力為零,別拿它做多模態。

  • 頭像
    TIand
    寫作風格有點乾澀,列表化太重。

  • 頭像
    PRamos1684
    我們公司用它在內網做法律文件分析,長上下文和推理確實頂,比之前用API省錢還合規。

  • 頭像
    redelephant725
    NIM微服務一鍵部署挺省心,OpenRouter上6毛輸入1塊8輸出,比自己養8卡便宜多了。

  • 頭像
    CRcol
    8張H100才能跑滿血,消費級顯示卡直接勸退。

  • 頭像
    餘貞
    Unsloth的動態量化真不錯,GGUF跑起來比想象中順,雖然上下文得砍。

  • 頭像
    Doris_Simmons_2022
    FP8比BF16還猛,這量化悖論有點反直覺,部署直接上FP8了。

  • 頭像
    Judith_Henderson007
    推理開關這個設計很實用,複雜數學題開detailed thinking on能從80%拉到97%,平時關掉省token。就是知識截止在2023年,問最近的事會翻車,用之前得想清楚場景。

  • 頭像
    Sarah.Barnes_X403
    上週幫一家金融風控客戶做選型,他們之前跑DeepSeek-R1單節點視訊記憶體峰值98%動不動就OOM雪崩,換成Ultra 253B之後同樣的8卡H100穩多了,每天百萬級請求扛得住。它不是拿來刷榜的,是真正解決部署工程痛點的。

  • 頭像
    SAgut
    對比同門Super 120B,Ultra就是純粹堆質量,吞吐慢一截但文字質量對標GPT-4級別。

  • 頭像
    iGuillermoCortes_dev
    老實說規格表很漂亮但實際誰在用是個問題。我們測試下來程式碼生成15/15滿分很離譜,長文件摘要和RAG也穩,可一旦涉及函式呼叫就直接歇菜,真要做agent還不如上Claude或者Qwen。把它當純文字推理引擎用最舒服,別被官方agent敘事帶偏。