Nemotron

NVIDIA推出的開源大語言模型系列,開放權重和訓練資料用於構建專用AI代理

深度報告

  • NVIDIA Nemotron是一系列最開放的AI大語言模型,配備開放的權重、訓練資料和方案,提供業內領先的效率和準確性,用於構建專用的AI代理。

  • Nemotron系列的核心創新在於開放性,訓練資料和模型權重完全開放,可在Hugging Face免費下載。架構上採用混合Mamba-Transformer MoE架構,支援高達100萬token的上下文視窗。在部署方面支援vLLM、SGLang、Ollama、llama.cpp等開源框架,提供超高吞吐量推理,降低推理成本。

  • Nemotron產品線分為多個型號滿足不同需求:Nemotron 3 Nano 30B定位高價效比,適用於目標任務的最高準確性和效率;Nemotron 3 Super 120B在效率和準確性之間取得平衡,適合多智慧體環境處理複雜任務;Llama Nemotron Ultra 253B提供最高準確率,適用於多智慧體企業工作流;Nemotron Nano VL 12B專注視覺語言,適用於文件智慧和影片理解;Nemotron RAG提供檢索增強功能,包括提取、嵌入和重排序;Nemotron Safety提供安全稽核功能,包括越獄檢測、內容稽核、PII檢測;Nemotron語音提供完整語音AI能力,包括ASR、TTS和語音翻譯。

  • Nemotron的多模態能力涵蓋視覺理解、資訊檢索、語音處理和安全功能,支援RAG和智慧體應用等場景。

  • 當前頁面未提供具體的定價資訊。可用的部署和試用方式包括透過OpenRouter免費試用部分模型,NVIDIA NIM提供推理端點API服務,以及第三方推理提供商包括Baseten、DeepInfra、Fireworks AI、FriendliAI、Together AI等。

使用者評論

  • 頭像
    Jason_221
    Nemotron 3 Ultra 的 SWE-Bench 71.9% 挺猛的,關鍵是訓練配方和資料集全開源,這點英偉達比 Meta 大方多了。

  • 頭像
    MAjac
    試了一下 Nano Omni,30B 啟用 3B 就能跑多模態,影片理解吞吐是對標模型的 9 倍,25GB 視訊記憶體本地就能跑,這個效率確實離譜。

  • 頭像
    MarilynCooper00728
    那個 Nemotron 委員會模式被 SemiAnalysis 噴得夠嗆,說是群體思維拖累進度。不過模型本身是不錯的,委員會搞爛了不代表技術不行。

  • 頭像
    史鵬
    用 Nemotron 3 Super 做程式碼審查,12 秒審完 19 個檔案的 PR,抓出一個 CORS regression,比我手動快多了。不過對跨檔案上下文的建議偏淺。

  • 頭像
    Amanda.Cruz_2021
    本地用 Nano 30B 跑了一段時間,編碼任務確實強,但聊天太機器人了,像跟一個正經的工程師說話,沒得感情。

  • 頭像
    AbigailSchuster
    Ultra 的 PinchBench 91% 跟 Kimi K2.6 打平,但推理速度快了 4 倍多,實用性上我覺得英偉達的最佳化思路更實在。

  • 頭像
    Pamela.Scott_20237
    Mamba 生態還是不夠成熟,llama.cpp 和 Ollama 對 Nemotron 的支援半殘不殘的,非 N 卡使用者慎入。

  • 頭像
    James185
    Nemotron 3 Super 的 SWE-Bench Multilingual 45.78% 吊打 GPT-OSS 的 30.8%,多語言程式碼修復場景下差距真大。

  • 頭像
    ABell520155
    跑了一下 1M context,真的能塞進整個程式碼庫做分析,官方說的 100 萬 token 不是吹的。不過載入時間有點長。

  • 頭像
    Linda.Roberts_Plus
    話說 OpenRouter 上 Nemotron 3 Super 免費,0 美元 / 百萬 token,薅羊毛搞 agent 開發挺香的。

  • 頭像
    crazybird811
    太囉嗦了這個模型,同樣的任務它輸出的 token 比別的模型多一大截,做生產環境要掂量一下 token 成本。之前用 Super 搭過一個小型 agent 服務,同樣一個客服工單分類的任務,Super 輸出 800 token,Qwen3.5 只要 300 token,量級差了將近三倍,雖然準確率差不多但成本翻倍了。

  • 頭像
    JanetNeal
    NVFP4 量化真的是黑科技,精度幾乎不掉,但吞吐翻了好幾倍。Blackwell 上跑應該更爽。

  • 頭像
    RobertSimmonsJr
    Ultra 跑智慧體能撐 80 輪不掉鏈子,沒出現過幻覺論文標題的情況。同任務 DeepSeek V4 編了一個不存在的論文出來,高下立判。不過我用的 DeepInfra 收費,跑了完整 research pipeline 下來花了大概十幾刀,如果自建的話前期 infra 成本也不小,得看團隊有沒有這個部署能力。

  • 頭像
    dOUGLAS892
    Nemotron 3 Ultra 搭配 LangChain 的 Harness Engineering 方案,推理成本比 Opus 4.8 便宜 10 倍,差距只有 0.01。對中小企業來說夠用了。

  • 頭像
    RebeccaGomez1685
    用 Cascade 跑 HumanEval 97.6%,ClassEval 88%,30B 總參 3B 啟用能有這個編碼能力,紅迪上那哥們說得對,確實被低估了。

  • 頭像
    CosmosCris915
    搞深度研究的瓶頸已經不在模型本身了,英偉達把整個工具箱都開源了,什麼 Nemoclaw、OpenShell 一套下來,搭 agent 比之前舒服太多。之前搭多智慧體系統從零開始搞 agent 框架搭了好幾天,現在直接拿 OpenShell 的沙盒加編排框架,半天就搭起來了,門檻確實降了很多。

  • 頭像
    JoseBaileyII
    中文理解能力跟國產模型比差距還是挺明顯的,畢竟主要最佳化的是英文 Agent 場景,做中文產品的話優先考慮 Qwen 或者 DeepSeek。

  • 頭像
    Patricia.Cox
    Greptile 測完說 Super 是「一流的初輪審查工具」,我自己用下來也是這樣,程式碼審查場景是真的強。

  • 頭像
    MelissaGray
    聯網搜尋配合 Nemotron Nano 30B 本地跑,那篇 OpenWebUI 上的評測說得在理,體驗比很多雲端小模型還好。

  • 頭像
    IFlores168
    英偉達搞的這個開源協議比 Llama 那些偽開源清爽多了,沒有月活限制,商業部署不用提心吊膽。之前公司想用 Llama 做產品,法務一看那個商用協議裡一堆附加條款,折騰了好久才放行。Nemotron 的 OpenMDW-1.1 雖然也有 patent termination clause,但整體限制少很多。

  • 頭像
    A_Lriv
    Super 在 RULER @1M 上 91.75%,對比 GPT-OSS 的 22.30% 簡直是降維打擊,長上下文場景選 Nemotron 沒毛病。

  • 頭像
    purplegoose369
    用 Ultra 寫了一個 FPS 小遊戲試水,從零開始生成程式碼搞了好幾天才跑起來,debug 能力倒是不錯,但創造性編碼真不是它的強項。

  • 頭像
    AmellyDa luz
    模型回覆一股子 RLHF 過度最佳化的味道,太保守太工整了,適合企業部署但不好玩。開箱即用選這個沒錯。

  • 頭像
    MStephens_77
    Cadence 用 Nemotron 3 Ultra 做晶片驗證,把 RTL 驗證從幾周縮短到幾小時,這才是模型的正確用法。

  • 頭像
    JoseRoss_Max3
    Mamba-2 + Transformer 混搭架構真的是被低估的設計,長序列記憶體效率拉滿,純 Transformer 做 1M context 根本吃不消。我試過用同樣引數量級的純 attention 模型載入 500K context,視訊記憶體直接爆炸,Nemotron 的 Mamba 層在長序列上只存固定大小的狀態,這個設計差異在實際部署時是天壤之別。

  • 頭像
    MsChristopherCarpenter_dev
    Nemotron 3 Nano Omni 六個多模態榜單第一,MediaPerf 上影片標註吞吐比 GPT 5.1 還高,這你受得了嗎。

  • 頭像
    DorothyBrooksK
    試了試角色的扮演功能——本來以為這種企業級模型不會寫故事,結果寫了個賽博朋克修電腦的劇情,細節豐富到讓我有點吃驚。從叮咚作響的店門鈴鐺到貨架上那些壞掉的 Seagate 硬碟,再到那個戴老花鏡的老闆,整個氛圍描寫很線上,完全沒想到一個面向企業部署的模型能有這種敘事能力。

  • 頭像
    redmouse606
    Ultra 的 structured output 可靠性真不錯,200 次 JSON 請求只有 1 次格式錯誤,做 pipeline 很穩。

  • 頭像
    Eugene.Evans_Pro678
    卡在 Arena-Hard 73.88% 這個成績上,跟 GPT-OSS 的 90.26% 差了快 17 個點,聊天質量確實不如其他模型。

  • 頭像
    Harold84
    Super 的 120B 模型 Q4_K 量化後能在 M1 Ultra 上跑 1M context,雖然速度降得厲害但至少能跑,這一點已經領先很多同尺寸模型了。實測下來 prompt processing 從零 context 的 255 t/s 降到 200K context 時的 142 t/s,token generation 也從 26.7 降到 20.6 t/s,雖然慢但可用,這在半年前根本不敢想。