英偉達釋出 Nemotron 3 Embed,8B版登頂 RTEB 榜首
檢索層的軍備競賽
英偉達這次沒發聊天模型,而是發了一組「給 Agent 當記憶」的嵌入模型。7月17日,NVIDIA 釋出 Nemotron 3 Embed 系列,面向生產級 RAG、智慧體檢索、程式碼檢索和智慧體記憶。系列裡最亮眼的是8B 旗艦版,在最新檢索基準 RTEB 上拿下了總榜第一,得分78.5%,在 MMTEB Retrieval 上也有75.5%。
為什麼檢索模型值得單獨發?因為對 Agent 來說,檢索質量決定了它能「讀」到什麼證據。一個漏掉的文件,會讓 Agent 反覆搜尋、多燒 token,最後還可能基於錯誤上下文給出自信的錯誤答案。NVIDIA 內部用一個由 Nemotron 3 Ultra 驅動的搜尋 agent 做了測試:更好的檢索器能讓 agent 更早拿到相關證據,從而減少重複查詢和不必要的推理輪次。換句話說,提升檢索,常常比逼著推理模型去補救壞上下文更划算。
這個系列一次放出三個檢查點,覆蓋從精度到效率的整條曲線。8B 旗艦是「精度優先」的錨點;1B BF16 版把部署 footprint 做小,RTEB 得分72.4%,較上一代1B 錯誤率降了27%;還有專門面向 Blackwell 架構最佳化的1B NVFP4 四位元版,在保留99%以上精度的情況下,吞吐最高翻倍。三者都支援32K 上下文、多語言和程式碼檢索。
戰略上,這組模型是開放權重——權重、資料集、微調與蒸餾配方都開源,可透過 NeMo AutoModel 工具鏈在自己的基礎設施上微調。這跟 OpenAI、Cohere 那種閉源嵌入 API 是兩條路。對跑 RAG 或智慧體記憶的團隊來說,能用自己的語料微調檢索器,就不再是被通用排序綁死。IBM、Palantir、ServiceNow、Mem0 等公司已經在測。
值得警惕的是,這些數字目前都來自 NVIDIA 自己的測試套件,還沒有獨立第三方審計,RTEB 的排名應被當作強內部宣告而非中性結論。但對任何被 Agent 反覆查詢、token 賬單已經肉眼可見的團隊來說,在下次續費前,拿 Nemotron 3 Embed 跑一輪基準,確實值得。