英伟达发布 Nemotron 3 Embed,8B版登顶 RTEB 榜首

检索层的军备竞赛

2026-07-18 14:56

英伟达这次没发聊天模型,而是发了一组「给 Agent 当记忆」的嵌入模型。7月17日,NVIDIA 发布 Nemotron 3 Embed 系列,面向生产级 RAG、智能体检索、代码检索和智能体记忆。系列里最亮眼的是8B 旗舰版,在最新检索基准 RTEB 上拿下了总榜第一,得分78.5%,在 MMTEB Retrieval 上也有75.5%。

为什么检索模型值得单独发?因为对 Agent 来说,检索质量决定了它能「读」到什么证据。一个漏掉的文档,会让 Agent 反复搜索、多烧 token,最后还可能基于错误上下文给出自信的错误答案。NVIDIA 内部用一个由 Nemotron 3 Ultra 驱动的搜索 agent 做了测试:更好的检索器能让 agent 更早拿到相关证据,从而减少重复查询和不必要的推理轮次。换句话说,提升检索,常常比逼着推理模型去补救坏上下文更划算。

这个系列一次放出三个检查点,覆盖从精度到效率的整条曲线。8B 旗舰是「精度优先」的锚点;1B BF16 版把部署 footprint 做小,RTEB 得分72.4%,较上一代1B 错误率降了27%;还有专门面向 Blackwell 架构优化的1B NVFP4 四比特版,在保留99%以上精度的情况下,吞吐最高翻倍。三者都支持32K 上下文、多语言和代码检索。

战略上,这组模型是开放权重——权重、数据集、微调与蒸馏配方都开源,可通过 NeMo AutoModel 工具链在自己的基础设施上微调。这跟 OpenAI、Cohere 那种闭源嵌入 API 是两条路。对跑 RAG 或智能体记忆的团队来说,能用自己的语料微调检索器,就不再是被通用排序绑死。IBM、Palantir、ServiceNow、Mem0 等公司已经在测。

值得警惕的是,这些数字目前都来自 NVIDIA 自己的测试套件,还没有独立第三方审计,RTEB 的排名应被当作强内部声明而非中性结论。但对任何被 Agent 反复查询、token 账单已经肉眼可见的团队来说,在下次续费前,拿 Nemotron 3 Embed 跑一轮基准,确实值得。