返回信息流
新闻事件
Hugging Face Blog
1 个来源

NVIDIA Nemotron 3 Embed 在 RTEB 上排名第一,推动智能检索发展

NVIDIA 的 Nemotron 3 Embed 模型在 RTEB 基准测试中荣获整体排名第一,标志着智能检索技术的重大进步。这一成就展示了 NVIDIA 在检索任务 AI 嵌入技术领域的领导地位。

SynthePulse Insight · AI 深度解读

NVIDIA Nemotron 3 Embed 登顶 RTEB:检索质量如何重塑智能体效率

版本 1 · 1 个来源

NVIDIA 发布 Nemotron 3 Embed 系列,8B 旗舰模型在 RTEB 上排名第一,同时 1B 变体通过 NVFP4 量化实现 99%+ 精度保留与 2 倍吞吐提升。本文解析其技术路径、智能体场景下的 token 成本优化,以及开源策略对生态的影响。

  • Nemotron-3-Embed-8B-BF16 在 RTEB 上以 78.5% 得分排名第一,MMTEB Retrieval 得分 75.5%。
  • 1B BF16 变体在 RTEB 上得分 72.4%,相比前代错误率降低 27%。
  • NVFP4 变体在 Blackwell 上实现 BF16 2 倍吞吐,精度保留 99%+。
  • 在智能体评估中,更强检索可降低下游 token 成本,8B 模型同时实现最高精度和最低成本。
  • 模型基于 Ministral-3-8B-Instruct-2512 改造,采用双向编码器与对比预训练。
  • 开源权重、数据集和微调配方,支持 Hugging Face、NIM 微服务和 vLLM。
展开章节目录RTEB 榜首与多基准验证

RTEB 榜首与多基准验证

NVIDIA 于 2026 年 7 月 16 日发布 Nemotron 3 Embed 系列,其中旗舰模型 Nemotron-3-Embed-8B-BF16 在 RTEB(Retrieval Task Evaluation Benchmark)上以 78.5% 的 NDCG@10 得分排名第一。该模型在 MMTEB Retrieval 上同样取得 75.5% 的高分,显著超越前代 Nemotron 基线。

1B 变体 Nemotron-3-Embed-1B-BF16 在 RTEB 上得分 72.4%,相比其前身 llama-nemotron-embed-vl-1b-v2 错误率降低 27%;在 MMTEB Retrieval 上得分 71.0%,错误率降低 28%。评估还覆盖了 ViDoRe V3 Text 和 LongEmbed 基准,采用平均 NDCG@10 指标,进一步验证了模型在长文档和多语言场景下的鲁棒性。

智能体场景:检索质量与 token 成本的权衡

为衡量检索对智能体工作流的影响,NVIDIA 设计了一项实验:使用 Nemotron 3 Ultra 作为搜索智能体,仅更换嵌入模型,在 ViDoRe V3、BRIGHT 和 BrowseComp-Plus 三个数据集上评估平均检索精度与下游智能体 token 成本(按 GPT-5.5 定价估算)。结果显示,更强检索能更早返回相关证据,减少智能体的重复搜索和不必要推理步骤,从而降低 token 消耗。

Nemotron-3-Embed-8B-BF16 在三个数据集上同时实现了最高平均检索精度和最低估计 token 成本,确立了新的智能体检索前沿。1B 变体也显著优于前代,表明即使在小模型上,检索质量的提升也能直接转化为智能体效率的改善。

NVFP4 量化:效率与精度的平衡

针对高吞吐部署,NVIDIA 推出 Nemotron-3-Embed-1B-NVFP4,利用 Blackwell 架构的原生 NVFP4 加速,对线性层权重和激活进行 4 位量化,并通过量化感知蒸馏(QAD)恢复长序列精度。在 ViDoRe V3 上,该变体保留了 BF16 版本 99% 以上的检索精度,同时实现高达 2 倍的吞吐提升,内存占用显著降低。

与 Qwen3-Embedding-0.6B 和 EmbeddingGemma-300M 等小模型相比,NVFP4 变体在精度-效率曲线上占据明显优势。NVIDIA 还提供了基于 Rust 的 NIM 微服务,在 GB200 和 RTX PRO 6000 GPU 上,对于 256 和 1024 的输入序列长度,NIM 性能匹配或超越 vLLM 检查点。

模型架构与训练方法

Nemotron-3-Embed-8B-BF16 基于 Ministral-3-8B-Instruct-2512 骨干网络,将其因果解码器改造为双向编码器,以实现全序列检索。训练分为两个阶段:首先在网页来源和合成文本对的混合数据上进行对比预训练,然后在法律、金融、医疗、商业和教育等多领域多语言检索数据集上进行微调。

1B 模型通过蒸馏和量化技术从 8B 模型迁移知识。NVIDIA 开源了权重、数据集和 NeMo AutoModel 微调/蒸馏配方,允许团队在自有数据上进行领域适应和模型压缩。

生态集成与部署选项

Nemotron 3 Embed 系列在发布当日即获得广泛生态支持:模型权重已上传 Hugging Face,可通过 NVIDIA NIM 微服务部署,并兼容 vLLM 推理框架。32K 上下文窗口支持长文档、代码库和多轮智能体历史检索,减少截断损失。

多语言和代码检索能力覆盖全球企业数据和技术文档。NVIDIA 强调,开放权重和配方使团队能够完全控制检索模型的检查、调优和部署,适用于生产级 RAG、智能体检索、代码检索和智能体记忆等场景。

可信度边界

本文信息主要来源于 NVIDIA 在 Hugging Face 博客发布的官方技术文章,属于一手来源。所有基准测试结果由 NVIDIA 团队报告,未独立验证。RTEB 排名截图来自 2026 年 7 月 15 日的排行榜,但未提供其他竞争模型的详细得分。智能体 token 成本估算基于 GPT-5.5 定价公式,实际成本可能因场景而异。

核心结论

Nemotron 3 Embed 通过架构创新和量化技术,在检索精度和部署效率上均取得显著突破,尤其证明了高质量检索对降低智能体 token 成本的直接价值。开源策略有望推动企业级 RAG 和智能体系统的广泛采用。

主报道

Hugging Face Blog

主报道来源