NVIDIA Nemotron 3 Embed 重磅开源:8B 登顶 RTEB 榜首,Agent 检索革命来了!
2026 年 7 月 16 日,NVIDIA 正式开源 Nemotron 3 Embed 系列嵌入模型,包含 8B 旗舰版和 1B 高效版。其中 8B 模型在 RTEB 多语言检索基准测试中排名第一,成为首个在 Agent 检索效率曲线上同时做到最高精度和最低 Token 消耗的开源嵌入模型。本文将带你从零上手,用代码实战 Nemotron 3 Embed!
一、为什么嵌入模型突然火了?
如果你做 RAG(检索增强生成),你一定知道:检索质量决定了 LLM 回答的准确性。
但在 2026 年的 Agent 时代,嵌入模型的重要性被提到了全新的高度——
Agent ≠ Chatbot
一个深度研究型 Agent 可能会执行 20~50 步推理,每一步都需要从外部知识库检索相关信息。如果检索质量不够好,Agent 会:
- 反复查询浪费 Token
- 携带噪音进入下一步推理
- 最终输出"幻觉"答案
NVIDIA Nemotron 3 Embed 正是在这个背景下诞生的。它的核心目标只有一个:让检索做到又快又准,为 Agent 提供坚实的"记忆系统"。

二、Nemotron 3 Embed 模型矩阵
NVIDIA 一口气发布了三个开放权重模型:
| 模型 | 参数 | 嵌入维度 | 上下文窗口 | 适用场景 |
|---|---|---|---|---|
| Nemotron-3-Embed-8B-BF16 | 8.0B | 4096 | 32K | 精度优先的企业级 RAG |
| Nemotron-3-Embed-1B-BF16 | 1.14B | 2048 | 32K | 延迟敏感的生产环境 |
| Nemotron-3-Embed-1B-NVFP4 | 1.14B | 2048 | 32K | Blackwell 超高吞吐部署 |
核心亮点
| 特性 | 说明 |
|---|---|
| RTEB #1 | 8B 版本在多语言检索基准上排名第一 |
| 32K 上下文 | 支持超长文档的嵌入编码 |
| 多语言支持 | 覆盖中文、英文、日文、韩文等 34 种语言 |
| 商业可用 | OpenMDW-1.1 开源协议,可直接商用 |
| 动态嵌入切片 | 支持从 2048 维截取任意子维度,重新 L2 归一化后性能损失极小 |
三、技术深度解析:NVIDIA 做了什么?
3.1 从因果解码器到双向编码器
传统的大语言模型(如 Ministral)使用因果注意力(Causal Attention),即每个 token 只能看到前面的 token。
嵌入模型需要双向注意力(Bidirectional Attention),即每个 token 可以看到句子中所有的 token。
NVIDIA 团队将 Ministral-3-8B-Instruct-2512 的因果解码器改造为双向编码器,这是 8B 模型的基础。
3.2 剪枝 + 蒸馏 = 1B 小钢炮
1B 版本不是从头训练的,而是通过结构剪枝 + 知识蒸馏从 3B 压缩而来:
3B 模型 → NAS 搜索最优架构 → 剪枝到 2B → 8B Teacher 蒸馏 → 2B Student
2B 模型 → NAS 再次搜索 → 剪枝到 1.14B → 8B Teacher 蒸馏 → 1B Student
这种"剪枝+蒸馏"的二阶段 pipeline 保证了 1B 模型保留了 8B 模型 95% 以上的检索准确率,但体积和速度都大幅优化。

3.3 NVFP4 量化:Blackwell 上的性能怪兽
1B-NVFP4 版本使用 NVIDIA Model Optimizer 将权重和激活量化到 4 位浮点,在 Blackwell GPU 上吞吐量提升 2 倍,同时保持 99% 的 BF16 准确率。
四、手把手实战:用 Python 运行 Nemotron 3 Embed
4.1 安装环境
# 创建虚拟环境
python3 -m venv nemotron-embed
source nemotron-embed/bin/activate
# 安装依赖
pip install torch sentence-transformers
4.2 基础用法:计算文本嵌入
from sentence_transformers import SentenceTransformer
# 加载 1B 模型(推荐在 CPU/消费级 GPU 上运行)
model = SentenceTransformer("nvidia/Nemotron-3-Embed-1B-BF16")
# 定义查询和文档
query = "What is the capital of France?"
documents = [
"France is a country in Western Europe.",
"Paris is the capital and most populous city of France.",
"The Eiffel Tower is located in Paris, France."
]
# 编码:query 和 document 使用不同的前缀
query_embedding = model.encode(query) # 自动添加 "query: " 前缀
doc_embeddings = model.encode(documents) # 自动添加 "document: " 前缀
print(f"Query embedding shape: {query_embedding.shape}") # (2048,)
print(f"Document embeddings shape: {doc_embeddings.shape}") # (3, 2048)
4.3 语义搜索
import numpy as np
def semantic_search(query, documents, model, top_k=3):
"""语义搜索:计算 query 与 documents 的余弦相似度"""
query_emb = model.encode(query)
doc_embs = model.encode(documents)
# L2 归一化
query_emb = query_emb / np.linalg.norm(query_emb)
doc_embs = doc_embs / np.linalg.norm(doc_embs, axis=1, keepdims=True)
# 计算相似度
scores = np.dot(doc_embs, query_emb)
# 排序
top_indices = np.argsort(scores)[::-1][:top_k]
results = []
for idx in top_indices:
results.append({
"text": documents[idx],
"score": float(scores[idx])
})
return results
# 测试
docs = [
"Python is a programming language.",
"PyTorch is a deep learning framework.",
"NVIDIA Nemotron 3 Embed is a state-of-the-art embedding model.",
"The Eiffel Tower is in Paris.",
"Machine learning is a subset of artificial intelligence."
]
results = semantic_search("What is Nemotron 3 Embed?", docs, model)
for r in results:
print(f"Score: {r['score']:.4f} | Text: {r['text']}")
# 输出:
# Score: 0.6723 | Text: NVIDIA Nemotron 3 Embed is a state-of-the-art embedding model.
# Score: 0.3512 | Text: PyTorch is a deep learning framework.
# Score: 0.2847 | Text: Machine learning is a subset of artificial intelligence.
4.4 构建 RAG 检索管道
from sentence_transformers import SentenceTransformer
import numpy as np
class NemotronRAGRetriever:
"""基于 Nemotron 3 Embed 的 RAG 检索器"""
def __init__(self, model_name="nvidia/Nemotron-3-Embed-1B-BF16"):
self.model = SentenceTransformer(model_name)
self.documents = []
self.embeddings = None
def index(self, documents):
"""索引文档"""
self.documents = documents
self.embeddings = self.model.encode(documents)
# L2 归一化
self.embeddings = self.embeddings / np.linalg.norm(self.embeddings, axis=1, keepdims=True)
print(f"Indexed {len(documents)} documents")
def retrieve(self, query, top_k=3):
"""检索最相关的文档"""
query_emb = self.model.encode(query)
query_emb = query_emb / np.linalg.norm(query_emb)
scores = np.dot(self.embeddings, query_emb)
top_indices = np.argsort(scores)[::-1][:top_k]
results = []
for idx in top_indices:
results.append({
"content": self.documents[idx],
"relevance": float(scores[idx])
})
return results
def retrieve_with_context(self, query, top_k=3):
"""检索结果并格式化为 LLM 友好的上下文"""
results = self.retrieve(query, top_k)
context = "\n\n".join([
f"[文档 {i+1}] (相关度: {r['relevance']:.3f})\n{r['content']}"
for i, r in enumerate(results)
])
return context, results
# ========== 实战测试 ==========
# 构建知识库
knowledge_base = [
"NVIDIA Nemotron 3 Embed is a collection of open embedding models released on July 16, 2026.",
"The 8B version ranks #1 on the RTEB multilingual retrieval benchmark.",
"The 1B model supports 34 languages and has a context window of 32K tokens.",
"Models are trained using bidirectional attention on Ministral backbone.",
"The 1B model uses structured pruning and knowledge distillation from the 8B teacher.",
"NVFP4 quantization doubles throughput on Blackwell GPUs while maintaining 99% accuracy.",
"The models support dynamic embedding slicing with re-normalization.",
"Embedding dimension: 8B model outputs 4096-dim vectors, 1B model outputs 2048-dim vectors."
]
# 初始化检索器
retriever = NemotronRAGRetriever()
retriever.index(knowledge_base)
# 查询
query = "How does the 1B model achieve efficiency?"
context, results = retriever.retrieve_with_context(query)
print(f"查询: {query}\n")
print("检索到的上下文:")
print(context)
# 模拟 LLM 回答(示意)
print("\n=== LLM 生成的回答(示意)===")
print("1B 模型通过两轮结构剪枝和知识蒸馏实现高效——")
print("首先从 3B 压缩到 2B,再压缩到 1.14B,")
print("期间使用 8B Teacher 模型进行蒸馏,保留了 95% 以上的检索准确率。")
4.5 动态嵌入切片技巧
Nemotron 3 Embed 支持动态切片,这是生产环境中非常实用的特性:
from sentence_transformers import SentenceTransformer
import numpy as np
model = SentenceTransformer("nvidia/Nemotron-3-Embed-1B-BF16")
text = "NVIDIA Nemotron 3 Embed supports dynamic embedding slicing."
full_emb = model.encode(text) # shape: (2048,)
# 切片到不同维度(保持前 N 维)
for dim in [256, 512, 1024, 2048]:
sliced = full_emb[:dim].copy()
# 重归一化(必须!)
sliced = sliced / np.linalg.norm(sliced)
print(f"Dim {dim}: shape={sliced.shape}, norm={np.linalg.norm(sliced):.4f}")
五、Agent 检索效率:为什么 Nemotron 3 Embed 是最优解?
NVIDIA 团队做了一项非常有趣的实验:用 Nemotron 3 Ultra 作为搜索 Agent 推理引擎,替换不同的嵌入模型,在 ViDoRe V3、BRIGHT、BrowseComp-Plus 三个基准上测试。
结果如下:

关键结论
| 嵌入模型 | 检索准确率 | 下游 Token 消耗 |
|---|---|---|
| Nemotron-3-Embed-8B | 最高 | 最低 |
| 其他开源模型 | 低 5-15% | 高 20-40% |
根本原因:更好的检索在第一步就返回了最相关的文档,Agent 无需反复查询和核实,从而大幅减少推理轮数和 Token 浪费。
六、企业级部署:NVIDIA NIM 微服务
对于生产环境,NVIDIA 同时发布了 Rust 实现的 NIM 微服务:
# 使用 NIM 部署 1B 模型
docker run --gpus all \
-e MODEL_NAME=nvidia/Nemotron-3-Embed-1B-BF16 \
-p 8000:8000 \
nvcr.io/nvidia/nim/nemotron-embed:3.0.0
调用 API:
import requests
response = requests.post(
"http://localhost:8000/v1/embeddings",
json={
"model": "nvidia/Nemotron-3-Embed-1B-BF16",
"input": ["query: What is RAG?", "document: RAG stands for Retrieval-Augmented Generation."]
}
)
embeddings = response.json()["data"]
七、总结与展望
为什么你应该关注 Nemotron 3 Embed?
- RTEB 第一:这是目前最强的开源嵌入模型,没有之一
- Agent 原生优化:专为多步 Agent 推理设计,能显著降低 Token 成本
- 多语言商业可用:34 种语言覆盖,OpenMDW 协议可直接商用
- 灵活部署:从 8B 旗舰到 1B 量化版,覆盖所有场景
- 完全开源:权重 + 训练配方全部公开,支持领域微调
适合人群
- ✅ 正在做 RAG 系统的开发者
- ✅ 构建 Agent/智能体应用的技术团队
- ✅ 需要多语言搜索能力的企业
- ✅ 希望降低 LLM Token 成本的工程团队
快速上手
pip install sentence-transformers
python -c "from sentence_transformers import SentenceTransformer; model = SentenceTransformer('nvidia/Nemotron-3-Embed-1B-BF16'); print(model.encode('Hello World').shape)"
模型下载地址:
- https://huggingface.co/nvidia/Nemotron-3-Embed-8B-BF16
- https://huggingface.co/nvidia/Nemotron-3-Embed-1B-BF16
- https://huggingface.co/nvidia/Nemotron-3-Embed-1B-NVFP4
本文发布于 2026 年 7 月 19 日,基于 NVIDIA 于 2026 年 7 月 16 日发布的 Nemotron 3 Embed 系列模型撰写。正是 WAIC 2026 在上海火热进行之时,Agentic AI 的落地黄金期已至,更高效的检索就是 Agent 的核心竞争力。
如果本文对你有帮助,欢迎点赞、收藏、转发!你的支持是我持续输出高质量技术文章的动力 💪
更多推荐



所有评论(0)