文档向量化

文档向量化将文档块进行向量化编码,用于后续的向量检索,步骤如下图所示。
在这里插入图片描述

文档向量化示意图
具体而言,将切分后文档块作为输入,对其中的每个文档块应用向量化模型,生成相应的向量,并汇总这些向量以形成集合作为输出。
本方案采用通用向量化模型BGE对文档分块进行向量化处理,将每段文档映射为高维的密集向量,以便于后续的检索操作。BGE模型对于短查询到长文档的检索任务,每个短查询需要查询指令前缀开头,以提高检索效果,如下式所示。
〖emb〗_query=〖LM〗encode (concat(〖query〗(〖instruction〗_prefix ),query))
其中,〖LM〗_encode指和本文块嵌入使用同一模型,concat(·)表示将查询指令前缀和原始的查询拼接。
构建RAPTOR树
构建RAPTOR(RAPTOR:RECURSIVE ABSTRACTIVE PROCESSING FOR TREE-ORGANIZED RETRIEVAL递归抽象处理树状检索)树,按照语义对文档块做聚类,形成多个cluster。按照语义对chunk(文档块)做聚类,形成多个cluster(簇),利用LLM给每个cluster内的文档生成摘要总结,并为对总结也生成embedding,作为树的非Leaf叶节点;越接近Root(根)节点,语义越精简。
在这里插入图片描述

RAPTOR树构建流程示意图

更多推荐