RADIO框架:理由蒸馏如何解决RAG系统中重排序器与生成器的偏好不一致问题!
今天为大家分享来自香港城市大学 & 华为诺亚方舟实验室的最新工作 RADIO,这篇工作提出了一种基于理由蒸馏的偏好对齐框架,直接用生成器的“推理依据”去指导重排序器排序,从而让两者在信息选择上的目标一致,提升最终回答的准确性与稳定性。

论文:https://aclanthology.org/2025.findings-acl.220/
代码:https://github.com/Applied-Machine-Learning-Lab/RADIO
摘要
重排序器(reranker)和生成器(generator)是检索增强生成(Retrieval-Augmented Generation,RAG)流程中的两个关键组件,分别负责对相关文档进行排序以及生成回答。然而,由于预训练数据和目标的差异,重排序器判定为相关的文档与生成器生成针对查询的回答所需的文档之间,不可避免地存在不一致性。为了解决这一问题,我们提出了 RADIO,一种新颖且实用的偏好对齐框架,其核心是理由蒸馏(RAtionale DIstillatiOn)。具体而言,我们首先提出了一种理由提取方法,利用大语言模型(LLM)的推理能力,抽取回答查询所需的理由。随后,我们设计了一个基于理由的对齐过程,根据提取的理由对文档重新排序,并微调重排序器以更好地对齐偏好。在四个数据集的三个任务上的大量实验表明,我们的方法具有有效性和可迁移性。
主要创新点
- 我们提出了 RADIO,一个新颖且实用的框架,旨在解决 RAG 流水线中不同组件之间的偏好错位问题。
- 我们在 RAG 框架中引入了理由蒸馏,这是一种利用显式文本理由作为信号来对齐不同组件偏好的有效方法。
- 我们在三个任务、四个数据集上进行了大量实验,以验证 RADIO 的有效性和可迁移性。
方法

Rationale Extraction
利用大语言模型(LLM)的推理能力,从与查询相关的候选文档中抽取出回答该查询所需的显式理由(rationales)。这些理由是能够直接支撑答案的文本片段。
prompt:"You are a professional QA assistant. Given a question and the ground truth answer, you can output the rationale why the ground truth answer is correct. Question: {question}. Answer: {answer}. Rationale: "
对应公式:
Rationale-based Alignment
给定提取出的推理 ,一个关键挑战在于如何有效且高效地利用它来提升 RAG 流水线中的偏好一致性。在本节中,我们提出一种基于推理的对齐方法,其中推理作为信号用于微调重排器(reranker)。这样可以使重排器识别并优先选择能够帮助生成器产生准确回答的支持性文档。具体而言,我们首先使用检索器 基于查询检索出 个相关文档:
其中, 表示检索器 基于查询 和语料库 检索到的文档集合,且 。
接下来,为了方便比较不同文档与推理之间的相似性,我们使用文本编码器将文档和推理都转换为稠密向量: 和 分别表示第 个文档和推理的表示向量, 为第 个文档, 为提取出的推理。
然后,我们计算每个文档与推理之间的语义相似度。这里我们使用余弦相似度 。计算得到的分数表示文档对生成正确答案的支持程度,分数越高,支持性越强。我们还通过加权求和的方式,将文档的推理分数与检索阶段的检索分数进行线性插值融合:
其中,、 和 分别表示推理相似度分数、检索分数和最终分数, 是检索器中的打分函数, 是用于融合的超参数。需要注意的是,我们在融合之前对推理分数和检索分数均进行了 min-max 归一化。
接下来,我们根据分数对文档进行重新排序。我们选择排名最高的文档作为正样本,然后向后偏移 个文档,并从其后的文档中采样 个负样本,构造用于微调重排器的正负样本对。该过程可表示为:
其中, 和 分别表示采样的正样本和负样本文档, 表示从排名低于 的文档集合中采样 个负样本的操作。
我们使用 InfoNCE 作为微调重排器的优化目标:
其中, 和 分别表示正样本和负样本文档, 为温度参数, 表示负样本文档的数量。
实验
Open-domain QA

- 与 Base 方法相比,大多数实验设置都取得了更好的结果,说明在 RAG 中进行偏好对齐是必要的。
- 与其他基线方法相比,RADIO 在所有数据集和重排器下都始终表现出更优的性能。
- 在 TriviaQA 上,当使用重排器 gte-large 和 bge-reranker-base 时,RRR 和 REPLUG 等方法的性能相较于 Base 方法出现下降。这表明这些方法对模型变化较为敏感,从而限制了适用性。相比之下,RADIO 在不同重排器上表现出较强的适应性,并在三种重排器下均取得了显著的性能提升。
- 随着重排器规模变大或性能增强(如从 gte-base 到 gte-large,再到 bge-reranker-base),使用 RADIO 微调后的模型在性能排序上与重排器自身能力保持一致。这说明 RADIO 的性能提升具有可持续性和可扩展性,并能随着更强的重排器进一步探索 RAG 的性能上限。
Multi-choice Questions MMLU

- 从 ALL 类别对应的指标来看,RADIO 相较于 Base 实现了持续的提升。这凸显了 RADIO 的有效性和泛化能力,因为即使在开放域问答任务上进行微调,它仍能成功适应多选题任务。
- 按问题类别分析,RADIO 在人文学科和社会科学类别上相较于 Base 方法表现出更显著的提升,平均增幅分别为2.03% 和 2.13%。然而,在 STEM 类别上则表现出轻微的负面影响。这可能是由于微调所用的数据集(NQ 和 TriviaQA)属于开放域问答数据集,其分布更接近人文与社会科学,而与 STEM 学科差异较大。
- 与其他基线方法相比,RADIO 在绝大多数指标上都取得了最优表现,体现了其优越性和最新的先进水平。
Multi-hop QA Musique

- 首先,RADIO 在所有评估指标(EM 和 F1)上均取得了显著的性能提升,体现了其在多跳推理任务中的任务泛化能力。在 NQ 源数据集上,RADIO 的 EM 值为 0.0699,F1 值为 0.1371,分别比 Base 方法提升了 5.59% 和 5.71%。在 TriviaQA 源数据集上,RADIO 的 EM 值为 0.0695,F1 值为 0.1347,分别比 Base 方法提升了 4.98% 和 3.86%。
- 其次,与其他基线方法相比,RADIO 在 NQ 和 TriviaQA 两个源数据集上都表现出更加均衡且一致的优势。值得注意的是,当使用 NQ 作为源数据集时,只有 RADIO 在 EM 指标上表现为正向提升,而其他所有基线方法在不同程度上均出现了负向下降。
可迁移性分析

我们在两个不同任务的数据集 NQ 和 MMLU 上进行实验,使用三种不同的生成器(Llama3.1-8b-instruct、qwen2.5-14b-instruct 和 gpt4o-mini),并结合在 NQ 上微调的 bge-reranker-base,以验证我们方法的可迁移性,结果如表所示。我们发现:(1) RADIO 在不同生成器上都能保持其有效性,持续提升原始 RAG 的性能,这表明 RADIO 在多种生成器上的可迁移性较强。(2) 不同生成器的比较结果显示,RADIO 在规模较小、能力较弱的生成器上性能提升更为显著。具体来说,当生成器分别为 Llama3.1、Qwen2.5 和 GPT4o-mini 时,RADIO 在 EM 上的提升分别为 8.72%、6.28% 和 3.74%,在 F1 上的提升分别为 6.82%、6.00% 和 4.22%。这是因为随着生成器能力的提升并接近 RAG 的性能上限,进一步提升RAG性能的难度会增加,从而导致性能增幅变小。
消融实验

为探索推理分数和检索分数的具体影响,我们在 bge-reranker-base 重排器下设计了以下变体:
- w/o ALL: 未经过微调的基础重排器,不引入推理分数或检索分数。
- w/o Retrieval: 仅基于推理分数对文档排序并微调重排器。
- RADIO: 基于推理分数和检索分数共同微调重排器。
表中展示了在 NQ 和 MMLU 上的消融实验结果,我们可以得出以下结论:(1) 推理分数和检索分数均对 RADIO 的性能提升有正向贡献,其中推理分数的正向影响比检索分数更强。(2) RADIO 的表现优于 w/o ALL 和 w/o Retrieval,同时 w/o Retrieval 优于 w/o ALL。这表明推理分数与检索分数并不冲突,而是相互补充。两者结合能够为文档排序提供更强的信号,从而有效辅助重排器的微调。(3) 在 MMLU 数据集的 STEM 类别中,w/o ALL 的表现优于 w/o Retrieval 和 RADIO。这可能是因为训练数据集(NQ)中的问题分布更接近人文和社会科学,从而导致在人文、社会科学及其他类别的趋势与 STEM 类别存在差异。
0基础怎么学习AI大模型?
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。
这份完整版的大模型 AI 学习和面试资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】


第一阶段: 从大模型系统设计入手,讲解大模型的主要方法;
第二阶段: 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用;
第三阶段: 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统;
第四阶段: 大模型知识库应用开发以LangChain框架为例,构建物流行业咨询智能问答系统;
第五阶段: 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型;
第六阶段: 以SD多模态大模型为主,搭建了文生图小程序案例;
第七阶段: 以大模型平台应用与开发为主,通过星火大模型,文心大模型等成熟大模型构建大模型行业应用。

👉学会后的收获:👈
• 基于大模型全栈工程实现(前端、后端、产品经理、设计、数据分析等),通过这门课可获得不同能力;
• 能够利用大模型解决相关实际项目需求: 大数据时代,越来越多的企业和机构需要处理海量数据,利用大模型技术可以更好地处理这些数据,提高数据分析和决策的准确性。因此,掌握大模型应用开发技能,可以让程序员更好地应对实际项目需求;
• 基于大模型和企业数据AI应用开发,实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模型(数据准备、数据蒸馏、大模型部署)一站式掌握;
• 能够完成时下热门大模型垂直领域模型训练能力,提高程序员的编码能力: 大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握可以提高程序员的编码能力和分析能力,让程序员更加熟练地编写高质量的代码。

1.AI大模型学习路线图
2.100套AI大模型商业化落地方案
3.100集大模型视频教程
4.200本大模型PDF书籍
5.LLM面试题合集
6.AI产品经理资源合集
👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

为武汉地区的开发者提供学习、交流和合作的平台。社区聚集了众多技术爱好者和专业人士,涵盖了多个领域,包括人工智能、大数据、云计算、区块链等。社区定期举办技术分享、培训和活动,为开发者提供更多的学习和交流机会。
更多推荐


所有评论(0)