
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
逐步理论推导:InfoNCE损失函数通过对比正负样本,实际上是在最大化变量间互信息的下界
NeurIPS 2020、TPAMI 2022 论文阅读笔记。这篇文章研究模仿学习(Imitation Learning, IL)中的误差传播(compounding error)问题。核心结论是相比于 BC,用 GAIL 学习环境模型可将策略评估误差从二次降为线性
本文介绍了一种解决离线元强化学习中转移-奖励分布偏移问题的新方法IDAQ,通过理论分析和实验验证展示了其优越性能。
单轮交互模式极大地限制了LLMs能力的发挥,因为它忽略了对话中最关键的要素:历史上下文。本文综述了多轮交互任务及方法。
这篇论文提出了 ReVal(Replay-based Value Learning),一种用于大语言模型(LLM)后训练的离策略(off-policy)价值强化学习方法,旨在解决大语言模型(LLM)在强化学习微调过程中样本效率低下与轨迹生成成本高昂的核心痛点。
【NeurIPS 2019】Envelope Q-Learning,在Q更新中使用凸包络提升多目标优化效率:该算法利用凸包思想,避免传统方法对每个偏好单独训练的不可扩展性问题,并提供了理论收敛性证明。同时,算法设计了偏好适应机制,仅需少量样本即可推断隐藏偏好并快速调整策略。实验在四个复杂任务(Deep Sea Treasure、Fruit Tree Navigation、对话系统和Super Ma
【NeurIPS 2019】Envelope Q-Learning,在Q更新中使用凸包络提升多目标优化效率:该算法利用凸包思想,避免传统方法对每个偏好单独训练的不可扩展性问题,并提供了理论收敛性证明。同时,算法设计了偏好适应机制,仅需少量样本即可推断隐藏偏好并快速调整策略。实验在四个复杂任务(Deep Sea Treasure、Fruit Tree Navigation、对话系统和Super Ma
这篇文章提出了 Meta-Q-Learning (MQL),一个基于Q-learning的离策略(off-policy)元强化学习算法。它的核心发现令人意外:在现有meta-RL基准测试中,普通的TD3算法只要加上一个"上下文变量"(context variable)来表征历史轨迹,就能与MAML、PEARL等复杂的元学习算法平起平坐。基于这一发现,MQL进一步利用倾向得分估计(propensit
本文将系统梳理2016-2020年间五个具有里程碑意义的元强化学习(Meta-RL)研究工作:RL²、MAML-RL、MAESN、PEARL和variBAD。这些工作共同解决的核心问题是:如何让智能体利用以往任务的经验,在新任务中通过极少的环境交互就能快速学习?
这篇论文提出了 ReVal(Replay-based Value Learning),一种用于大语言模型(LLM)后训练的离策略(off-policy)价值强化学习方法,旨在解决大语言模型(LLM)在强化学习微调过程中样本效率低下与轨迹生成成本高昂的核心痛点。








