logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【理论推导】互信息与InfoNCE损失:从公式推导理解对比学习的本质

逐步理论推导:InfoNCE损失函数通过对比正负样本,实际上是在最大化变量间互信息的下界

#学习#机器学习#深度学习 +2
【论文阅读笔记】模仿学习中的误差界:从策略模仿到环境模仿

NeurIPS 2020、TPAMI 2022 论文阅读笔记。这篇文章研究模仿学习(Imitation Learning, IL)中的误差传播(compounding error)问题。核心结论是相比于 BC,用 GAIL 学习环境模型可将策略评估误差从二次降为线性

#论文阅读#学习#人工智能
【论文阅读笔记】IDAQ:离线元强化学习中的分布内在线适应

本文介绍了一种解决离线元强化学习中转移-奖励分布偏移问题的新方法IDAQ,通过理论分析和实验验证展示了其优越性能。

#论文阅读#学习#人工智能 +2
【论文阅读笔记】大模型多轮对话综述:Beyond single-turn A survey on multi-turn interactions with large language models

单轮交互模式极大地限制了LLMs能力的发挥,因为它忽略了对话中最关键的要素:历史上下文。本文综述了多轮交互任务及方法。

#论文阅读#语言模型#人工智能 +2
【论文阅读笔记】ReVal:让大模型强化学习真正支持离策略(off-policy)数据复用

这篇论文提出了 ReVal(Replay-based Value Learning),一种用于大语言模型(LLM)后训练的离策略(off-policy)价值强化学习方法,旨在解决大语言模型(LLM)在强化学习微调过程中样本效率低下与轨迹生成成本高昂的核心痛点。

#论文阅读#语言模型
【论文阅读笔记】多目标优化 + 强化学习(RL):Envelope Q-Learning,在Q更新中使用凸包络提升多目标优化效率

【NeurIPS 2019】Envelope Q-Learning,在Q更新中使用凸包络提升多目标优化效率:该算法利用凸包思想,避免传统方法对每个偏好单独训练的不可扩展性问题,并提供了理论收敛性证明。同时,算法设计了偏好适应机制,仅需少量样本即可推断隐藏偏好并快速调整策略。实验在四个复杂任务(Deep Sea Treasure、Fruit Tree Navigation、对话系统和Super Ma

#论文阅读#机器学习#人工智能 +3
【论文阅读笔记】多目标优化 + 强化学习(RL):Envelope Q-Learning,在Q更新中使用凸包络提升多目标优化效率

【NeurIPS 2019】Envelope Q-Learning,在Q更新中使用凸包络提升多目标优化效率:该算法利用凸包思想,避免传统方法对每个偏好单独训练的不可扩展性问题,并提供了理论收敛性证明。同时,算法设计了偏好适应机制,仅需少量样本即可推断隐藏偏好并快速调整策略。实验在四个复杂任务(Deep Sea Treasure、Fruit Tree Navigation、对话系统和Super Ma

#论文阅读#机器学习#人工智能 +3
【论文阅读笔记-meta rl】Meta-Q-Learning (MQL):Q-learning + 元强化学习

这篇文章提出了 Meta-Q-Learning (MQL),一个基于Q-learning的离策略(off-policy)元强化学习算法。它的核心发现令人意外:在现有meta-RL基准测试中,普通的TD3算法只要加上一个"上下文变量"(context variable)来表征历史轨迹,就能与MAML、PEARL等复杂的元学习算法平起平坐。基于这一发现,MQL进一步利用倾向得分估计(propensit

#论文阅读#机器学习#深度学习 +2
元强化学习经典方法:RL²、MAML-RL、MAESN、PEARL、VariBAD

本文将系统梳理2016-2020年间五个具有里程碑意义的元强化学习(Meta-RL)研究工作:RL²、MAML-RL、MAESN、PEARL和variBAD。这些工作共同解决的核心问题是:如何让智能体利用以往任务的经验,在新任务中通过极少的环境交互就能快速学习?

#机器学习#人工智能#pytorch +2
【论文阅读笔记】ReVal:让大模型强化学习真正支持离策略(off-policy)数据复用

这篇论文提出了 ReVal(Replay-based Value Learning),一种用于大语言模型(LLM)后训练的离策略(off-policy)价值强化学习方法,旨在解决大语言模型(LLM)在强化学习微调过程中样本效率低下与轨迹生成成本高昂的核心痛点。

#论文阅读#语言模型
    共 22 条
  • 1
  • 2
  • 3
  • 请选择