logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

LLM综述系列-RL难样本学习

摘要 本文系统综述了大语言模型(LLM)强化学习中的难样本学习问题。研究发现,在主流GRPO框架下,全对或全错的训练样本会产生零梯度,导致训练效率低下。文章提出五维分类法,梳理56篇代表性工作:(1)样本过滤与动态采样;(2)课程学习与难度递进;(3)难度感知数据选择;(4)工业实践;(5)富反馈与蒸馏技术。分析揭示了领域存在的六大方法论问题,包括理论重复性、难度漂移、过滤与保留的路线争议等,并着

#机器学习#人工智能#算法
vscode下python代码没有高亮显示

vscode下使用python代码不能高亮

文章图片
#python
vscode下python代码没有高亮显示

vscode下使用python代码不能高亮

文章图片
#python
【导数术】4.三次函数

原创《导数术》,对高中数学导数部分的内容进行了总结。4.三次函数

文章图片
#抽象代数
【导数术】14.凹凸反转

原创《导数术》,对高中数学导数部分的内容进行了总结。14.凹凸反转

文章图片
#抽象代数
【导数术】6.端点效应

原创《导数术》,对高中数学导数部分的内容进行了总结。6.端点效应

文章图片
#抽象代数
d森林问题

d森林问题贪心选择策略

到底了