
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
【RLHF实战】消费级显卡突围:在 8G 显存单卡跑通奖励模型 (RM) 训练
本文介绍了在消费级显卡(如RTX 4060 8G)上实现大语言模型人类对齐的奖励模型(RM)训练方法。文章首先解释了为什么需要进行人类对齐,指出预训练模型存在的三大缺陷:幻觉问题、指令遵循困难和价值观未对齐。接着概述了RLHF(基于人类反馈的强化学习)的核心三步流程,重点聚焦于奖励模型的训练与实现。详细阐述了RM模型的输入输出规范、结构改造和数学原理,包括Bradley-Terry模型和极大似然估

【SGD】随机梯度下降法的研究方向综述
现在随着AI的兴趣,机器学习、深度学习、强化学习等问题广泛应用在各个领域,而最优化问题求解,即损失函数最小化成为了求解问题关键的一个环节。使得最近20年,优化方法发展迅速,许多人从不同的角度去阐释算法改良的路线。包括从优化问题本身(凸或非凸,光滑或离散)、自适应学习率(动态调整学习率,减少手调参数的频率,应用更多的场景)、加速技巧(动量加速类的算法)等。因此,许多领域的学者都致力于研究该问题的改进

到底了







