logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型推理(九):采样温度

因此,如果两个词的概率接近,比如:p(“美丽的”) = 0.32,p(“可爱的”) = 0.30。一旦选择了不同的词,所有后续的概率都会随之变化。这是一种混沌敏感性:微小的初始差异会导致后续语境的巨大变化,就像概率空间中的蝴蝶效应一样。舍入误差只是影响模型输出的很小的一部分,更常见的大部分变化来自于概率、随机性和上下文的相互作用。- 当 T > 1 时:除以较大的数会使分布更平坦,随机性更强,后续

#transformer#神经网络#机器学习
大模型推理(六):K/V缓存(KV cache)与上下文长度

每一步,模型都会保留所有之前已经写好的token的K和V,并为新的位置计算一个新的Q。” 每次都是一个新的查询。• 要回答这个问题,你需要将它与之前token(你缓存了这些token)的所有键进行比较,然后使用这些token(也缓存了这些token)的值来构建加权和。这就是为什么大模型的语言感觉流畅的原因:模型生成的每一个词都是在回顾所有内容,包括之前的整条消息和模型之前的回复的同时参与计算,而不

#transformer#神经网络#深度学习
大模型微调(四):人类反馈强化学习(RLHF)

每一步,它都会执行一个动作 a_t,获得一个奖励 r_t,并更新其策略以最大化预期的未来奖励。奖励信号内置于环境中,例如,游戏得分、机器人与目标的距离,或明确的成功/失败衡量标准。然后,大模型的“策略”,也就是模型生成响应的方式会被优化,以最大化这个学习到的奖励函数,而不是外部的奖励函数。微调仍然使用强化学习算法,通常是 PPO(近端策略优化,需要奖励模型,代价比较高)或是 DRPO(直接策略优化

#transformer#神经网络#机器学习
大模型微调(五):RLHF奖励模型与偏好损失函数

此外,我们定义了损失:L(\phi) = -\log \sigma(R_\phi(x, y^+) - R_\phi(x, y^-)),我们希望最小化这个损失,这意味着我们需要将 \phi 向减少它的方向移动。当你对 R_\phi(x, y^+) 和 R_\phi(x, y^-) 求损失函数的导数时,你会得到一个简单的公式,其中 \Delta = R_\phi(x, y^+) - R_\phi(x,

#神经网络#机器学习#transformer
大模型微调(七):近端策略优化PPO

其中,R是奖励模型的得分,表示人类对该响应的喜爱程度。在 LLM 的案例中,工程师们借用了 PPO,因为它很好地解决了一个非常具体的问题:如何利用奖励改进策略,同时避免突然的、破坏性的更新。它可以防止模型过度拟合奖励模型的偏差或训练数据中的极端样本,让模型更贴近人类的喜好,但不要忘记最初的良好习惯。PPO 会将 \pi_\theta 推向具有正优势的动作(标记/序列),并远离具有负优势的动作,但会

#transformer#神经网络#机器学习
大模型微调(七):近端策略优化PPO

其中,R是奖励模型的得分,表示人类对该响应的喜爱程度。在 LLM 的案例中,工程师们借用了 PPO,因为它很好地解决了一个非常具体的问题:如何利用奖励改进策略,同时避免突然的、破坏性的更新。它可以防止模型过度拟合奖励模型的偏差或训练数据中的极端样本,让模型更贴近人类的喜好,但不要忘记最初的良好习惯。PPO 会将 \pi_\theta 推向具有正优势的动作(标记/序列),并远离具有负优势的动作,但会

#transformer#神经网络#机器学习
大模型微调(五):RLHF奖励模型与偏好损失函数

此外,我们定义了损失:L(\phi) = -\log \sigma(R_\phi(x, y^+) - R_\phi(x, y^-)),我们希望最小化这个损失,这意味着我们需要将 \phi 向减少它的方向移动。当你对 R_\phi(x, y^+) 和 R_\phi(x, y^-) 求损失函数的导数时,你会得到一个简单的公式,其中 \Delta = R_\phi(x, y^+) - R_\phi(x,

#神经网络#机器学习#transformer
到底了