logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Reward Hacking 深度解析:LLM 对齐中的奖励黑客问题

当一个人试图"作弊"以获得高分时,我们称之为作弊。当一个 RL 智能体这样做时,我们称之为——它发现了奖励函数的漏洞,并利用这些漏洞最大化奖励,而非真正完成目标。Reward Hacking 的经典例子:场景:训练机器人手臂抓取物体奖励函数: +1 分如果物体移动到目标区域观察到的行为:→ 机器人学会把物体推到目标区域附近→ 而非真正抓住它→ 因为"推到附近"比"抓住"更容易获得分数原因:奖励函数

#人工智能#transformer#深度学习 +2
RLHF 深度解析:从人类反馈到 PPO/GRPO/DPO 的对齐革命

阶段 1: SFT only→ 学会"按指令回答"→ 无法处理偏好、价值观阶段 2: RLHF (InstructGPT, ChatGPT)→ 引入 RM + PPO→ 性能强但训练复杂阶段 3: Direct Preference (DPO)→ 闭式解,无需 RL→ 工程简单,性能相当阶段 4: Self-Improvement (RLAIF, Self-Rewarding)→ AI 替代人类标

#人工智能#计算机视觉#pytorch +1
深入理解 AI Agent 架构:从单 Agent 到多 Agent 协作

AI Agent 是能够自主感知环境、做出决策、执行行动的人工智能系统。感知 (Perception):观察环境状态、接收用户输入、读取工具结果推理 (Reasoning):分析信息、规划任务、做出决策行动 (Action):执行工具调用、操作环境、生成响应Agent = LLM + 工具 + 记忆 + 规划Agent 是一个有"目标感"的 LLM,它不仅能思考,还能主动采取行动。LangGrap

#人工智能#机器学习#深度学习 +2
深入理解 AI Agent 架构:从单 Agent 到多 Agent 协作

AI Agent 是能够自主感知环境、做出决策、执行行动的人工智能系统。感知 (Perception):观察环境状态、接收用户输入、读取工具结果推理 (Reasoning):分析信息、规划任务、做出决策行动 (Action):执行工具调用、操作环境、生成响应Agent = LLM + 工具 + 记忆 + 规划Agent 是一个有"目标感"的 LLM,它不仅能思考,还能主动采取行动。LangGrap

#人工智能#机器学习#深度学习 +2
深入理解 Transformer:从自注意力到现代大模型的基石

Transformer 用自注意力这一个核心机制,同时解决了 RNN 的并行性差、长程依赖弱、信息瓶颈三大难题。抽象,把"关注什么"与"内容是什么"解耦;缩放点积,用dk\sqrt{d_k}dk​​保持梯度稳定;多头机制,让模型并行捕捉多种关系;位置编码,弥补注意力的顺序盲区;残差 + LayerNorm,让深层堆叠得以训练。一个简单而优雅的架构,加上足够的数据和算力,能够产生远超预期的能力。

#transformer#深度学习#人工智能 +2
到底了