
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
当一个人试图"作弊"以获得高分时,我们称之为作弊。当一个 RL 智能体这样做时,我们称之为——它发现了奖励函数的漏洞,并利用这些漏洞最大化奖励,而非真正完成目标。Reward Hacking 的经典例子:场景:训练机器人手臂抓取物体奖励函数: +1 分如果物体移动到目标区域观察到的行为:→ 机器人学会把物体推到目标区域附近→ 而非真正抓住它→ 因为"推到附近"比"抓住"更容易获得分数原因:奖励函数
阶段 1: SFT only→ 学会"按指令回答"→ 无法处理偏好、价值观阶段 2: RLHF (InstructGPT, ChatGPT)→ 引入 RM + PPO→ 性能强但训练复杂阶段 3: Direct Preference (DPO)→ 闭式解,无需 RL→ 工程简单,性能相当阶段 4: Self-Improvement (RLAIF, Self-Rewarding)→ AI 替代人类标
AI Agent 是能够自主感知环境、做出决策、执行行动的人工智能系统。感知 (Perception):观察环境状态、接收用户输入、读取工具结果推理 (Reasoning):分析信息、规划任务、做出决策行动 (Action):执行工具调用、操作环境、生成响应Agent = LLM + 工具 + 记忆 + 规划Agent 是一个有"目标感"的 LLM,它不仅能思考,还能主动采取行动。LangGrap
AI Agent 是能够自主感知环境、做出决策、执行行动的人工智能系统。感知 (Perception):观察环境状态、接收用户输入、读取工具结果推理 (Reasoning):分析信息、规划任务、做出决策行动 (Action):执行工具调用、操作环境、生成响应Agent = LLM + 工具 + 记忆 + 规划Agent 是一个有"目标感"的 LLM,它不仅能思考,还能主动采取行动。LangGrap
Transformer 用自注意力这一个核心机制,同时解决了 RNN 的并行性差、长程依赖弱、信息瓶颈三大难题。抽象,把"关注什么"与"内容是什么"解耦;缩放点积,用dk\sqrt{d_k}dk保持梯度稳定;多头机制,让模型并行捕捉多种关系;位置编码,弥补注意力的顺序盲区;残差 + LayerNorm,让深层堆叠得以训练。一个简单而优雅的架构,加上足够的数据和算力,能够产生远超预期的能力。








