
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文深入解析了ReAct Agent的核心原理与工程价值,详细阐述了"观察-思考-行动"的工作模式。通过对比传统编程,展示了ReAct Agent在处理复杂任务时的灵活性与优势。文章介绍了历史上下文、环境信息、LLM推理、工具调用等关键要素,并通过实例与伪代码清晰展示了实现方法,帮助开发者快速掌握从"写流程"到"造智能体"的关键跃迁。

ReAct Agent智能体以大模型为大脑、工具为手脚,通过"思考-行动-观察"流程处理任务。由于模型存在幻觉和意图识别不明确等问题,执行过程不稳定,可能出现工具不全、执行错误等问题。因此需要通过提示词指导模型处理复杂任务的方法,限制执行次数确保系统稳定性。大模型自身能力有限,人类需参与指导其复杂任务处理能力。

ReAct Agent智能体以大模型为大脑、工具为手脚,通过"思考-行动-观察"流程处理任务。由于模型存在幻觉和意图识别不明确等问题,执行过程不稳定,可能出现工具不全、执行错误等问题。因此需要通过提示词指导模型处理复杂任务的方法,限制执行次数确保系统稳定性。大模型自身能力有限,人类需参与指导其复杂任务处理能力。

随着大模型的迅猛发展,LLM 作为人工智能的核心力量,正以前所未有的方式重塑着我们的生活、学习和工作。无论是智能语音助手、自动驾驶汽车,还是智能决策系统,大模型都是幕后英雄,让这些看似不可思议的事情变为可能。

本文分析了Agent技术在企业落地面临的挑战,详细介绍了ReAct和Plan-and-Execute两种主流框架及其局限性。作者提出基于ReAct框架的优化方案,包括快慢思考模型结合、"泛化"工具定义、Multi-Agent协作机制和异常处理策略,解决了Agent在复杂业务场景中的稳定性问题。同时探讨了多意图处理和意图跳转等关键技术难题,为Agent技术从概念走向实际应用提供了实践参考。

DeepSeek R1带火基于GRPO的强化学习技术后,agentic tool use learning也开始用上了GRPO,Reinforce++, PPO, policy gradient等各种算法了(以前是SFT+DPO,需要大量的标注数据来cover bad case,当时标注高质量数据都把我标哭了),想让大模型学会使用code interpreter, web search等工具来增强

本文面向已了解强化学习中策略梯度(policy gradient)、优势函数(advantage)、重要性采样(importance sampling)等概念的读者,重点对大模型强化学习主流算法做一条线的梳理与比较。

本文系统介绍强化学习在大模型中的应用,从基础理论到核心算法(Q-learning、PPO、DPO等),重点解析Agentic RL与LLM-RL的本质区别。强调Agentic RL在多步决策、工具调用中的必要性,并详述Hugging Face TRL、ms-swift等主流框架及业界实践。文章指出,Agentic RL已成为智能体时代的标配技术,能赋予模型自主执行与持续进化能力,是构建复杂AI系统

大模型训练正从预训练转向后训练阶段,强化学习(RL)成为关键。文章详细介绍了RLHF(基于人类反馈)和RLVR(可验证奖励)两种强化学习方法,对比了PPO和GRPO等算法。针对RL训练中推理与训练系统耦合的复杂工程挑战,verl框架提供了有效解决方案,并提出了投机式Rollout等性能优化技术,显著提升大模型在复杂任务中的推理与决策能力。

RouteRAG通过"统一策略+两阶段奖励"将文本/图谱检索转化为端到端强化学习问题,让小模型能自主规划"何时查、查什么"。其统一动作空间和三段式检索引擎使模型可选择最优检索策略,两阶段训练先保证正确性再优化效率。实验显示,仅用1万条数据训练的小模型在多跳问答中性能超越同尺寸模型,甚至媲美GPT-4o-mini,大幅提升检索效率和准确性。








