logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【干货收藏】深入浅出ReAct Agent:让AI边思考边行动的智能体开发实践

本文深入解析了ReAct Agent的核心原理与工程价值,详细阐述了"观察-思考-行动"的工作模式。通过对比传统编程,展示了ReAct Agent在处理复杂任务时的灵活性与优势。文章介绍了历史上下文、环境信息、LLM推理、工具调用等关键要素,并通过实例与伪代码清晰展示了实现方法,帮助开发者快速掌握从"写流程"到"造智能体"的关键跃迁。

文章图片
#react.js#人工智能#javascript +1
从零开始学ReAct Agent:大模型智能体的运行机制与实现技巧(值得收藏)

ReAct Agent智能体以大模型为大脑、工具为手脚,通过"思考-行动-观察"流程处理任务。由于模型存在幻觉和意图识别不明确等问题,执行过程不稳定,可能出现工具不全、执行错误等问题。因此需要通过提示词指导模型处理复杂任务的方法,限制执行次数确保系统稳定性。大模型自身能力有限,人类需参与指导其复杂任务处理能力。

文章图片
#AI#人工智能#RAG
从零开始学ReAct Agent:大模型智能体的运行机制与实现技巧(值得收藏)

ReAct Agent智能体以大模型为大脑、工具为手脚,通过"思考-行动-观察"流程处理任务。由于模型存在幻觉和意图识别不明确等问题,执行过程不稳定,可能出现工具不全、执行错误等问题。因此需要通过提示词指导模型处理复杂任务的方法,限制执行次数确保系统稳定性。大模型自身能力有限,人类需参与指导其复杂任务处理能力。

文章图片
#AI#人工智能#RAG
15分钟后搞懂AI大模型:基本概念、Prompt、RAG、Agent及多模态

随着大模型的迅猛发展,LLM 作为人工智能的核心力量,正以前所未有的方式重塑着我们的生活、学习和工作。无论是智能语音助手、自动驾驶汽车,还是智能决策系统,大模型都是幕后英雄,让这些看似不可思议的事情变为可能。

文章图片
#人工智能#架构#AI +1
【收藏必学】Agent元年实战:从技术框架到企业落地的完整指南

本文分析了Agent技术在企业落地面临的挑战,详细介绍了ReAct和Plan-and-Execute两种主流框架及其局限性。作者提出基于ReAct框架的优化方案,包括快慢思考模型结合、"泛化"工具定义、Multi-Agent协作机制和异常处理策略,解决了Agent在复杂业务场景中的稳定性问题。同时探讨了多意图处理和意图跳转等关键技术难题,为Agent技术从概念走向实际应用提供了实践参考。

文章图片
#transformer#深度学习#RAG +2
一文总结!2026年大模型Agent RL训练多轮planning技术,收藏这篇就够了!

DeepSeek R1带火基于GRPO的强化学习技术后,agentic tool use learning也开始用上了GRPO,Reinforce++, PPO, policy gradient等各种算法了(以前是SFT+DPO,需要大量的标注数据来cover bad case,当时标注高质量数据都把我标哭了),想让大模型学会使用code interpreter, web search等工具来增强

文章图片
#人工智能#AI#RAG +1
PPO过时了?GRPO/DAPO/GSPO/SAPO四大算法全面对比,揭秘最新强化学习技术趋势!

本文面向已了解强化学习中策略梯度(policy gradient)、优势函数(advantage)、重要性采样(importance sampling)等概念的读者,重点对大模型强化学习主流算法做一条线的梳理与比较。

文章图片
#算法#深度学习#机器学习 +2
(2万字硬核长文)大模型强化学习完全指南:从基础到Agentic RL实战技术解析!

本文系统介绍强化学习在大模型中的应用,从基础理论到核心算法(Q-learning、PPO、DPO等),重点解析Agentic RL与LLM-RL的本质区别。强调Agentic RL在多步决策、工具调用中的必要性,并详述Hugging Face TRL、ms-swift等主流框架及业界实践。文章指出,Agentic RL已成为智能体时代的标配技术,能赋予模型自主执行与持续进化能力,是构建复杂AI系统

文章图片
#人工智能#github#产品经理
大模型后训练核心技术解析:强化学习(RL)全流程,小白也能看懂的收藏级教程

大模型训练正从预训练转向后训练阶段,强化学习(RL)成为关键。文章详细介绍了RLHF(基于人类反馈)和RLVR(可验证奖励)两种强化学习方法,对比了PPO和GRPO等算法。针对RL训练中推理与训练系统耦合的复杂工程挑战,verl框架提供了有效解决方案,并提出了投机式Rollout等性能优化技术,显著提升大模型在复杂任务中的推理与决策能力。

文章图片
#人工智能#算法#开发语言
RouteRAG:小模型的自规划检索强化学习方案,性能媲美GPT-4o

RouteRAG通过"统一策略+两阶段奖励"将文本/图谱检索转化为端到端强化学习问题,让小模型能自主规划"何时查、查什么"。其统一动作空间和三段式检索引擎使模型可选择最优检索策略,两阶段训练先保证正确性再优化效率。实验显示,仅用1万条数据训练的小模型在多跳问答中性能超越同尺寸模型,甚至媲美GPT-4o-mini,大幅提升检索效率和准确性。

文章图片
#transformer#深度学习#人工智能 +2
    共 1380 条
  • 1
  • 2
  • 3
  • 138
  • 请选择