logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从 RAG 到评估革命:OpenAI 论文戳破AI幻觉的底层逻辑,可信AI缺的不只是数据

摘要:OpenAI最新论文揭示了AI产生幻觉的两大原因:评估体系鼓励猜测和模型训练机制缺陷。主流评测仅关注准确率,导致开发者训练模型"硬猜"而非诚实回答"不知道"。同时,大模型基于"下一个词预测"训练,缺乏错误示例,对低频随机事实只能猜测。解决方案需双管齐下:RAG技术提供实时知识检索,重构评估体系以奖励"不确定"回答。可信AI的关键不在于永远正确,而在于诚实面对知识边界,这需要技术和评估范式的共

文章图片
#人工智能#机器学习#深度学习
AI也会复盘了?谷歌Reasoning Bank让AI不再重复犯错

谷歌团队在《ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory》论文中提出突破性AI记忆框架,通过"推理银行"系统让智能体实现自我进化。该技术摒弃传统微调方法,采用结构化记忆存储策略经验(成功与失败案例),结合记忆感知测试机制(MaTTS)形成学习闭环。实测显示任务成功率提升34.2%,交互效率提高1

文章图片
#人工智能
推理大模型VS通用大模型:提示词设计差异及技巧

摘要: 大型语言模型(LLM)分化为通用大模型(如GPT-5)与推理大模型(如DeepSeek-R1)。通用模型擅长广泛语言任务,需通过角色扮演和详细提示词引导;推理模型专精逻辑推理,内置推理链机制,无需角色指定即可自动分步解答。提示词设计上,通用模型需明确指令、上下文和示例,而推理模型只需简洁提问,冗余信息反而干扰其固有推理流程。这种差异源于两类模型的设计目标:通用模型依赖外部引导激活能力,推理

文章图片
#人工智能
推理大模型VS通用大模型:提示词设计差异及技巧

摘要: 大型语言模型(LLM)分化为通用大模型(如GPT-5)与推理大模型(如DeepSeek-R1)。通用模型擅长广泛语言任务,需通过角色扮演和详细提示词引导;推理模型专精逻辑推理,内置推理链机制,无需角色指定即可自动分步解答。提示词设计上,通用模型需明确指令、上下文和示例,而推理模型只需简洁提问,冗余信息反而干扰其固有推理流程。这种差异源于两类模型的设计目标:通用模型依赖外部引导激活能力,推理

文章图片
#人工智能
别再迷信“大力出奇迹”了!大模型的下一个胜负手,藏在“后训练”里

摘要:从GPT-3到Grok-3,AI发展曾依赖"堆参数"策略,但随着规模扩大,边际效益骤减。当前AI竞争焦点已转向后训练阶段,包括监督微调(SFT)和强化学习(RL)两大核心。SFT通过高质量数据建立行为准则,RL则通过反馈机制优化输出。评估成为后训练的关键门槛,需结合自动评估和人工评估。普通开发者完全可以通过聚焦特定场景、高质量小数据实现有效优化。大模型未来将更强调精细化训

文章图片
#人工智能#深度学习#机器学习
大模型智能体设计模式第3讲:并行化

本文探讨大模型智能体系统中的任务并行化方法,通过对比串行与并行执行模式的效率差异,指出精准拆解无依赖任务是实现高效并行的关键。文章介绍了LangChain、LangGraph和Google ADK三种主流框架的并行实现方案,包括轻量级任务打包、图结构编排和多智能体协作等方式,并提供了具体代码示例。同时提出并行化需注意的三个常见问题:资源上限控制、任务失败处理和结果顺序管理,强调并行不等于无序执行。

文章图片
#设计模式#java#大数据
大模型设计模式第4讲:Reflection模式

本文介绍了大模型应用中的“反思模式”,这是一种让模型自我评估和改进输出的关键机制。文章指出,模型的首次输出往往存在缺陷,而反思模式通过"执行-评估-改进-迭代"的闭环流程,能显著提升输出质量。文章详细阐述了生产者-批评者双智能体结构,并提供了实践落地的关键策略,如控制反思深度、量化评价标准等。同时分析了反思模式的优缺点,强调其适合高价值、高容错成本场景。最后展望未来,指出反思模

文章图片
#设计模式#java#大数据
大模型设计模式第4讲:Reflection模式

本文介绍了大模型应用中的“反思模式”,这是一种让模型自我评估和改进输出的关键机制。文章指出,模型的首次输出往往存在缺陷,而反思模式通过"执行-评估-改进-迭代"的闭环流程,能显著提升输出质量。文章详细阐述了生产者-批评者双智能体结构,并提供了实践落地的关键策略,如控制反思深度、量化评价标准等。同时分析了反思模式的优缺点,强调其适合高价值、高容错成本场景。最后展望未来,指出反思模

文章图片
#设计模式#java#大数据
大模型智能体设计模式第3讲:并行化

本文探讨大模型智能体系统中的任务并行化方法,通过对比串行与并行执行模式的效率差异,指出精准拆解无依赖任务是实现高效并行的关键。文章介绍了LangChain、LangGraph和Google ADK三种主流框架的并行实现方案,包括轻量级任务打包、图结构编排和多智能体协作等方式,并提供了具体代码示例。同时提出并行化需注意的三个常见问题:资源上限控制、任务失败处理和结果顺序管理,强调并行不等于无序执行。

文章图片
#设计模式#java#大数据
大模型智能体设计模式第3讲:并行化

本文探讨大模型智能体系统中的任务并行化方法,通过对比串行与并行执行模式的效率差异,指出精准拆解无依赖任务是实现高效并行的关键。文章介绍了LangChain、LangGraph和Google ADK三种主流框架的并行实现方案,包括轻量级任务打包、图结构编排和多智能体协作等方式,并提供了具体代码示例。同时提出并行化需注意的三个常见问题:资源上限控制、任务失败处理和结果顺序管理,强调并行不等于无序执行。

文章图片
#设计模式#java#大数据
    共 14 条
  • 1
  • 2
  • 请选择