logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

深度学习中的参数更新方法

SGD:基础款,手动挡,容易震荡。:加了惯性,跑得快,但还得手动调学习率。AdaGrad:能自动调学习率,但容易过早停止(学习率降太快)。RMSProp:解决了过早停止问题,只关注近期梯度。:既有惯性,又能自动调速,全能选手。

#深度学习#神经网络#自然语言处理 +1
别让大模型“胡说八道”:拆解 LLM 的“幻觉”与“中年健忘症”

摘要: 大模型常出现"幻觉"(一本正经地胡说八道)和"迷失在中间"(遗忘长文本中间内容)两大问题。前者源于模型本质是概率续写机而非事实库,后者因注意力机制导致中间信息被忽略。解决方案包括:1)采用RAG架构,通过检索和重排关键片段;2)优化提示词,如事实锚定、思维链和指令后置。这些方法能有效约束模型输出,平衡创造力和准确性。(149字)

#人工智能
浅析大模型 Agent 的记忆(Memory)机制

摘要: 本文深入探讨了大模型Agent记忆机制的设计挑战与解决方案。首先分析了全量历史对话堆叠带来的三大技术灾难:计算复杂度爆炸、中间迷失现象和商业化成本问题。随后指出纯向量RAG方案的"时序坍塌"缺陷,即语义相似但时间冲突的信息召回问题。核心解决方案是构建基于状态机的记忆固化系统,通过异步解耦、信息降维和冲突状态机实现精准记忆管理。最后提出混合检索架构(图谱路由+倒排索引+向量召回)解决复杂关联

#语言模型#深度学习#RAG
从 @Tool 装饰器到 MCP,浅析大模型工具生态与 Function Calling 的底层逻辑

本文解析了大模型工具生态中的核心概念与底层逻辑。通过"餐馆点餐"类比,区分了工具定义(菜单)、Function Calling(点菜)和工具执行(做菜)三个环节。重点对比了本地@tool装饰器与跨平台MCP协议:@tool适合快速开发但绑定特定框架,MCP则实现跨语言/跨框架的工具复用。文章还探讨了动态工具发现方案(工具检索器和分层架构)以应对工具爆炸问题。最终指出未来架构将是Function C

#人工智能#语言模型#自然语言处理
大模型 API 省钱秘籍:带你读懂什么是“缓存命中”

摘要: 大模型API中的"缓存命中"能大幅降低使用成本。当用户重复发送相同文本时,系统会复用之前计算的中间状态(KV Cache),而非重新处理,从而节省算力。DeepSeek等厂商通过磁盘缓存技术将这部分Token价格降低50%-90%。要最大化缓存命中率,需将固定文本前置、变动内容后置,避免污染缓存前缀。正确设计Prompt结构可显著提升响应速度并降低运营成本,这是规模化AI应用的重要优化手段

#缓存#人工智能#transformer +1
深度学习中的参数更新方法

SGD:基础款,手动挡,容易震荡。:加了惯性,跑得快,但还得手动调学习率。AdaGrad:能自动调学习率,但容易过早停止(学习率降太快)。RMSProp:解决了过早停止问题,只关注近期梯度。:既有惯性,又能自动调速,全能选手。

#深度学习#神经网络#自然语言处理 +1
pytorch中的损失函数使用

本文介绍了PyTorch中常用的损失函数及其实现。首先讲解了二元交叉熵损失函数(BCE)的计算公式和应用场景,通过代码示例展示了如何使用nn.BCELoss()。接着介绍了多分类交叉熵损失函数的概念和两种目标值处理方式(顺序标签和概率值)。最后通过一个简单的神经网络模型示例,演示了损失函数在实际训练中的应用流程,包括模型定义、前向传播、损失计算、反向传播和参数更新等步骤。代码示例涵盖了nn.Lin

#pytorch#深度学习#人工智能
别让大模型“胡说八道”:拆解 LLM 的“幻觉”与“中年健忘症”

摘要: 大模型常出现"幻觉"(一本正经地胡说八道)和"迷失在中间"(遗忘长文本中间内容)两大问题。前者源于模型本质是概率续写机而非事实库,后者因注意力机制导致中间信息被忽略。解决方案包括:1)采用RAG架构,通过检索和重排关键片段;2)优化提示词,如事实锚定、思维链和指令后置。这些方法能有效约束模型输出,平衡创造力和准确性。(149字)

#人工智能
浅析大模型 Agent 的记忆(Memory)机制

摘要: 本文深入探讨了大模型Agent记忆机制的设计挑战与解决方案。首先分析了全量历史对话堆叠带来的三大技术灾难:计算复杂度爆炸、中间迷失现象和商业化成本问题。随后指出纯向量RAG方案的"时序坍塌"缺陷,即语义相似但时间冲突的信息召回问题。核心解决方案是构建基于状态机的记忆固化系统,通过异步解耦、信息降维和冲突状态机实现精准记忆管理。最后提出混合检索架构(图谱路由+倒排索引+向量召回)解决复杂关联

#语言模型#深度学习#RAG
从 ReAct 到“越走越远”:为什么 AI 总顺着你胡说?深度解构大模型的盲区与自救

在大模型的“终极救赎”演进完全普及之前,作为使用 AI 的人类,我们该如何自保?既然自回归的上下文污染不可逆,那就物理刷新它。当你发现和 AI 的对话已经开始陷入泥潭、方向不对时,千万不要试图在当前的对话框里去纠正和反驳它(因为你的反驳又会变成新的上下文噪声)。提炼出前几轮对话中真正正确的几句核心结论,点击“New Chat”(新建对话),开辟新局。只有这样,才能彻底洗掉那条已经歪掉的自回归误差链

#人工智能#神经网络#自然语言处理 +1
    共 22 条
  • 1
  • 2
  • 3
  • 请选择