
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文我们研究的是 bge-reranker-v2-m3模型。
中文instruct在chatGLM, LLAMA上的表现。

可以分为短期记忆与长期记忆,同时Agentic RAG也可以认为是记忆模块的一种,claude的skills,Manus的文件也都是为了增强智能体的记忆能力。然后我们的agent会负责执行这个工具,并把工具结果作为context继续输入给大模型,如果需要多次调用工具则进行反复调用,最终大模型输出正式的结论。最近流行的大模型智能体,以大模型为大脑,通过调用工具来完成复杂的任务。强化学习中的智能体 通
Agent又被称为Actor,Actor对于特定的任务,有自己的一个策略π,策略π用一个神经网络表示,其参数为θ。从一个特定的状态state出发,一直到任务的结束,被称为一个完整的eposide,在每一步,我们都能获得一个奖励r,一个完整的任务所获得的最终奖励被称为R。模型的学习过程就是调整Actor的策略π,使得期望奖励最大化,于是有了策略梯度的方法。既然奖励的期望函数如上,只要使用梯度提升的方
使用chatGLM6b + langchain实现本地化知识库检索与智能答案生成。

模型:sequence classification, or sequence regression。趋势:先确定是指数加速、线性还是减速。如果是线性在根据斜率确定速度。带一些AutoML性质的。

NLP

Agent又被称为Actor,Actor对于特定的任务,有自己的一个策略π,策略π用一个神经网络表示,其参数为θ。从一个特定的状态state出发,一直到任务的结束,被称为一个完整的eposide,在每一步,我们都能获得一个奖励r,一个完整的任务所获得的最终奖励被称为R。模型的学习过程就是调整Actor的策略π,使得期望奖励最大化,于是有了策略梯度的方法。既然奖励的期望函数如上,只要使用梯度提升的方









