logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

动手学习RAG:rerank模型微调实践 bge-reranker-v2-m3

本文我们研究的是 bge-reranker-v2-m3模型。

#学习
大语言模型-中文chatGLM-LLAMA微调

中文instruct在chatGLM, LLAMA上的表现。

文章图片
#人工智能
大模型智能体实战指南

可以分为短期记忆与长期记忆,同时Agentic RAG也可以认为是记忆模块的一种,claude的skills,Manus的文件也都是为了增强智能体的记忆能力。然后我们的agent会负责执行这个工具,并把工具结果作为context继续输入给大模型,如果需要多次调用工具则进行反复调用,最终大模型输出正式的结论。最近流行的大模型智能体,以大模型为大脑,通过调用工具来完成复杂的任务。强化学习中的智能体 通

#机器学习
强化学习: PPO模型

Agent又被称为Actor,Actor对于特定的任务,有自己的一个策略π,策略π用一个神经网络表示,其参数为θ。从一个特定的状态state出发,一直到任务的结束,被称为一个完整的eposide,在每一步,我们都能获得一个奖励r,一个完整的任务所获得的最终奖励被称为R。模型的学习过程就是调整Actor的策略π,使得期望奖励最大化,于是有了策略梯度的方法。既然奖励的期望函数如上,只要使用梯度提升的方

#机器学习#人工智能
大语言模型-中文Langchain

使用chatGLM6b + langchain实现本地化知识库检索与智能答案生成。

文章图片
#语言模型#python#深度学习
工业机器学习算法-预测性维护

模型:sequence classification, or sequence regression。趋势:先确定是指数加速、线性还是减速。如果是线性在根据斜率确定速度。带一些AutoML性质的。

文章图片
#机器学习#算法#人工智能
强化学习: PPO模型

Agent又被称为Actor,Actor对于特定的任务,有自己的一个策略π,策略π用一个神经网络表示,其参数为θ。从一个特定的状态state出发,一直到任务的结束,被称为一个完整的eposide,在每一步,我们都能获得一个奖励r,一个完整的任务所获得的最终奖励被称为R。模型的学习过程就是调整Actor的策略π,使得期望奖励最大化,于是有了策略梯度的方法。既然奖励的期望函数如上,只要使用梯度提升的方

#机器学习#人工智能
    共 55 条
  • 1
  • 2
  • 3
  • 6
  • 请选择