
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
强化学习起源于动物心理学的相关原理,模仿人类和动物学习的试错机制,是一种通过与环境交互,学习状态到行为的映射关系,以获得最大积累期望回报的方法。强化学习包含环境,动作和奖励三部分,其本质是 agent 通过与环境的交互,使得其作出的action所得到的决策得到的总的奖励达到最大,或者说是期望最大。DL/ML中的loss function目的是使预测值和真实值之间的差距最小,而RL中的loss fu

整个确定性策略梯度方法沿用了行动者-评论家学习框架,评论家(Critie)使用可微近似函数估计行为值函数,行动者(Actor)朝着行为值函数梯度方向更新策略参数。在引入AC框架之前,大多数无模型强化学习算法都是基于广义策略迭代框架,将策略评估与策略改进相结合求解最优值。

到目前为止,一直假定强化学习任务是在有限状态上进行的,这时的值函数其实是一个表格。对于状态值函数,其索引是状态;对于行为值函数,其索引是状态行为对。值函数迭代更新的过程实际上就是对这张表进行迭代更新,获取某一状态或行为价值的时候通常需要一个查表操作。因此,前面的强化学习算法称为表格型强化学习。

大型语言模型(LLMs)由于其惊人的能力已被广泛应用。随着链式思维(CoT)提示与上下文学习(ICL)等技术的发展,输入给 LLM 的提示长度越来越长,甚至超过数万个 token。为了加速模型推理并降低成本,本文提出 LLMLingua,一种粗到细的提示压缩方法,包括:预算控制器(Budget Controller):用于在高压缩率下保持语义完整性;基于 Token 级的迭代压缩算法:更好地建模压

它的目标仍是生成,但条件(前缀)建模更强,天然适合“给定上下文再生成”的场景。所以 User1 部分的编码输出,只能感知到 User1 的内容,无法感知到它之后的文本,可以用来预测 Assistant1 的内容。而 User2 部分的编码输出,只能看到 User1、Assistant1、User2 的内容,可以用来预测 Assistant2 的内容,依此类推。模型的 attention mask

机器学习中的聚类是一种无监督学习方法,主要用于数据分组。常见的聚类算法包括:层次聚类(构建树状层次结构)、密度聚类(如DBSCAN,基于数据密度发现聚类)、K-means(通过迭代优化簇中心划分数据)、谱聚类(利用图论和特征分解进行聚类)。不同算法适用于不同场景,理解它们的特点有助于选择最合适的聚类方法。

在机器学习任务中,我们通常会遇到多分类问题,而有时手头的工具或模型仅支持二分类。如何巧妙地将多分类问题转化为二分类问题?本篇博客探讨几种常见的方法,包括 一对多(One-vs-All, OvA)、一对一(One-vs-One, OvO) 和 基于层级或分组的方法,并分析它们的优缺点及适用场景。

梯度下降(Gradient Descent)是机器学习中最常见的优化算法之一,广泛用于模型训练和参数优化。本篇博客介绍梯度下降的基本原理,并深入探讨 批量梯度下降(GD)、随机梯度下降(SGD) 及 次梯度方法(Subgradient Method) 的区别与应用。我们将分析不同算法在 收敛速度、计算成本、稳定性 等方面的表现,并结合实际案例,帮助读者理解如何选择最适合的优化策略,以应对不同的机器

H2数据库是一种轻量级的、嵌入式的关系型数据库管理系统(RDBMS),它被设计用于嵌入到Java应用程序中。H2数据库以纯Java代码的形式实现,因此它不需要外部的数据库服务器或独立的进程来运行,可以直接作为Java类库嵌入到应用程序中,或者以服务器模式在网络上提供服务。

支持向量机(SVM)是一类按监督学习方式对数据进行二元分类的广义线性分类器,其决策边界是对学习样本求解的最大边距超平面,可以将问题化为一个求解凸二次规划的问题。与逻辑回归和神经网络相比,支持向量机,在学习复杂的非线性方程时提供了一种更为清晰,更加强大的方式。








