logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

推荐算法学习记录2.2——kaggle数据集的动漫电影数据集推荐算法实践——基于内容的推荐算法、协同过滤推荐

这种方法通过分析用户的历史行为和偏好,找出具有相似兴趣的用户群体,然后推荐他们喜欢的物品或内容。协同过滤是一种常见的推荐系统技术,它基于用户的历史行为(例如评分、点击、购买等)来预测用户可能感兴趣的物品。协同过滤主要有两种类型:基于用户的协同过滤和基于物品的协同过滤。它可以直接利用物品的内容特征进行推荐,适用于内容较为丰富的场景。冷启动问题是指在推荐系统中,无法为新用户或新物品提供高质量的推荐。

文章图片
#python#matplotlib#开发语言
萱仔大模型学习记录3.2-BERT算法微调理论和实践Adapter Tuning、Prefix Tuning等

传统微调的局限性修改所有语言模型参数,需要为每个任务存储一个完整的模型副本。前缀调优的优势保持语言模型参数不变,仅优化前缀参数。通过仅学习0.1%的参数,前缀调优在全数据集设置中获得了可比的性能,在低数据设置中表现优于微调,并在训练中未见的主题上表现更好。应用场景前缀调优适用于自然语言生成任务,如表格到文本生成和摘要生成。所有P-tuning都是基于优化连续的prefix或者prompt的思想。调

文章图片
#python#算法#学习
Agent智能体

Agent(智能体)是一个能够感知环境并采取行动的自主实体,通常被设计用于在特定的环境中执行任务。智能体可以通过学习、推理等方式来决策,目标是最大化某种效用或实现某个预定的目标。它们广泛应用于自动化系统、游戏AI、机器人、自然语言处理、推荐系统等领域。

文章图片
#人工智能
主流的大数据框架Hadoop/spark

处理大数据: 如果你有成千上万的文件、日志数据,或者每天需要处理几百 GB 的数据量,Spark 是一个理想的工具。在需要反复计算的数据任务中,如迭代式的机器学习算法,它有很大的优势。1、高速处理: Spark 能够将数据加载到内存中进行计算,相比于传统的 Hadoop MapReduce,它的迭代计算速度要快很多,特别是在处理需要多次操作的数据集时(例如机器学习任务)。分布式和容错性: Spar

文章图片
#大数据
主流的大数据框架Hadoop/spark

处理大数据: 如果你有成千上万的文件、日志数据,或者每天需要处理几百 GB 的数据量,Spark 是一个理想的工具。在需要反复计算的数据任务中,如迭代式的机器学习算法,它有很大的优势。1、高速处理: Spark 能够将数据加载到内存中进行计算,相比于传统的 Hadoop MapReduce,它的迭代计算速度要快很多,特别是在处理需要多次操作的数据集时(例如机器学习任务)。分布式和容错性: Spar

文章图片
#大数据
萱仔大模型学习记录4-BERT_lora实战

Lora通过添加低秩的矩阵,使得只需要微调少量参数,而不是整个模型。这样就可以用比较小的代价去处理我自己的任务,虽然bert本身不算一个特别巨大的模型,但是作为实践,还是可以尝试吧lora引入进去当作一个实践,从简单到困难需要循序渐进嘛。由于我已经理顺了一次lora的原理,对于个人简单来说就是外接一个新的A和B矩阵,来训练新的小小矩阵去×原本的大大模型,这样只训练小矩阵的成本就能大大降低,而且由于

文章图片
#学习#bert#算法
萱仔求职系列——1.1 机器学习基础知识复习

任务类型K-means:无监督学习(聚类)。KNN:有监督学习(分类或回归)。输入K-means:只需要数据,不需要标签。KNN:需要带有标签的训练数据。输出K-means:每个样本的簇分配和质心。KNN:新样本的预测标签或值。算法目标K-means:寻找数据的自然簇,最小化簇内的样本到质心的距离。KNN:基于已知样本的标签或值,对新样本进行预测。适用场景K-means:用于发现数据的自然分组或模

文章图片
#机器学习#人工智能
机器学习常用的评价指标原理和代码

最近面试的时候,很多面试官问道了我项目中的一些评价指标的算法和原理,我觉得这确实也是一个很重要的内容,所以趁这个机会综合起来一块复习一下,在刷力扣的时候也不能忘记项目最常用的内容嘛。它们都表示模型在所有实际为正类的样本中,正确预测为正类的比例。:计算误差的绝对值与真实值的比率的平均值,反映相对误差。:实际为正类的样本中,正确预测为正类的比例。:预测为正类的样本中,真正为正类的比例。

文章图片
#机器学习#人工智能
BLEU和ROUGE评价指标原理和计算方式

BLEU是一种自动评估生成文本与参考文本相似性的指标,主要用于机器翻译。它通过计算n-gram的重叠程度来判断生成文本的质量。ROUGE是一组用于自动评估文本生成质量的指标,主要用于文本摘要。它通过计算生成文本与参考文本之间的重叠情况,尤其关注召回率。

文章图片
#python#nlp#中文分词
常用大语言模型简单介绍

LLaMA是 Meta 开发的开源大型语言模型,用于执行多种 NLP 任务。Ollama是一个工具或平台,允许用户在本地运行和管理多个语言模型,包括 LLaMA。它简化了 LLM 的运行流程,使用户可以通过命令行轻松调用和实验模型。因此,LLaMA 是一个模型本身,而Ollama 是一个工具,用于运行包括 LLaMA 在内的多种大语言模型。

#nlp#人工智能#python +1
    共 11 条
  • 1
  • 2
  • 请选择