logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从人工智能到大语言模型

下图展示了人工智能、机器学习、深度学习和大语言模型以及生成式大语言模型之间的关系。人工智能是包括机器学习、深度学习等众多分支的领域,旨在开发能够执行需要人类智能水平的任务(包括语音理解、模式识别、决策制定)的机器。机器学的重点研究内容是实现人工智能的算法。机器学习涉及开发能够从数据中学习的算法。无需明确编程,这些算法就能基于数据做出预测或决策。深度学习是机器学习的一个分支,它主要利用 3 层及以上

文章图片
#人工智能#语言模型#自然语言处理
Ollama部署与常用命令

Ollama是一款开源工具,其目标是简化大语言模型在本地环境的部署和使用。它支持多种流行的开源大语言模型,如 Llama 2、Qwen2.5等。介绍Ollama部署和常用命令。

文章图片
#AIGC
初识LangChain

LangChain是一个开源框架,用于快速开发部署由LLM驱动的应用。LangChain使LLM不仅可以处理文本,还能够在更广泛的环境中进行操作和响应,从而扩展LLM的应用范围。如果把LLM比作CPU,那么LangChain类似于传感器。

文章图片
软件架构演进:复用资源与服务之路

在软件系统的发展历程中,架构的演进始终围绕着如何更高效地复用资源与服务这一核心主题展开。从最初的单体架构开始,到今天已形成了多种成熟的架构模式和服务模型,每一步都体现了对可扩展、可复用和可维护性的不懈追求。

文章图片
#架构
指令微调大模型

本文介绍了大语言模型指令微调的全过程,重点阐述数据准备和批处理方法。指令微调分为三个阶段:数据准备、模型微调和性能评估。

文章图片
#人工智能
手写大模型

本文介绍了构建类GPT大语言模型的关键组件及其实现方法。首先阐述了层归一化技术如何通过调整激活值分布来提升训练稳定性,随后对比了ReLU、GELU等激活函数的特性,并实现了包含GELU的前馈神经网络模块。文章详细讲解了快捷连接在缓解梯度消失问题中的作用,以及如何将多头注意力机制与前馈网络结合形成Transformer块。最后展示了GPT模型的整体架构,包括文本生成机制从词元编码到解码的全过程,并指

文章图片
#语言模型
LoRA 微调

LoRA(低秩自适应)是一种高效的参数微调技术,通过仅调整预训练模型权重的一小部分来适应特定任务。其核心思想是将权重更新矩阵ΔW分解为两个低秩矩阵A和B的乘积,显著减少训练参数。

文章图片
#人工智能#机器学习#算法
Ollama微调

在 Ollama 里,Modelfile是用来定义和配置模型的文件,其中包含众多参数用于控制模型的构建、训练和使用。

文章图片
#AIGC
分类微调大模型

本文介绍了大语言模型在文本分类任务上的微调方法,以垃圾短信分类为例。首先通过平衡数据集解决类别不平衡问题,并使用填充技术处理不同长度文本。然后修改预训练模型架构,替换输出层为二分类结构,并冻结大部分参数仅训练输出层。

文章图片
#分类#人工智能
预训练大模型

本文介绍了GPT模型的文本生成流程及预训练方法。

文章图片
#深度学习#人工智能#机器学习
    共 17 条
  • 1
  • 2
  • 请选择