logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

深度学习复习01【从梯度下降到优化器】

本文系统介绍了梯度下降算法及其优化器Adam。梯度下降通过迭代更新参数最小化损失函数,包含批量梯度下降(BGD)、随机梯度下降(SGD)和小批量梯度下降(Mini-batch GD)三种形式。核心数学原理是梯度方向即为函数值增长最快的方向,通过方向导数和向量点积可推导出这一结论。Adam优化器融合了动量法和自适应学习率的优点,通过计算梯度的一阶矩(动量项)和二阶矩(自适应学习率项),并引入偏差修正

#深度学习#人工智能#神经网络 +1
linear probing & lora

大模型微调方法比较与选择 本文比较了两种大模型微调方法:linear probing和LoRA。

#神经网络#计算机视觉#深度学习
数据挖掘与机器学习入门-以房价预测为例

简单概述部分针对数据集的数据处理方法和简单机器学习案例

文章图片
#机器学习#数据挖掘#人工智能
一次理解Attention/Self-Attention/Multi-Head Attention【简洁版】

给输入的不同信息分配不同的权重,让模型重点关注和当前任务强相关的信息,自动弱化无关 / 噪声信息。Q、K、V 全部来自「同一个输入序列」,序列自己和自己计算注意力,专门挖掘序列内部「每个元素和其他所有元素」的关联关系。类型Q/K/V 来源核心作用典型场景普通 AttentionQ 来自一个序列,K/V 来自另一个序列两个不同序列之间的信息匹配机器翻译(目标句 Q vs 原句 K/V)、Transf

#计算机视觉#深度学习#自然语言处理
linear probing & lora

大模型微调方法比较与选择 本文比较了两种大模型微调方法:linear probing和LoRA。

#神经网络#计算机视觉#深度学习
数据挖掘与机器学习入门-以房价预测为例

简单概述部分针对数据集的数据处理方法和简单机器学习案例

文章图片
#机器学习#数据挖掘#人工智能
到底了