logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从零构建大模型 Build a large language model from scratch by Sebastian Raschka 阅读笔记

本文介绍了大模型的核心技术,包括文本数据处理、注意力机制和GPT模型实现。文本预处理将离散符号转化为连续向量嵌入,使神经网络可处理。注意力机制通过查询、键、值矩阵计算上下文相关性,采用多头设计和因果掩码提升性能。GPT模型实现展示了架构细节,包括嵌入层、层归一化和残差连接等关键技术。

文章图片
#AI学习
主动深度学习用于高光谱图像分类

文献Active Deep Learning for Classification of Hyperspectral Images了解知识: RBM 受限波尔茨曼机:https://zhuanlan.zhihu.com/p/24989699提取数据特征,有点像自动编码器。一类具有两层结构的、对称链接无自反馈的随机神经网络模型(一种特殊的马尔科夫随机场)。什么是主动学习?在某些情况...

vllm学习笔记之 PD分离 kv connector

vLLM框架中的Disaggregated Prefilling技术

文章图片
高光谱图像中的目标检测(一)

这是第一篇博客,前两周开始接触高光谱图像处理中的目标检测,试着总结一下自己学习到的概念和算法。

#图像处理#算法
Deep Dive into LLMs like ChatGPT 学习笔记

这篇文章介绍了大语言模型的基础概念和训练过程。预训练阶段使用海量数据(如15万亿token的FineWeb数据集),通过预测下一个token来调整神经网络权重。推理时模型基于训练数据生成新内容。文章以GPT-2(16亿参数)和Llama3(4050亿参数)为例,说明现代模型训练效率提升的原因。还讨论了基础模型的特点、后训练优化、幻觉问题解决方法,以及强化学习在模型训练中的应用(如Deepseek-

高光谱图像中的目标检测(一)

这是第一篇博客,前两周开始接触高光谱图像处理中的目标检测,试着总结一下自己学习到的概念和算法。

#图像处理#算法
高光谱图像中的目标探测(三) | 正交子空间投影和CEM方法(约束能量最小化)的比较研究

本文比较研究了HSI中用于检测和分类的两个经典算法:Orthogonal subspace projection (OSP) 和 Constrained energy minimization (CEM)算法。1. 介绍线性解混通过将一个HSI中的像素表示为有限个端元的线性组合进行检测和分类。解混像元并找到端元对应的丰度值。有几种方法:奇异值分解(SVD)、子空间投影、最大似然法等等。

#算法
到底了