
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
交叉熵把信息论距离度量与概率最大似然统一起来,成为深度学习分类任务的基础损失函数,是现代计算机视觉、自然语言处理模型训练的基石。可见交叉熵在深度学习中占着核心地位,本章详细讲解交叉熵完整体系概念公式推导过程: 信息量 →信息熵→ 相对熵(KL 散度) → 交叉熵推导 → 交叉熵损失函数 → 最大似然 →深度学习损失。

交叉熵把信息论距离度量与概率最大似然统一起来,成为深度学习分类任务的基础损失函数,是现代计算机视觉、自然语言处理模型训练的基石。可见交叉熵在深度学习中占着核心地位,本章详细讲解交叉熵完整体系概念公式推导过程: 信息量 →信息熵→ 相对熵(KL 散度) → 交叉熵推导 → 交叉熵损失函数 → 最大似然 →深度学习损失。

BBPE是BPE的升级版,BPE最初是一种数据压缩算法,用于通过迭代合并高频字节对来减少数据大小,BPE被引入自然语言处理(NLP)领域,作为分词(Tokenization)的核心方法。BPE 指的是字节对编码。英文单词大概有60万,中文汉字大概 有6万,如果都加到词表中,词表巨大、显存爆炸、训练极度不稳定,有部分单词很少用到白白占位,还有未登录词问题(OOV),如果用基本字节组合又太小,比如

架构图核心能力:文本理解(分类、NER等)代表模型: BERT、RoBERTa、ALBER当前地位: 逐渐被替代(仅用于纯理解任务)

本文基于libtorch手写完整Transformer架构代码包含1.编码器 Encoder2.解码器 Decoder3.多头注意力 MultiHeadAttention4.前馈网络 FFN将的libtorch库自带Transformer 换成 我们手写MyTransformer 来验证结果。

Transformer 的核心是与,让序列每个位置都能动态关注全局相关信息,并行捕捉长程依赖。

掩码类型形状要求场景src_mask[seq,seq]极少用 空张量tgt_mask[seq, seq]必须使用屏蔽未来位置[tgt_seq,src_seq]默认情况下,无需屏蔽必须使用对齐目标序列长度必须使用对齐源序列长度同src_key_padding_mask。

1. msys2 下载安装MSYS2,https://www.msys2.org/2. msys2 环境配置2.1 打开 msys2 msys :2然后输入以下命令安装:pacman-Syupacman -S base-develpacman -S yasm nasm gcc pacman -S mingw-w64-x86_64-toolchainpacman -S gitpacman -S ma

flags: SDL_INIT_TIMER支持定时器子系统,SDL_INIT_AUDIO支持音频子系统,SDL_INIT_VIDEO支持视频子系统。4.填充音频数据 ,让 SDL 来主动执行回调函数来取数据。2. 打开一个特定的音频设备。1. 初始化SDL库。








