logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

动手学深度学习——序列模型

一组按照顺序排列的数据这里每个元素都不是孤立的,而是和前后元素有关系。这一节我们初步认识了序列模型,核心内容可以总结为以下几点。

文章图片
#深度学习#人工智能
动手学深度学习——样式迁移代码

上一篇我们已经从整体上理解了**样式迁移(Style Transfer)**的思想:内容图提供结构与布局样式图提供纹理与风格生成图通过不断优化得到优化目标同时考虑内容损失和风格损失这一节我们就正式进入代码实现。固定一个预训练特征提取网络,然后把生成图本身当作待优化参数。所以这一节真正要看懂的是:怎么提取内容特征怎么提取风格特征Gram 矩阵怎么计算总损失怎么写怎么一步步优化生成图包括:内容损失风格

文章图片
#深度学习#人工智能
动手学深度学习——样式迁移

前面我们一直在学习计算机视觉中的“识别型任务”,例如:图像分类目标检测语义分割让模型理解图像里有什么。但深度学习不仅能“看懂图像”,还能“生成图像风格效果”。样式迁移(Style Transfer)把一张图的内容,与另一张图的风格融合起来,生成一张新的图像。比如:保留一张照片中的人物、建筑、景物结构同时让它呈现梵高油画、素描、水彩等艺术风格这就是样式迁移的魅力所在。内容来自一张图,风格来自另一张图

文章图片
#深度学习#人工智能
动手学深度学习——文本预处理代码

上一篇我们已经进入了序列模型部分。我们知道,文本本质上也是一种序列,例如一句话:我正在学习深度学习对于人来说,文字天然可以理解。但对于神经网络来说,文字本身只是字符串,模型并不能直接处理。如何把原始文本处理成模型可以读懂的数字形式?这就是本节“文本预处理代码”的核心任务。这一节主要要解决:如何读取原始文本如何把文本拆成词元(token)如何建立词表(vocabulary)如何把词元转换成数字索引这

文章图片
#深度学习#人工智能
动手学深度学习——门控循环单元(GRU)

前面我们已经学习了:RNNRNN 从零开始实现RNN 简洁实现通过隐藏状态,把过去的信息传到当前时刻。这让它能够处理序列数据,比如:文本时间序列音频序列它很难有效处理长期依赖。也就是说,如果当前时刻需要依赖很久以前的信息,普通 RNN 往往学不好。这背后通常会伴随着:梯度消失梯度爆炸远距离信息难以保留GRU(Gated Recurrent Unit,门控循环单元)让模型学会“该记什么、该忘什么、该

文章图片
#深度学习#rnn#人工智能
动手学深度学习——RNN

循环神经网络这里“循环”两个字,不是说网络真的绕圈跑,而是说它在时间维度上有一种“状态递归传递”的结构。“隐藏状态(hidden state)”是 RNN 里最关键的概念之一。模型在当前时刻对“过去已经看到的信息”的内部摘要例如处理一句话时:第一个词来了,模型更新一次状态第二个词来了,再结合前一个状态继续更新第三个词来了,再往后传于是到了第 t 步时,隐藏状态H_t就像是:到目前为止,模型对前 t

文章图片
#深度学习#rnn#人工智能
动手学深度学习——RNN简洁实现

35:时间步长度num_steps2:批量大小batch_size28:每个时间步输入向量维度input_size也就是说:这里一次性输入了 2 条序列,每条序列长度为 35,每个时间步是一个 28 维向量。这一点和我们上一节手写版的输入组织方式是一致的。1:层数 × 方向数2:隐藏状态维度因为这里:只用了1 层 RNN不是双向 RNN所以第一个维度就是 1这和手写版的相比,多了一个“层数维”。这

文章图片
#深度学习#rnn#人工智能
动手学深度学习——RNN从零开始实现

a可以表示成b表示成c表示成d表示成这就叫 one-hot 编码。它的特点是:只有一个位置是 1其余位置全是 0不会人为引入“编号大小规律”所以它非常适合表示离散 token。因为outputs列表里装的是每个时间步的输出:第 1 步一个Y第 2 步一个Y第 3 步一个Y而训练时通常希望把它们拼成一个二维张量,方便统一计算损失。会把所有时间步输出拼到一起。如果每个Y这一节我们从零开始实现了 RNN

文章图片
#深度学习#人工智能
动手学深度学习——BERT

来自 Transformer 的双向编码表示自注意力非常适合建模全局依赖,而且并行能力强。BERT 正是建立在这个基础上。它没有用 RNN、GRU、LSTM 来逐步递推序列,多层 Transformer Encoder 堆叠这是 BERT 最核心的预训练任务。它的基本做法是:在输入序列中随机遮住一些 token,让模型根据上下文去预测这些被遮住的词。deep这和传统“下一个词预测”非常不同。

文章图片
#深度学习#bert#人工智能
动手学深度学习——使用注意力机制的 Seq2Seq 代码

上一篇我们已经从原理上理解了使用注意力机制的 Seq2Seq基础 Seq2Seq 的问题是固定上下文向量注意力机制让解码器在每一步都能动态查看输入序列query 通常来自解码器当前状态key 和 value 通常来自编码器所有时间步输出这一篇就继续按李沐的节奏,把这套模型真正落实到代码上。这一节最核心的问题就是:注意力版解码器怎么写编码器输出如何作为 keys / values 被保存下来解码器每

文章图片
#深度学习#人工智能
    共 97 条
  • 1
  • 2
  • 3
  • 10
  • 请选择