第5章 AI训练师的核心技能——深度学习算法

本章将深入探讨深度学习算法,这是人工智能领域中前沿和非常重要的技术之一,同时也是AI训练师需要掌握的核心技能。深度学习作为机器学习的一个重要分支,通过构建深度神经网络来模拟人脑的认知过程,已在语音识别、图像处理、自然语言理解等领域取得了突破性的成果。本章主要介绍深度学习的基本原理及应用场景。

第5章 深度学习算法

5.1 架构与核心概念

5.2 八大实战案例

神经网络原理

前向传播与反向传播

激活函数

损失函数与优化器

图像生成

语音识别

文本生成

风格迁移

5.1 架构与核心概念:深度学习算法

在探索机器学习时,深度学习作为其中的一个子集,已经引发了科学界的广泛关注。受到人类大脑结构和功能的启发,深度学习算法能够处理海量的结构化和非结构化数据,为解决复杂问题提供了新的可能性。深度学习算法的核心概念—人工神经网络,赋予了机器前所未有的决策能力。

在本节中,我们将深入探讨深度学习的奥秘,从其基本原理到工作流程,带领大家认识深度学习算法。

5.1.1 概念解读:认识深度学习算法

深度学习算法是以人工神经网络为基础,旨在模拟人脑神经元之间的连接方式和信息传递过程,通过大量数据和计算资源进行训练和优化,能够有效地解决许多传统机器学习算法无法解决的问题。相比于其他机器学习算法,深度学习算法最大的特点是能够自主学习特征,即通过训练自动识别数据中的模式和规律,而无须人工指定特征。

深度学习算法的核心思想是特征学习,因此在计算机视觉、自然语言处理、语音识别等领域的表现非常出色。

案例48 深度学习算法在无人机视觉导航与避障中的应用

无人机使用深度学习算法来识别和处理图像,以便在各种环境中能够稳定飞行并执行任务。深度学习算法在无人机视觉导航与避障中发挥了关键作用,使无人机在复杂环境中实现更精确、可靠的导航和避障功能。

高级飞行辅助系统5.0)全向视觉感知系统,它具有强大的“全向避障”功能,能够在多个方向上更快、更顺畅地避开障碍物,为全方位摄影创作保驾护航。深度学习算法通过分析无人机拍摄的图像,进行目标检测、三维重建、位置估计等任务,同时实现障碍物检测、路径规划等功能,保障无人机安全飞行。

深度学习算法的核心是人工神经网络,其中较基本的模型是感知机模型 (Perceptron Model)。感知机模型是一个线性分类器,它基于输入的特征向量和权重向量之间的点积进行决策。然而,感知机模型只能处理线性可分的数据,对于非线性问题,它无法找到一个超平面进行分割。

为了解决这个问题,深度学习算法引入了多层感知机(Multilayer Perceptron,MLP)模型。多层感知机模型通过堆叠多个感知机,形成了复杂的非线性分类器。每一层的感知机将前一层的输出作为输入,进行线性组合和激活函数运算,产生输出。

这种结构使得多层感知机能够学到更复杂的特征,并处理更复杂的模式识别问题。除了感知机模型和多层感知机模型,深度学习算法还涉及其他类型的神经网络,如卷积神经网络、循环神经网络和生成对抗网络等。这些网络结构各有特点,适用于不同的场景,本书后面章节会进行具体介绍。

另外,分类问题是深度学习算法中的一项关键任务。在分类问题中,输入是一组数据,输出是对这组数据的分类结果。为了实现分类,我们需要建立一个输入与输出之间的映射关系,这个映射关系可以用一组参数来表示,这组参数即为神经网络的权重。神经网络通过训练学到最优的权重,从而获得最佳的分类效果。

训练神经网络时采用的关键算法是反向传播算法,该算法根据误差反向调整模型权重,包括前向传播和反向传播两个阶段。在前向传播阶段,输入数据通过神经网络产生输出结果,这一过程也称“前向计算”;在反向传播阶段,将输出结果与真实结果进行比较,然后反向计算权重调整,从而将网络输出的误差降到最小。

5.1.2 深入对比:机器学习与深度学习的区别

机器学习和深度学习是人工智能领域中两个重要的算法,尽管这两种算法在训练各种有用模型方面都取得了显著的成功,但它们之间仍存在明显的差异。这些差异主要表现在模型结构、学习方法等多个方面,具体介绍如下。

  1. 在模型结构方面:机器学习通常采用较简单的模型,如线性回归、逻辑回归等,这些模型主要适用于处理简单的线性问题;而深度学习则采用多层神经网络作为模型结构,通过多层次的连接和节点,实现对数据的深度学习和理解,尤其擅长处理复杂的非线性问题。

  2. 在学习方法方面:机器学习主要采用监督学习和无监督学习方法,监督学习依赖于大量标注数据,通过模型学习输入和输出的对应关系,而无监督学习则不需要标注数据,模型可通过寻找数据内部的结构和规律进行学习;
    深度学习既可以采用监督学习方法,也可以采用无监督学习方法,尤其在监督学习方面,它可以在未标注数据上学习数据的特征表示,然后利用监督学习方法进行微调和优化。

  3. 在算法复杂性方面:常见的机器学习算法相对简单;而深度学习算法则采用更高级别的复杂性,利用人工神经网络进行学习。

  4. 在所需资源方面:由于机器学习算法更简单并且需要的数据集要小得多,因此可以在个人计算机上训练机器学习模型;而深度学习算法需要更大的数据集和更复杂的算法来训练模型,通常需要使用专用处理器(如TPU等)来节省大量时间。

温馨提示

TPU(Tensor Processing Unit,张量处理单元)是一种专门为处理神经网络运算而设计的专用集成电路(Application Specific Integrated Circuit,ASIC)处理器。
与传统的中央处理器(Central Processing Unit,CPU)和图形处理器 (Graphics Processing Unit,GPU)相比,TPU更加专注于深度学习的特定计算需求,从而在处理大规模神经网络模型时具有更高的性能和能效。

  1. 在适用的问题类型方面:机器学习适用于解决更简单和更线性的问题,如分类、回归、降维和聚类等;而深度学习更适用于解决复杂问题,如图像和语音识别、自治系统、AI游戏、机器人和自然语言处理等。
    需要注意的是,虽然深度学习也可以用于解决简单的线性问题,但这些问题通常更适合使用机器学习方法。
5.1.3 工作原理:深度学习算法的底层逻辑

从本质上来说,深度学习其实是机器学习中的一种范式,因此它们的算法流程基本相似。但深度学习算法在数据分析和建模方面进行了优化,通过神经网络统一了多种算法。在深度学习算法广泛应用之前,机器学习算法需要花费大量的时间去收集数据、筛选数据、提取特征、执行分类和回归任务。

深度学习算法的核心是构建多层神经网络模型并使用大量训练数据,使机器能够学到重要特征,从而提高分类或预测的准确性。深度学习算法通过模仿人脑的机制和神经元信号处理模式,使计算机能够自行分析数据并找出特征值。深度学习算法的底层逻辑如图5-2所示。

  1. 数据集:是深度学习算法的基础,它包含了用于训练、验证和测试模型的数据。

  2. 特征工程:是深度学习中非常重要的一步,它涉及从原始数据中提取和创建特征的过程,这些特征可以被模型用来学习。

  3. 测试集:用于评估模型性能的数据集,通常在训练过程中不使用。

  4. 训练集:用于训练深度学习模型的数据集,模型通过学习训练集中的数据来学习如何进行预测或分类。

  5. 验证集:用于在训练过程中评估模型的性能,并用于调整模型的超参数(在模型训练开始之前设置的参数)。通常情况下,训练集、验证集和测试集的比例为 7∶2∶1。

  6. 迭代训练:是深度学习中的一个重要过程,它涉及多次重复训练模型的过程。在每次迭代中,模型会根据训练集进行学习,并在验证集上评估其性能,然后根据评估结果来调整其参数。

  7. 模型预测:是指使用已经训练好的模型来对新的、未见过的数据进行预测或分类。

  8. 模型评估:是训练过程中和训练完成后对模型性能的评估,评估指标包括准确率、精确率、召回率等。

5.2 八大实战案例:深度学习应用

深度学习作为机器学习领域中的一种强大技术,已经深入各个行业和领域中,为人们解决复杂问题提供了新的思路和方法。本节将以百度飞桨的AI Studio平台为例,通过8个实例带大家深入了解深度学习的应用场景。

5.2.1 实例1:使用AI生成绘画作品

通过训练AI绘画的深度学习模型,可以让计算机自动生成独特的绘画作品,让人感受科技与创意的完美结合。图5-3所示为使用AI生成的龙年吉祥物图像效果。下面介绍使用AI生成绘画作品的操作方法。步骤01 进入AI Studio平台的“应用”页面,在其中选择相应的AI应用,如图5-4 所示。

该AI应用基于Stable Diffusion XL基础模型进行训练。通过模型训练,AI 应用能够学到各种绘画风格和技巧,并且可以根据用户提供的文字描述,自动生成符合要求的绘画作品。

步骤02 执行操作后,进入AI应用的详情页面,输入相应的提示词(Prompt),如提示词可以引导AI模型生成更准确、丰富的内容。步骤03 单击“高级设置”按钮展开该选项区,设置“图片比例”为“3∶2文章配图”,使AI生成的图片符合3∶2的比例,如图5-6所示。

步骤04 单击“生成画作”按钮,AI应用即可根据我们输入的提示词和设置的选项参数生成画作,效果如图5-7所示。

温馨提示

AI Studio是基于百度深度学习平台飞桨的人工智能学习与实训社区,提供在线编程环境、免费GPU算力、海量开源算法和开放数据等资源,可以帮助开发者或AI训练师快速创建、训练和部署各种深度学习模型。

5.2.2 实例2:使用AI翻译方言

基于深度学习模型训练的自然语言类AI应用,可以实现方言翻译的功能。它能够将各种方言准确无误地转化为标准语言,让更多的人理解。下面介绍使用AI翻译方言的操作方法。步骤01 进入AI Studio平台的“应用”页面,在其中选择相应的AI应用,如图5-8 所示。

该AI应用基于ERNIE 3.5基础模型进行训练,ERNIE是一种强大的深度学习模型,主要用于自然语言处理方面的任务。步骤02 执行操作后,进入AI应用的详情页面,在“新对话”文本框中输入相应的提示词,给出了需要翻译的方言内容,同时还添加了两个问题,如图5-9所示。

步骤03 按【Enter】键确认,或者单击文本框右侧的“发送”按钮 ,将提示词发送给AI应用, AI应用会根据提示词的要求进行回答,如图5-10所示。

5.2.3 实例3:使用AI推荐美食

通过深度学习模型和推荐算法,AI能够根据用户输入的地名,为用户推荐当地的美食。下面介绍使用AI推荐美食的操作方法。步骤01 进入AI Studio平台的“应用”页面,在其中选择相应的AI应用,如图5-11 所示。

该AI应用同样基于ERNIE 3.5基础模型进行训练,它是由百度开发的一种文本文档理解模型,主要通过捕获文本中的上下文信息和语义信息来理解文档内容。步骤02 执行操作后,进入AI应用的详情页面,在“新对话”文本框中输入相应的提示词,要求AI找到河南郑州地区的特色早餐,如图5-12所示。

步骤03 按【Enter】键确认,将提示词发送给AI应用,AI应用会根据提示词的要求进行回答,如图5-13所示。

温馨提示

用户可以切换至“知识库”选项卡,查看开发者在训练该深度学习模型时所使用的训练集,如图5-14所示。这些训练集包含了大量的中国美食数据,如各种食材的搭配、制作工艺、口感特点等信息。

5.2.4 实例4:使用AI充当旅游助手

深度学习模型强大的信息处理能力和个性化推荐功能,可以为用户的旅行计划提供极大的便利。下面介绍使用AI充当旅游助手的操作方法。步骤01 进入AI Studio平台的“应用”页面,在其中选择相应的AI应用,如图5-15 所示。

该AI应用同样基于ERNIE 3.5基础模型进行训练,该基础模型采用了多任务学习的思想,将不同NLP任务(如关系分类、属性识别等)在同一个神经网络中共享参数进行训练,从而提高模型的泛化能力。

步骤02 执行操作后,进入AI应用的详情页面,在“新对话”文本框中输入相应的提示词,要求AI给出相应的旅行建议,如图5-16所示。步骤03 按【Enter】键确认,将提示词发送给AI应用,AI应用会根据提示词的要求进行回答,如图5-17所示。

案例49 携程旅行发布旅游垂直行业大模型—携程问道

携程旅行发布的旅游垂直行业大模型—携程问道,主打成为旅客们的“智能导游”,使“AI+旅游”的新型旅行规划模式成为现实。携程问道大模型基于深度学习技术,通过对海量的旅游数据进行分析,使大模型能够理解用户的旅行需求,为他们提供个性化的行程建议,如图5-18所示。

与传统旅行规划相比,携程问道作为人工智能导游,不仅可以提供基础的行程规划服务,还能根据用户的兴趣和需求,推荐合适的景点、餐厅和娱乐活动。它就像一个了解用户的专属旅行顾问,让每一次旅行都更加贴心、更加精彩。

5.2.5 实例5:使用AI识别中文表格

手动识别和整理表格不仅耗时耗力,还容易出错,使用AI识别中文表格可以避免这些问题,提高工作效率。下面介绍使用AI识别中文表格的操作方法。步骤01 进入AI Studio平台的“应用”页面,在其中选择相应的AI应用,如图5-19 所示。

该AI应用基于轻量级表格识别模型SLANet进行训练,可以广泛应用于医疗、金融等多种场景下的表格结构识别。

温馨提示

SLANet是一个表格识别模型,采用PP-LCNet(CPU友好型轻量级骨干网络)、CSP- PAN(轻量级高低层特征融合模块)和SLAHead(结构与位置信息对齐的特征解码模块)等算法,能够对文档中出现的表格区域进行结构化识别。
步骤02 执行操作后,进入AI应用的详情页面,在“待测试图片”选项区中上传一张表格图片,如图5-20所示。步骤03 在页面下方,单击“提交”按钮,AI应用即可自动识别表格结构和内容, 并转换为电子表格,如图5-21所示。
用户可以单击Download,下载转换后的表格文件。

案例50 金鸣识别将图片转换为各种文档

金鸣识别是一款利用深度学习算法开发的OCR工具,如图5-22所示。它能够精准地识别图片中的文字和表格。金鸣识别独特的前置表格线识别技术,使得表格识别效果极佳,且可以完美还原表格排版。

无论是常见的JPG/PNG格式的图片,还是大图片、长窄图及TIF等特殊格式的图片,甚至连PPT和Word中的图片,金鸣识别都能轻松应对。金鸣识别采用先进的边缘检测技术,结合形态学处理、轮廓检测和透视变换等多种方法,能够精准地识别图片中的表格结构。

这种方法通过筛选符合表格形状的轮廓,进行透视变换和单元格分割,并最终进行OCR识别,确保了表格识别的准确性和完整性。

5.2.6 实例6:使用AI识别车牌

传统的车牌识别方法通常需要人工操作,效率低下且容易出错。然而,随着人工智能技术的不断发展,使用AI识别车牌已经成为现实,对于维护交通安全和打击违法行为具有重要意义。下面介绍使用AI识别车牌的操作方法。步骤01 进入AI Studio平台的“应用”页面,在其中选择相应的AI应用,如图5-23 所示。

该AI应用是基于PP-OCRv4训练的一个高精度车牌识别模型,端到端f- measure可达93.79%。

温馨提示

PP-OCRv4由文本检测模型和文本识别模型串联完成,先输入待检测图片,经过文本检测模型获取全部的检测框;然后根据检测框坐标在原图中抠出文本行,并进行矫正;最后将全部文本行送入文本识别模型,得到文本结果。
“端到端”指的是该模型从输入到输出都是自动完成的,不需要人为干预。f-measure是一个评估模型性能的指标,其值为93.79%表示该模型在车牌识别任务上具有很高的准确率。
步骤02 执行操作后,进入AI应用的详情页面,在“待测试图片”选项区中上传一张带车牌的图片,如图5-24所示。步骤03 在页面下方,单击“提交”按钮,AI应用即可自动识别图中的车牌(注意,该车牌是虚拟的,用户可以使用真实车牌自行尝试),如图5-25所示。

案例51 利用AI车牌识别技术打造自动化的智能停车场

利用AI技术打造的车牌识别系统,是实现自动化智能停车场的关键,如图5-26所示。通过快速准确地识别进出车辆的车牌,智能停车场能够提高安保能力,减少非法停车和盗刷风险。同时,自动计费功能提高了运营效率,减少了人工收费的误差和纠纷。

此外,通过与其他智能系统的集成,提供了更全面的停车场管理数据,而结合移动支付和电子发票等功能则提升了车主的停车体验。

5.2.7

实例7:使用AI总结网页内容在信息爆炸的时代,快速获取和整理网页内容变得至关重要。传统的网页内容总结方式往往费时费力,而且容易遗漏重要信息。如今,利用AI技术可以自动总结网页内容,帮助用户快速获取所需信息,提高工作效率。下面介绍使用AI总结网页内容的操作方法。

步骤01 进入AI Studio平台的“应用”页面,在其中选择相应的AI应用,如图5-27 所示。该AI应用不仅可以回答用户的各种问题,还能够识别百度的网页内容。步骤02 执行操作后,进入AI应用的详情页面,在“新对话”文本框中输入相应的网址,如图5-28所示。

步骤03 按【Enter】键确认,将网址发送给AI应用,AI应用会自动总结网址中的页面内容,如图5-29所示。

5.2.8 实例8:使用AI进行语音聊天

通过训练AI模型进行语音聊天,不仅能够提高人机交互的效率和体验,还能够拓展出更多智能化的服务。下面介绍使用AI进行语音聊天的操作方法。步骤01 进入AI Studio平台的“应用”页面,在其中选择相应的AI应用,如图5-30 所示。

该AI应用调用了文心一言大模型的语音对话功能,能够使用语音回答用户的问题。

温馨提示

文心一言大模型具有优秀的语音识别能力,能够准确地识别用户的语音,并将其转化为文字进行后续处理。同时,文心一言大模型还支持语音合成功能,可以将文字内容转化为自然流畅的语音输出,为用户提供更加便捷的交互方式。
步骤02 执行操作后,进入AI应用的详情页面,在“在此处填写你想对我说的话” 下方的文本框中输入相应的提示词,如图5-31所示。步骤03 单击“发送”按钮,将提示词发送给AI应用,AI应用在输出文字回答的同时,还会通过语音来进行同步回答,如图5-32所示。

案例52 文心一言App可与AI进行连续语音对话

在文心一言App上,用户可以通过语音与AI进行对话,获得即时的信息、答案和建议,无须等待或浏览大量文档。这种对话方式不仅提高了沟通效率,还为用户提供了与人工智能合作的机会,以解决各种问题和任务。

在文心一言App的“连续语音对话”模式下,用户可以随时说出自己的问题或需求,AI将自动识别并给予相应的回答或反馈,如图5-33所示。这种连续的AI语音交流方式,为用户带来了更加智能化的交互体验。此外,文心一言App的语音识别技术也得到了优化和提升,使连续语音对话的准确率得到了显著提高。

即使在复杂的语言环境和多种口音的场景下,文心一言大模型也能够准确地识别用户的语音,确保了连续语音对话的顺畅进行。本章小结本章主要介绍了深度学习算法的基本概念、与机器学习的区别、工作原理以及8个应用场景的实例。

其中8个实例具体包括使用AI生成绘画作品、翻译方言、推荐美食、充当旅游助手、识别中文表格、识别车牌、总结网页内容和进行语音聊天等。这些实例展示了深度学习算法的强大功能和广泛的应用前景,为读者学习AI训练提供了宝贵的实践经验和启示。

课后习题鉴于本章知识的重要性,为了帮助读者更好地掌握所学知识,下面将通过课后习题帮助读者进行简单的知识回顾和补充。

  1. 使用AI生成室内设计图,效果如图5-34所示。

  2. 使用AI生成风景照片,效果如图5-35所示。

更多推荐