【HCIA- AI(正课)】1.2大模型基础概念
·
人工智能发展过程

公式不懂没关系,了解前人思路




大模型发展过程
发展过程







大模型特点









大模型演进趋势
人工智能伦理道德




会考判断题



大模型安全







会考这个



大模型技术趋势与展望





- 神经网络学习思路
- 一元一次函数拟合信号
-
拟合神经元原理:讲解一元一次函数特点,是为让学员知道其可拟合神经元,解决信号问题。信号有大有小,具有连续性属性,机器学习中有连续性、离散性等六种属性,神经元获取信号需累加足够大才传递。
-
W 参数理解:输入多个数据,最终最重要的 W 只有一个,代表场景下信号量大小。不同场景会有不同 W,有大权重和小权重。
-
多信号累加:用一元一次函数拟合信号后,通过多信号累加得出公式,该公式是神经网络早期做累加和的扩充内容。
-
激活函数决定传递
- 阈值设置问题:信号传递需达到一定量,但不能简单设阈值,因不同场景阈值不同,如广告费和流量场景。
- 标准化解决方法:采用标准化(归一化)操作,如使用公式 ( \frac{1}{e^x + 1} ) ,将数据缩放至 0 到 1 之间,设阈值 0.5,以上传递,以下不传递。
- 非线性因素引入:激活函数是曲线,引入非线性因素,解决单层感知机异或问题,使深度神经网络每层判定复杂度提高,在隐藏层添加激活函数可拟合更复杂场景。
-
- 人工智能时代分类
- 核心区别:强人工智能时代具有认知、自我意识和自我思考能力,弱人工智能时代则不具备。
- 当前所处时代:目前处于弱人工智能时代,正朝着强人工智能时代迈进,如马斯克的自动驾驶研发旨在让人工智能独立思考。
- 人工智能发展历史
- 发展阶段
- 早期提出:早期出现控制论、专家系统、机器学习等概念。
- 深度学习发展:随后提出深度学习,如神经网络,还涉及 CV(视频处理)、NLP(自然语言处理)等领域。
- 后续发展:逐步发展到 AI for Science、Statue Diffusion 算法、GPT - 4 等,进入 AIGC 时代。
- 各领域发展情况
- 计算机视觉领域:是目前利用最广泛、最成熟的领域。
- NLP 领域:大模型出现后,NLP 领域逐步突围。
- 发展阶段
- AI 算法技术发展
- 技术路线
- 早期统计模型:最早期是统计模型,基于常规概率论统计学。
- 机器学习与深度学习:发展到机器学习,再到 CNN、RNN、LSTM 等深度学习技术。
- 深度优化网络:出现深度优化网络,如 VGG、ResNet、AlexNet 等。
- 大模型架构:最终发展到大模型 Transformer 架构、ByteGPT 等。
- 学习建议:若想在该行业深入发展,需按技术路线学习,依次学习高数、线性代数、概率论、机器学习、深度学习、Transformer 大模型。
[图片]
- 技术路线
- 大模型特点
- 参数大
- 量变产生质变:大模型参数大,当参数达到一定程度会从量变产生质变,出现涌现现象,如雪花堆积成雪崩。
- 涌现现象表现:涌现带来语境学习、指令学习、逐步推理学习等高阶能力,使模型回答更人性化。
- 计算量大
- 算力与数据集需求:计算量大体现在算力上,芯片算力提升促使大模型成功,同时大模型需要大量数据集训练,有时也需高精度少量数据集微调。
- 与普通神经网络对比:大模型比普通神经网络拟合的函数更多。
- 参数大
- 大模型相关专业名词
- 涌现现象
- 定义:涌现又称创发、出现等,核心是量变产生质变的规模突破,性能显著提升,如微观粒子组成银河系。
- 带来的能力:包括语境学习(零样本和少样本学习)、指令学习、逐步推理学习等。
- 零样本和少样本学习
- 零样本学习:直接问问题,模型无需样本即可回答结果。
- 少样本学习:给定少量样本,模型通过学习得出想要的结果。
- 思维链
- 定义与作用:思维链是谷歌提出的改进提示词策略,可将问题拆分,引导模型一步一步推出结果,提高模型回答准确率。
- 应用限制:在特定领域如数学、逻辑推理领域有用,但在机器翻译等领域效果较差,体现目前仍处于弱人工智能阶段。
- 涌现现象
- 大模型调用外部工具:大模型可调用外部工具,如使用 MCP 或 langchain 框架调用第三方插件或应用,完成工具调度和工作。
- 人工智能趋势演进
- 争议问题
- 失业与隐私:引发关于是否会导致失业、隐私暴露、可控性等争议。
- 伦理问题:存在训练数据对特定群体有偏见、隐私数据安全等伦理问题,法律法规正在逐步完善。
- 大模型挑战
- 输入侧挑战:攻击者可通过构造特殊提示词干扰大模型表现,如注入恶意指令。
- 输出侧挑战:输出可能包含虚假、歧视性、暴力性等不安全内容,用户不能盲目依赖生成内容。
- 传输侧挑战:训练数据在存储和传输环节可能被攻击、泄露,网络带宽可能被占满导致拒绝服务。
- 服务器端挑战:存在训练数据投毒、过度代理、权限突破等问题。
- 模型端挑战:不安全的插件可能导致代码缺陷,攻击侵入大模型系统,泄露隐私数据。
[图片] - 相关概念
- 鲁棒性:可理解为泛化性,即模型能容忍小问题和错误数据干扰,输出正确结果。
- RLHF:基于人类强化反馈学习,将人类偏好作为奖励,优化模型准确率,用于大模型微调。
- 技术展望
- 多模态融合:多个处理不同类型数据的模型融合成大模型,从单一模态向多模态发展。
- 规模与复杂度提升:模型规模和复杂度逐步加大,从卷参数量到卷上下文长度,再到卷泛化能力、准确率和减少幻觉。
- 大小模型协同
- 轻量化模型:通过压缩、蒸馏、剪枝等技术对大模型进行轻量化,使其能在移动端或 PC 端运行,但仍会产生幻觉问题。
- 大小模型互补:小模型在单一专业场景应用广泛且成熟,大模型与小模型互动,大模型传递能力给小模型,小模型得出准确结果后反馈给大模型。
- 具身智能:能理解和推理物理世界与智能体之间的沟通,通过视觉、听觉等多感官物理设备互动,在环境中学习、自适应并执行复杂任务,形成人类智能系统。
更多推荐
所有评论(0)