
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
序列中每一个单词所在的位置对应一个向量。这一向量会与单词表示对应相加并送入后续模块中做进一步出来。在训练的过程中,模型会自动学习到如何利用这部分位置信息。2。

机制核心优化点类比场景典型优势稀疏注意力减少计算量(只关注重要部分)跳读一本书长序列处理效率提升优化内存访问顺序一次性准备好所有食材再做饭速度快、省显存多查询注意力共享参数(K/V)小组作业共享工具推理速度快、参数少多头潜在注意力捕捉隐藏关联创建隐藏文件夹整理照片深层语义理解能力更强稀疏注意力少看(只看关键部分)—— 像读长文章只看段落首尾句,抓重点省时间。快算(不改逻辑只提速)—— 像用计算器算

代码解析实验结果
由于 Transformer 没有 RNN 的 “顺序记忆”,必须手动加入位置信息 —— 通过特定规则生成 “位置向量”,与词嵌入相加,让模型知道 “哪个词在前,哪个词在后”(比如 “我爱你” 和 “你爱我” 的区别)。,得到每个词的概率分布(如生成 “learning” 的概率是 0.8,“study” 是 0.1),再通过贪心搜索或束搜索(Beam Search)选择最可能的词,逐步生成完整序

核心技术:自顶向下 / 自底向上的注意力提示(Cues)自顶向下提示:由任务目标定义 “关注方向”(如翻译时,解码器当前状态作为 Query,代表 “需要翻译的词”)。自底向上提示:由输入数据的显著性特征驱动(如文本中高频词、图像中高对比度区域)。作用:确定 “Query”(当前任务的关注点),回答 “模型应该关注什么”。注意力提示是引导模型 “关注什么” 的信号,本质是驱动注意力分配的线索。非自

机制核心优化点类比场景典型优势稀疏注意力减少计算量(只关注重要部分)跳读一本书长序列处理效率提升优化内存访问顺序一次性准备好所有食材再做饭速度快、省显存多查询注意力共享参数(K/V)小组作业共享工具推理速度快、参数少多头潜在注意力捕捉隐藏关联创建隐藏文件夹整理照片深层语义理解能力更强稀疏注意力少看(只看关键部分)—— 像读长文章只看段落首尾句,抓重点省时间。快算(不改逻辑只提速)—— 像用计算器算

传统微调:给大模型 “全身体检 + 重训”,贵且麻烦;LoRA:只给大模型 “局部小手术”,快又省;AdaLoRA:“智能小手术”,哪里重要修哪里;QLoRA:“压缩后小手术”,普通设备也能做。

DQN(Deep Q-Network),即深度 Q 网络,是强化学习领域中一个非常经典且具有开创性的算法。它将深度学习和 Q 学习相结合,用于解决状态空间和动作空间较大的问题。在强化学习里,有智能体、环境、状态、动作、奖励这些关键元素。可以把智能体想象成一个游戏玩家,环境就是游戏世界,状态是游戏玩家当前所处的局面,动作是玩家可以采取的操作,奖励则是执行动作后获得的分数或者惩罚。

在马尔可夫决策过程(MDP)中,动态规划(Dynamic Programming, DP)算法是求解最优策略和最优价值函数的经典方法。其核心思想是利用,通过迭代更新价值函数或策略,最终收敛到最优解。和。

强化学习就像 “教智能体做决策” 的工具箱,不同问题需要不同工具。下面从最基础的 “模仿人类” 到复杂的 “多智能体协作”,用生活化的例子拆解六大技术方向,包括细分方法、核心区别、优缺点和应用场景,确保每个技术的细节都讲透。








