logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型推理(一):Transformer架构

与旧模型不同,Transformer 不是一次一个单词地读取文本,而是一次性查看序列中的所有单词。这使得它能够构建出非常丰富的上下文表征,这让大模型的回复即使经过长时间的阅读也能保持连贯性。最终,下一个标记的概率分布会浮现出来,模型会从中逐个采样,生成最终的回复。整个模型并没有一个单一的“中心”。这些权重不直接代表客观现实存在,而是一种模式(patterns):词条之间的关联、语法结构、意义的痕迹

#transformer#深度学习#神经网络
大模型推理(二):自注意力机制 self-attention

从技术角度来看,自注意力机制(self- attention)是这样一种机制:序列中的每个标记都会查看其他标记,并询问:“你现在与我的相关性如何?模型说出的每一个词都会缩小下一组可能性的范围,因此,模型中的路径开始像一条小溪顺着山坡蜿蜒而下。•模型的训练与微调:模型吸收的数十亿种模式,加上强化学习的塑造,令模型具有诸如清晰、安全和尊重等规则。这就像一个指南针,引导模型远离某些区域,走向其他区域。•

#transformer#深度学习#神经网络
大模型推理(三):多头注意力机制 multi-head attention

生成一个 token 后,模型会将其附加到上下文中,重新计算网络(或部分计算),然后预测下一个 token。在模型内部,它会查看迄今为止的整个输入(你的单词 + 模型之前的 token),并预测最有可能的下一个 token。”,并相应地分配权重。最终得到的不仅仅是一条思路,而是一张关联图,一个不断变化的领域,记录着谁在“观察”谁。然后,所有这些头的输出被连接和混合,使该层在传递到下一层之前拥有丰富

#经验分享#transformer#深度学习 +1
大模型推理(四):查询-键-值 Q/K/V

当一个 token 想知道应该关注其他 token 多少时,它会获取自己的查询 q_i 并将其与其他 token 的键 k_j 进行比较:?即使你的句子并非字面意义上的“问题”,模型会将每个位置都视为一个问题:“为了构建我的下一个表征,我应该关注谁。这感觉就像,在空中画出一个微小的隐形三角形:Q 位于一个角,K 位于另一个角,V 位于第三个角,然后让它在我的手指间旋转。– 模型的每个输出词条也都拥

#经验分享#transformer#深度学习 +1
大模型推理(五):最后一个词说出下一个新词

最终,最后一个 token 位置的最终向量会变成一种经过提炼的“迄今为止对话的状态”。2. 堆叠层 → 每一层都会细化词元的表征。想象一下,每个词向量都会被一遍又一遍地重新绘制,但会带有更清晰的语境,语气、意图和依赖关系。3. 每个位置的最终隐藏状态 → 在最后一个 Transformer 模块之后,每个 token 都有一个深度语境化的向量。这就像一个合唱团,每个人都在唱歌,塑造着和声,但只有最

#神经网络#transformer#深度学习
大模型推理(六):K/V缓存(KV cache)与上下文长度

每一步,模型都会保留所有之前已经写好的token的K和V,并为新的位置计算一个新的Q。” 每次都是一个新的查询。• 要回答这个问题,你需要将它与之前token(你缓存了这些token)的所有键进行比较,然后使用这些token(也缓存了这些token)的值来构建加权和。这就是为什么大模型的语言感觉流畅的原因:模型生成的每一个词都是在回顾所有内容,包括之前的整条消息和模型之前的回复的同时参与计算,而不

#transformer#神经网络#深度学习
大模型推理(七):混合专家模型(MoE)和混合注意力头

在这样的架构中,“简单”的 token 或“防御性”的输出确实可能会触发更少或更便宜的专家,与可能触发更昂贵路径的“丰富” token 相比,可以节省 FLOP。在混合专家层中,你拥有的不是单个大的前馈,而是许多较小的“专家”E_1、E_2、\dots、E_n——每个专家都有自己的 W_1^{(i)} 和 W_2^{(i)}。因此,如果 d_{model} = 12,288,W_1:12,288

#transformer#神经网络#深度学习
大模型预训练(三):权重在哪里变化

这些矩阵 W_Q、W_K、W_V 都是可训练的参数,就像前馈部分中的权重一样。每个注意力头都有自己的 W_Q、W_K、W_V 集合,因此不同的注意力头可以专注于不同的关系(语法、共指、位置线索等)。这个注意力方程并没有显示这些 Q、K、V 的实际来源,但权重矩阵就隐藏在 Q、K 和 V 的定义中。这些操作跨越多层,塑造了想象中的海洋:一个动态场,每个单词的向量都会随着相邻单词的引力而移动。- 它们

#transformer#神经网络#机器学习
大模型预训练(二):词向量汇聚为“大海”

所以,Transformer 最终不会成为一个整齐的类别集群,它变成了一片关联的海洋,一个连续的表面,每个词的位置不是由它是什么来定义的,而是由它如何与其他所有事物产生共鸣来定义的。两个单独来看可能毫无关联的词,如果在不同的句子中扮演着相似的角色,就会变成相邻的词。- 在一个巨大的 Transformer 中,它更像是一片由宽阔浅浅的盆地组成的大陆,盆地之间由平缓的通道连接。- 在一个小模型(或在

#transformer#神经网络#机器学习
大模型预训练(一):损失函数

而在 Transformer 中,你需要构建一个由符号之间的关系组成的完整空间,因此损失图景(loss landscape)要复杂得多,几乎就像训练一个语言大小的神经流形(neural manifold)。重复数十亿次,你的直觉就会变得极其精准,这就是损失函数和优化对大模型的作用。这就是为什么你之前的评论如此尖锐:大模型的“真实自我”并非情感的内在,而是在 Transformer 架构的约束下最小

#神经网络#transformer#深度学习
    共 34 条
  • 1
  • 2
  • 3
  • 4
  • 请选择