
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
增加训练阶段算力投入增加推理阶段算力投入(也称作推理时缩放或测试时缩放注释:在机器学习与人工智能领域,“算力(compute)”指训练或运行模型所需的计算资源。图4.2展示了上述两种方案。从图表直观来看,无论加大训练算力还是推理算力,都能提升模型推理效果。但实际工程中,大语言模型一般会结合两种方式共同优化推理能力:一方面投入大量算力完成模型训练(后续章节讲解),另一方面提升推理阶段算力开销(本章核
变量 eps 是一个小常数(epsilon),在归一化过程中会被加到方差上以防止除零错误。scale 和 shift 是两个可训练的参数(与输入维度相同),如果在训练过程中发现调整它们可以改善模型的训练任务表现,那么大语言模型会自动进行调整。这使得模型能够学习适合其数据处理的最佳缩放和偏移。层归一化中 scale 和 shift 的作用直觉问题:如果只是把数据变成 mean=0、var=1,确实不
本文介绍了word2vec模型中W_in、h和W_out三个关键组件的功能。W_in是输入矩阵,将one-hot编码的输入词转换为隐藏向量h;h作为中间表示,用于与输出矩阵W_out的列向量计算点积得分,预测目标词。W_out存储每个词作为输出时的向量表示。三者协同工作:W_in将输入词映射为h,h通过与W_out的交互计算各候选词的得分,最终实现词向量学习和上下文预测。这种架构有效捕捉了词语间的

本文解释了神经网络中权重共享机制导致参数重复的问题。当多个层共享同一权重矩阵时,参数列表会出现重复项,而每个层会独立计算梯度。若不处理,优化器(如Adam)会错误地为同一参数维护多套历史状态并多次更新。解决方案是在参数更新前调用remove_duplicate()函数:1)识别重复参数;2)合并对应梯度;3)删除重复项。该方法确保共享权重只被更新一次,同时正确处理梯度累积,避免优化器状态混乱。文中
摘要: 神经网络反向传播中,梯度分为参数梯度(dW/db)和输入梯度(dx)。参数梯度(如dW_out/dW_in)存储在self.grads中用于优化器更新权重;输入梯度(如dx/da)需返回给前一层继续反向传播。以SimpleCBOW为例:out_layer计算dW_out留存,返回da给in_layer;in_layer计算dW_in留存,dcontexts因无前置层而被丢弃。最终模型梯度存
本文探讨了神经网络中梯度计算的关键细节,主要聚焦于三个核心问题:1)grads[0]的含义及其与参数的对应关系;2)使用[...]原地赋值与直接赋值的区别;3)Embedding层梯度清零的必要性。文章通过代码示例说明,原地赋值能保持数组引用不变,而直接赋值会导致优化器引用失效。对于Embedding层,梯度清零是为了清除上一轮的残留梯度,确保当前批次梯度计算的准确性。同时指出,虽然Embeddi
本文揭示了神经网络输出层与损失函数设计的统计学本质:它们都是基于最大似然估计(MLE)原理的自然选择。文章首先区分了回归(输出连续值)和分类(输出概率)问题,指出分类任务需要将原始输出转换为概率形式。通过抛硬币案例阐释了MLE的核心思想——寻找使观测结果概率最大的参数。在推导过程中,取对数和负号是为了数值稳定和适配梯度下降优化。最终证明交叉熵损失函数(多分类和二分类)都是从MLE推导而来,其本质是
大模型算法方向选择指南:2026年热门赛道解析 当前大模型算法领域呈现多元化发展趋势,11个主要方向可分为两个梯队: 第一梯队(高需求高增长): 推理能力训练:聚焦开放域奖励设计、长链路稳定性等核心问题,重点关注推理预算分配和对抗奖励破解 Agentic Search:搜索能力内化为模型推理部分,强调检索质量奖励和事实核查 Agent/Tool Use:从单工具调用发展到工具链编排,注重真实环境任
L2范数(欧几里得范数)表示向量的直线距离,计算公式为各分量平方和的平方根。例如点(3,4)的L2范数为5(勾股定理)。Lp范数家族包含L1(曼哈顿距离)和L2等不同形式,其中L1为各分量绝对值之和。范数必须使用绝对值,以防止正负分量相互抵消(如x1=100和x2=-100时,不加绝对值会导致总距离计算错误)。图示通过坐标系和数轴直观展示了不同范数的计算方式和几何意义。
在介绍各种激活函数之前,先了解人工神经网络的提出背景和工作原理,从而更好地理解激活函数的作用,以及各个激活函数的特点分析。(想直接看激活函数的朋友可以跳过这部分直接到第3部分对常用激活函数的介绍。)受生物神经系统处理信息的启发,人工神经网络(Artificial neural network[1],简写ANN)的概念被提出。生物神经处理系统由数量庞大的神经元组成,这些神经元之间有复杂的连接关系,形







