
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
该文件的作用的是:清晰记录exp_1实验的模型差异化参数,后续复现实验时,只需加载此文件即可还原当时的模型设置,无需修改代码或基础配置。调用PyYAML库读取exp_1/model.yaml,并结合基础配置base/model.yaml生成完整参数。每个实验目录包含dataset.yaml、model.yaml、training.yaml等文件。dataset.py:自定义数据集类(继承自tor

除了上述主要的激活函数外,深度学习领域还涌现了许多新型激活函数。Swish:由 Google Brain 团队在 2017 年提出,公式为:Swish 结合了 Sigmoid 的门控机制和线性部分,在多个任务上表现优异。Mish:2019 年提出的自门控激活函数,公式为:Mish 在保持非单调性的同时,具有更好的正则化效果。GLU(门控线性单元):公式为:其中 σ 是 Sigmoid 函数,⊙

在深度学习领域,过拟合是一个普遍存在的问题,它指的是模型在训练数据上表现良好,但在未见过的测试数据上性能显著下降的现象。正则化是解决过拟合问题的核心技术之一,它通过限制模型复杂度、引入额外约束或增加训练数据多样性等方式,提高模型的泛化能力。正则化方法的选择直接影响模型的性能、可解释性和计算效率。随着深度学习模型规模不断增大和应用场景日益复杂,正则化技术也在不断发展和创新。从早期的 L1 和 L2

AI推理是指模型训练完成后,基于输入数据生成预测结果的过程,区别于训练阶段的大规模参数迭代与反向传播,推理更注重低延迟、高吞吐、资源高效利用,是模型从实验室走向产业应用的最后一公里。计算瓶颈计算受限型场景多出现于模型前向计算密集、算力无法满足计算需求的环节,典型如大模型预填充阶段的大规模矩阵乘法,算力(如GPU Tensor Core)成为性能上限;而内存带宽瓶颈是当下大模型推理的主要痛点,模型权

AI推理是指模型训练完成后,基于输入数据生成预测结果的过程,区别于训练阶段的大规模参数迭代与反向传播,推理更注重低延迟、高吞吐、资源高效利用,是模型从实验室走向产业应用的最后一公里。计算瓶颈计算受限型场景多出现于模型前向计算密集、算力无法满足计算需求的环节,典型如大模型预填充阶段的大规模矩阵乘法,算力(如GPU Tensor Core)成为性能上限;而内存带宽瓶颈是当下大模型推理的主要痛点,模型权

除了上述主要的激活函数外,深度学习领域还涌现了许多新型激活函数。Swish:由 Google Brain 团队在 2017 年提出,公式为:Swish 结合了 Sigmoid 的门控机制和线性部分,在多个任务上表现优异。Mish:2019 年提出的自门控激活函数,公式为:Mish 在保持非单调性的同时,具有更好的正则化效果。GLU(门控线性单元):公式为:其中 σ 是 Sigmoid 函数,⊙

蒙特卡洛方法(Monte Carlo Methods)是强化学习领域中一类重要的无模型学习技术,它通过对环境进行随机采样来估计价值函数和优化策略。与基于模型的动态规划方法不同,蒙特卡洛方法直接从经验中学习,不需要预先知道环境的状态转移概率和奖励函数,这使得它在现实世界中那些难以建模的复杂环境中具有独特优势。蒙特卡洛方法的基本思想源于大数定律:通过进行足够多的随机试验,利用这些试验的平均值来逼近真实
大语言模型作为人工智能领域的重要突破,其技术架构的演进深刻影响着自然语言处理的发展方向。本文系统梳理了从2017年Transformer架构诞生到2020年GPT-3发布这一关键时期的技术发展脉络,深入分析了大数据与大模型结合的扩展法则,并对比了Encoder-only、Encoder-Decoder、Decoder-only三种主流架构的技术特点。研究表明,,而不同架构在理解能力、生成能力和推理

在深入探讨Prompt工程之前,我们首先需要明确什么是Prompt和Prompt工程。Prompt的定义Prompt是用户向大型语言模型(LLM)发出的、用以引导其执行特定任务并生成相应回应的指令或输入。简单来说,Prompt就是你告诉AI要做什么的文本。它可以是一个简单的问题、一条指令、部分句子或更复杂的文本结构,在机器翻译、文本摘要、问答系统等多种自然语言处理任务中都有应用。从技术角度看,Pr

在深度学习领域,循环神经网络 (RNN) 是处理序列数据的强大工具,但传统 RNN 在处理长序列时面临两个主要挑战:短时记忆和梯度消失 / 爆炸问题。当序列长度增加时,RNN 很难捕捉到序列中相隔较远的信息之间的依赖关系,这种现象被称为 "记忆健忘症"。同时,在反向传播过程中,梯度会随着时间步的推移而逐渐消失或爆炸,导致模型难以学习到长期依赖关系。LSTM(Long Short-Term








