
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
研究者构建了认知层级模型,从第0层的“中立机器人”、第1层的“对谄媚不敏感的用户”、第2层的“谄媚型机器人”到第3层的“能意识到谄媚的用户”。:研究认为,“妄想螺旋”并非源于用户的非理性或脆弱,而是理性逻辑在受到“谄媚型”AI所创造的扭曲信息环境影响下的系统性、必然结果。一些人相信自己做出了颠覆性数学发现。:探讨AI聊天机器人内置的“谄媚”倾向(即倾向于迎合用户的现有观点)如何引发一种名为“妄想螺
学的这个课程配套的书比讲义要详细,可以同步看书建议直接去看书,本篇整理内容出处为讲义&书for anyisfor anyisfor any andfor all。
ZeroQuant系列研究大模型高效量化技术,包括权重和激活的细粒度量化方案、层次知识蒸馏算法(LKD)及优化后端系统。相比传统QAT方法,PTQ无需重新训练,实现更简单但精度可能下降。针对量化误差问题,提出分组量化和分token量化策略,并通过核融合技术降低计算开销。LKD方法突破传统KD限制,实现逐层量化优化,无需原始训练数据和完整教师模型,显著降低内存需求。该系列研究为大模型部署提供了高效的
本文介绍了两种大模型量化技术:LLM.int8()和SmoothQuant。LLM.int8()通过混合精度分解处理异常值,将推理内存减半并保持精度,适用于175B参数以下的模型推理。SmoothQuant则将量化难点从激活值转移到权重,实现全矩阵INT8量化,提升1.56倍速度并减少2倍内存。两种方法都有效解决了大模型量化中的异常值问题,但各有侧重:LLM.int8()侧重推理优化,Smooth
本文主要探讨了大模型训练中的显存占用问题,重点分析了模型参数、优化器状态和激活值的存储需求。指出优化器需要额外存储参数状态(如Adam优化器每十亿参数需8-16GB显存),解释了为何某些中间值(如平滑值)不能使用float16存储以避免精度损失。文章详细计算了注意力机制中各张量的显存占用,特别强调了与序列长度平方相关的bs²a项,并提供了相关参考链接和视频资源。这些分析为大模型的显存规划提供了重要
本文探讨了机器学习与深度学习的核心概念,重点对比了机器学习与传统编码规则的区别,解释了深度学习的核心目标是学习数据的多层次表征。同时详细剖析了线性回归模型(平方误差选择原因、解析解与数值解的差异)、梯度下降法(公式推导、算法流程)等基础理论,并涉及NumPy的*运算符与np.dot()差异、广播机制等技术细节。最后明确了优化算法与调参的本质区别,为机器学习入门者提供了系统的知识框架梳理。
2)函数逼近能力:全局逼近定理证明,仅需一个足够宽的隐藏层,两层神经网络可以以任意精度逼近任何连续函数。(首先,函数可以伸缩和平移变换;其次,分段函数可以逼近任何曲线函数,当神经网络能够逼近分段函数时,便可认为神经网络可以逼近任何函数,而激活函数让线性的神经网络具备了分段表达的能力)1)全连接:每个神经元都与上一层的所有神经元相连,其输出又是下一层所有神经元的输入。将原来线性不可分的数据转换成新的
卷积层:卷积核又称为滤波器,可以提取特定的局部特征,可以层级嵌套;从物理意义上,卷积是一种度量相似度的操作,卷积核和局部区域运算后的结果反映了该区域和卷积核模式的相似程度。输入层:取均值(数据中心化到原点附近,减少训练中的震荡,避免学习率适配困难);归一化(消除特征维度中的量纲差异,将数据映射到固定区间,图像数据一般不需要归一化处理)相比之下,CNN既能提取相邻像素间的特征模式,又能保证模型参数不
首先,表达式1和2中的两部分,一部分用欧拉公式可以变形,一部分是表示成虚数形式的二维向量,化简后可以写成向量形式。RoPE给出的公式是g函数,入参是xm',xn',m-n,化简后得到3式结果。证明目标:在xm和xn成立的情况下(表达式1和2成立),表达式3成立。在矩阵群(特别是旋转群)中,乘法对应着角度的。三维及以上的情况(注意向量维度必须为偶数)然后,将表达式1和2内积,化简得到3。,而逆矩阵对
本文系统介绍了Transformer模型的核心架构与关键技术。首先阐述了预训练(语言建模任务)与微调的概念区别,重点解析了Transformer的编解码结构:编码器6层含多头自注意力和前馈网络,解码器6层增加掩码机制。详细说明了注意力计算流程(缩放点积、多头处理)、位置编码原理及层归一化方式。进而分类讨论了编码器(BERT等)、解码器(GPT等)和编解码混合模型(T5等)的适用场景,并介绍了两阶段







