logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Python 版本升降级的后悔药——关键时候能救命

每天一个小知识,关键时候能救命,最有用的一集。在做AI项目时,总免不了与虚拟环境和各种库斗智斗勇,我就是在无意中将conda某env环境Python升级3.10了,导致环境直接崩塌,各种报错。但如果我把Python版本降到3.9,还会还原原来的环境吗。

文章图片
#python#开发语言#深度学习 +3
DeepSeek 爆火的 “黑魔法”:MLA 让大模型显存直接省 75%,这操作太秀了!

DeepSeek的MLA(多头潜在注意力)机制通过创新性的压缩存储方式大幅降低显存占用。与传统MHA(多头注意力)需要存储完整的K/V值不同,MLA将输入压缩为2个数的"压缩包"存储,利用矩阵结合律实现计算时无需还原原始数据。这种设计将显存占用降至MHA的1/4,同时保持相近性能表现。在初始化方面,预训练阶段采用标准初始化保证模型学习能力,而微调阶段则采用LoRA的特殊初始化策

文章图片
#人工智能#transformer#python +2
大模型 “瘦身” 黑科技:DeepSeek MLA 靠 2 个矩阵,把显存砍半还不丢性能?

摘要:DeepSeek的MLA和LoRA技术通过低秩分解实现高效参数压缩,将高维特征向量压缩为少量"精华数字"存储,使用时再还原。这一过程利用压缩器和生成器矩阵:前者提取核心特征(如从4维压至2维),后者恢复完整维度。该技术基于"低秩假设",在节省50%显存的同时保持计算效率,使大模型兼具轻量化和高性能特性。典型场景下,输入向量经过降维-升维处理后,能完整保

文章图片
#机器学习#python#算法 +2
《AI Agent 到底是什么?看完这篇你就懂大模型的下一个风口》

文章摘要: AIAgent(智能体)实现了从"缸中之脑"到"全能管家"的进化,为LLM配备了感知、工具和规划能力。其核心采用"双轨制"逻辑:先评估任务复杂度,再分流执行简单对话或复杂任务。对于复杂任务,Agent能自主拆解目标、调用工具并整合结果,具备自我纠错能力。这种架构如同操作系统,将LLM的推理能力转化为实际执行力,突破了数字与物理

文章图片
#人工智能#transformer#深度学习 +3
深度学习与大语言模型LLM的区别

摘要:深度学习(DL)是AI的核心技术基础,而大语言模型(LLM)是其顶级应用。DL作为方法论,通过多层神经网络处理各类数据;LLM则专攻文本领域,基于Transformer架构实现通用智能。二者关系可类比为"内燃机技术"与"波音747"——DL提供原理支撑,LLM展现复杂应用。现代AI开发中,DL作为底层工具,而LLM已成为可直接调用的基础设施,使开发者无

#深度学习#语言模型#人工智能 +3
深度学习与强化学习的区别

摘要:深度学习与强化学习在AI系统中扮演不同角色:前者负责感知与模式识别(如自动驾驶识别红灯),后者专注于决策优化(如决定刹车动作)。核心区别在于反馈机制(标准答案vs奖惩信号)和数据来源(静态历史数据vs动态交互数据)。深度学习提供基础认知能力,强化学习则实现长期收益最大化。二者通常协同工作,如ChatGPT先用深度学习学习语言,再通过强化学习优化回答策略。本质差异在于:深度学习是"认

#深度学习#人工智能#算法 +3
深度学习与大语言模型LLM的区别

摘要:深度学习(DL)是AI的核心技术基础,而大语言模型(LLM)是其顶级应用。DL作为方法论,通过多层神经网络处理各类数据;LLM则专攻文本领域,基于Transformer架构实现通用智能。二者关系可类比为"内燃机技术"与"波音747"——DL提供原理支撑,LLM展现复杂应用。现代AI开发中,DL作为底层工具,而LLM已成为可直接调用的基础设施,使开发者无

#深度学习#语言模型#人工智能 +3
知识蒸馏封神密码:KL 散度如何让 “学生” 偷师 “老师” 的暗知识?

KL 散度(也称相对熵)用于衡量两个概率分布之间的差异。假设我们要用一个分布(学生模型的预测)来近似另一个分布(教师模型的真实分布),KL 散度计算的就是这种近似过程中带来的信息损失。在深度学习优化中,因为教师分布固定,最小化 KL 散度等价于最小化交叉熵。维度详细说明位置处于模型训练阶段 (Training Phase)。具体来说,是在计算 Loss 反向传播之前。输入1. 教师模型对当前 Ba

文章图片
#机器学习#人工智能#python +1
混淆矩阵玩不转?场景里它的 “正反” 格式能坑哭算法工程师——两分钟带你搞明白

摘要:混淆矩阵是评估机器学习模型的核心工具,包含TP、TN、FP、FN四种判断结果。在安全领域(如入侵检测),正样本通常代表攻击流量,负样本为正常流量。混淆矩阵存在两种常见格式:理论标准格式(正例在前)和Python sklearn格式(负例在前)。关键指标如精确率(Precision)和召回率(Recall)存在权衡关系,安全场景更关注高召回率(减少漏报)。F1分数适合处理样本不平衡问题,而准确

文章图片
#算法#深度学习#transformer +2
用 MSE 训分类模型?交叉熵:你这是在给模型 “下慢性毒药”

摘要:交叉熵损失函数是分类任务的核心工具,通过衡量预测分布与真实分布的差异来评估模型性能。其核心逻辑是利用对数函数特性,对错误预测施加更大惩罚。相比均方误差,交叉熵配合Softmax能避免梯度消失问题,错误越大则梯度越大,收敛更快。该函数在训练阶段处于关键位置,将模型表现量化为损失值,指导参数调整方向。在入侵检测等多分类任务及语言模型预测中具有重要作用,既实现最大似然估计,又保证优化过程的凸性,促

文章图片
#transformer#深度学习#人工智能 +2
    共 23 条
  • 1
  • 2
  • 3
  • 请选择