logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepSeek-V3 与 GPT 核心技术原理及差异

摘要: DeepSeek-V3与GPT均基于Transformer架构,但核心设计存在显著差异。GPT采用Decoder-Only结构和标准多头注意力(MHA),虽自回归生成效率高,但面临KV Cache显存爆炸问题(如GPT-3单Token缓存达4.72MB)。DeepSeek-V3通过两项创新优化: MLA(低秩联合压缩注意力):突破传统分组共享(GQA)限制,从矩阵分解角度压缩KV Cach

#深度学习#人工智能#神经网络
大模型训练流程以及核心微调方法

在使用 LoRA 时,我们假设模型需要W是一个满秩的大矩阵,才能捕捉到预训练数据集中的所有知识。如果A的行数与ΔW相同, B的列数与ΔW相同,则分解式可以写成ΔW = AB。(AB是矩阵A和B的乘积)通过数学推导,DPO 发现“奖励模型”的优劣可以直接反映在“策略模型(即我们要训练的模型)”生成答案的概率上。2023 年以来的主流,通过直接优化模型在“好答案”和“坏答案”上的对数概率差,取代了复杂

#人工智能#深度学习
DeepSeek-V3 与 GPT 核心技术原理及差异

摘要: DeepSeek-V3与GPT均基于Transformer架构,但核心设计存在显著差异。GPT采用Decoder-Only结构和标准多头注意力(MHA),虽自回归生成效率高,但面临KV Cache显存爆炸问题(如GPT-3单Token缓存达4.72MB)。DeepSeek-V3通过两项创新优化: MLA(低秩联合压缩注意力):突破传统分组共享(GQA)限制,从矩阵分解角度压缩KV Cach

#深度学习#人工智能#神经网络
Linux -- 基本命令

Linux常用命令摘要 本文汇总了Linux系统下的基础命令操作,主要包括: 文件目录操作:ls/cd/pwd/mkdir/rm/cp/mv等 文件内容操作:cat/tail/head/more等 权限管理:chmod/chown/umask 查找比较:find/which/cmp 打包压缩:tar 系统监控:ps/top 其他实用命令:echo/type等 详细说明了各命令的基本格式、常用选项及

#linux#运维#服务器
Linux-- 目录

Linux目录结构采用树状设计,从根目录/开始展开。核心目录包括/bin(基础命令)、/etc(配置文件)、/boot(启动文件)等。用户数据存储在/home(个人文件)和/root(管理员目录)。系统运行时需要/proc(虚拟进程信息)、/sys(硬件信息)等虚拟文件系统。软件安装主要位于/usr(用户程序)和/opt(第三方软件),而/var存放日志等可变数据。特殊目录包括/media(自动挂

#linux#运维#服务器
Linux -- shell

Shell摘要(149字) Shell是用户与内核间的桥梁,兼具命令行解释器和脚本语言功能。它解析用户命令并转译为内核指令,提供交互界面。命令分内置(如cd)和外置(如ls)。脚本编写需三步:创建.sh文件、赋权、执行。变量无需声明,通过$调用;引号中双引号解析变量,单引号原样输出。支持字符串截取和预定义变量(如$0、$#)。算术运算用expr,注意空格和转义。条件判断包括数值比较(-eq)和文件

#linux#服务器#运维
Linux -- 线程

本文摘要:线程是操作系统调度的最小单位,作为进程内的执行路径,具有轻量级、资源共享和独立调度的特点。相比进程,线程创建/切换开销小,可直接访问共享数据,但稳定性较弱(单个线程崩溃会导致整个进程终止)。核心API包括pthread_create创建线程、pthread_join等待线程和pthread_exit退出线程。使用时需注意主线程应等待子线程完成,否则可能导致进程提前终止。通过示例展示了多线

#java#jvm#算法
Linux -- 基本命令

Linux常用命令摘要 本文汇总了Linux系统下的基础命令操作,主要包括: 文件目录操作:ls/cd/pwd/mkdir/rm/cp/mv等 文件内容操作:cat/tail/head/more等 权限管理:chmod/chown/umask 查找比较:find/which/cmp 打包压缩:tar 系统监控:ps/top 其他实用命令:echo/type等 详细说明了各命令的基本格式、常用选项及

#linux#运维#服务器
动态规划 -- 矩阵连乘问题

摘要:本文实现了矩阵链乘法问题的两种解法。递归解法MatrixChain1采用备忘录方法,通过分解子问题计算最优分割点k,并存储中间结果。动态规划解法MatrixChain2通过迭代方式自底向上填充代价表m和分割点表s。Traceback函数利用存储的分割点信息递归回溯最优计算顺序。两种方法都通过p数组存储矩阵维度,m存储最小乘法次数,s存储最优分割位置,最终解决矩阵链乘法的最优计算顺序问题。

#动态规划#矩阵#代理模式 +3
动态规划 -- 矩阵连乘问题

摘要:本文实现了矩阵链乘法问题的两种解法。递归解法MatrixChain1采用备忘录方法,通过分解子问题计算最优分割点k,并存储中间结果。动态规划解法MatrixChain2通过迭代方式自底向上填充代价表m和分割点表s。Traceback函数利用存储的分割点信息递归回溯最优计算顺序。两种方法都通过p数组存储矩阵维度,m存储最小乘法次数,s存储最优分割位置,最终解决矩阵链乘法的最优计算顺序问题。

#动态规划#矩阵#代理模式 +3
到底了