logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型训练中的Batch size对训练结果有什么影响?以及对GPU利用率有影响嘛?

在学习大模型训练的过程中,我想到了这一点,因为我记得batch size的大小好像会影响训练结果,但是记不太清了,因此,展开了一系列的调研。

#batch#机器学习#python
大模型断点续训流程

② 优化器状态AdamW 内部存了每个参数的"惯性/动量"。不恢复 = 优化器从零开始"找感觉",续训后 loss 会抖一下、走弯路。你的直觉主干是对的,只是"加载"这一步要加载的不止模型参数,还有优化器状态和进度,这样才能"无缝接上",就像训练从没中断过一样。这就是为什么续训存档(500~700M)比纯权重文件(130M)大得多——多出来的主要就是那个"优化器状态"。加载[模型参数 + 优化器状

#人工智能
区分数据传输速率和数据存储中K的含义

在王道习题(非真题 计组 P267 T12)里面一道题,因为这个细小的差别会导致选错。在数据传输速率中,1K=1000。在数据存储中,1K=1024。

文章图片
#考研
什么是将应用放在边缘服务器上创建?应用不是在用户手机上吗?边缘计算究竟如何优化?通过两个问题来辨析

边缘计算在计算上,有简单的计算能力,可以快速处理用户的请求,在存储上,相当于数据中心的cache,在网络上,因为可以在一定程度上进行本地计算,这节省了带宽,降低了网络延迟。

文章图片
#服务器#边缘计算#运维
【问题思考总结】为什么一点的泰勒展开可以在任意点逼近函数?【泰勒公式 泰勒定理的适用范围】

只要满足闭区间连续,开区间可导,就会存在一个ξ。因此是类似于中值定理的逼近方法。泰勒级数和泰勒展开式目前没有用到,以后有机会补充。(闭区间连续,开区间可导(不要求导函数连续)),,而因为只用到了一点n阶导数值,因此在。即可,是关于一个点的定性分析,一般用于。

文章图片
#考研
为什么duv=udv+vdu

从全导数和全微分的角度,简单梳理duv=udv+vdu。

#考研
【问题思考总结】拉格朗日法的条件极值中的λ可以等于0吗(三种方法)

λ先等于0和后等于0有本质区别,先等于0就剩单个方程了,后等于0好歹里面还剩一个约束条件:因此,本题解的的λ等于0依旧是条件极值的范畴。

文章图片
#考研
什么是非凸优化问题?

在信号处理中,许多信号恢复和图像处理问题也是非凸优化问题。在控制理论中,许多最优控制问题也是非凸的。在运筹学中,许多生产计划和资源分配问题也是非凸的。,因为非凸问题可能存在多个局部最优解,而这些局部最优解不一定等于全局最优解。非凸优化模型是指在优化问题中,目标函数或约束条件不满足凸性条件的模型。:如梯度下降法、牛顿法、拟牛顿法等,这些算法通常只能找到局部最优解,但计算效率较高。:如粒子群优化、蚁群

文章图片
#人工智能
【总结】考研数学中函数的对称性(f(a+x)=f(a-x))【轴对称和中心对称】

在做题的时候发现,关于对称性这部分老错,特此总结。

#考研
【问题思考总结】第一型曲线积分和第二型曲线积分的区别与联系【从几何知识的角度思考】

求两类曲线积分的转化,实质上就是求方向向量,把握好两类积分的联系,会解方向向量,这方面的题的求解将更加有底。

文章图片
#考研
    共 13 条
  • 1
  • 2
  • 请选择