
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在新机器上重装Ascend+MindSpore2.1环境,并行设置dp:mp:pp = 1:1:2时,报如下错误:(只要是设置了pp>1,都报下面的错误)【注意】:MindSpore2.2.0版本,cell_reuse装饰器的写法有变化,不需要后面的括号。应该是开启了cell共享的环境变量,所以报这个pipeline错误。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNa

MindSpore跑wizardcoder模型,dp:mp:pp=1:2:4,num_layer=16时可以跑通,但是当设置num_layer=20时出现如下报错。硬件环境(Ascend/GPU/CPU): Ascend。因此在多机并行时,只能采用离线切分的方法。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.2。

该情况下可能不是问题,pipeline并行需要查看最后一张卡的loss,其余卡的loss均为0。MindSpore模型Pipeline并行发现有些卡的log中loss为0。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.2。

根据报错信息可以知道我们给query_embeds传了多个值,但是实际上是只需要一个即可,所以我们会首先看下传入的这个 self.query_tokens是不是有问题,我们通过打印分析,self.query_tokens是一个Tensor,不存在多值的情况。此时我们问题定位不仅仅只关注报错,可能是其他问题诱发这个给人误导性的报错,我们走读脚本发现在报错代码的上面有一句。硬件环境(Ascend/GP
MindSpore大模型并行需要在对应的yaml里面做哪些配置。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.2.0。

在新机器上重装Ascend+MindSpore2.1环境,并行设置dp:mp:pp = 1:1:2时,报如下错误:(只要是设置了pp>1,都报下面的错误)【注意】:MindSpore2.2.0版本,cell_reuse装饰器的写法有变化,不需要后面的括号。应该是开启了cell共享的环境变量,所以报这个pipeline错误。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNa

MindSpore跑wizardcoder模型,dp:mp:pp=1:2:4,num_layer=16时可以跑通,但是当设置num_layer=20时出现如下报错。硬件环境(Ascend/GPU/CPU): Ascend。因此在多机并行时,只能采用离线切分的方法。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.2。

需要用多卡或者多机跑,整体HBM至少模型大小的4倍。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.2.0。模型并行显示内存溢出。一般是因为模型太大。
该情况下可能不是问题,pipeline并行需要查看最后一张卡的loss,其余卡的loss均为0。MindSpore模型Pipeline并行发现有些卡的log中loss为0。硬件环境(Ascend/GPU/CPU): Ascend。执行模式(PyNative/ Graph): 不限。MindSpore版本: 2.2。

根据报错信息可以知道我们给query_embeds传了多个值,但是实际上是只需要一个即可,所以我们会首先看下传入的这个 self.query_tokens是不是有问题,我们通过打印分析,self.query_tokens是一个Tensor,不存在多值的情况。此时我们问题定位不仅仅只关注报错,可能是其他问题诱发这个给人误导性的报错,我们走读脚本发现在报错代码的上面有一句。硬件环境(Ascend/GP







