
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
昇腾910训练大模型内存分配失败解决方案 在昇腾910上使用MindSpore训练7B大模型时出现Malloc device memory failed, drvRetCode=6错误,主要原因是设备内存(HBM)耗尽。建议以下解决方案: 检查显存占用:通过npu-smi info确认是否有其他进程占用显存,必要时终止无关进程或切换空闲卡。 调整HCCL通信内存:降低max_device_memo
采用下面的固定比特量化的方式得到的量化模型大小和fp16精度一样大,推理效率也一样,没有int8量化的效果,去掉'--optimize=ascend_oriented'后大小符合预期,但推理报错。转换命令量化参数。
在进行“MindSpore-Lab/Qwen3-Next-80B-A3B-Thinking”模型推理时,遇到了docker镜像无法下载的问题。就报错情况看,可能是该镜像的下载需要先进行登录。未登录的用户无权限拉取镜像!参考文档:Docker镜像链接:docker pull。
这个错误通常是mindnlp版本和mindspore版本不匹配造成的,ai pro上mindnlp 0.4.1分支+mindspore 2.5是可以的,不会有这个问题;之前根据这个帮忙在ai pro上测试janus跑过,mimdspore 2.4和2.5轻测可以运行;

运行脚本配置文件报错信息尝试过魔乐社区和huggingface的bf16版本 应该不是权重文件问题 求助如何解决。
在用 MindSpore 做大模型分布式训练时遇到棘手问题,求有实战经验的朋友指点一下。目前已经完成模型组网、数据集加载、优化器配置,单机单卡训练可以正常跑通,loss 下降也很平稳,但切换到多卡分布式训练后就出现异常:多卡训练 loss 震荡剧烈,收敛速度远不如单机,不同卡之间输出 logits 存在明显差异,偶尔还会出现训练中途精度突然跳水,也没有显存溢出、报错退出的情况。
使用华为昇腾AI处理器(Ascend 910)搭配MindSpore框架进行大模型训练时遇到了一个棘手的问题,已经排查了好几天还没解决,特来求助。正在尝试在单台8卡昇腾910服务器上微调Qwen-14B模型。环境配置完成后,启动训练脚本大约运行30分钟后,程序会突然崩溃,报错信息显示为“INFNAN模式溢出”和“TBE compile failed for custom operator”双重错误
-fmk=ONNX运行转换命令后报错说缺少ascend 插件库,请问要怎么解决?使用的是mindspore2.4,mindspore lite2.7,cann是8.2.RC1,驱动版本23.0.0。
摘要:使用MindSpore推理DeepSeek模型时出现文本质量骤降问题。经排查权重转换、精度对齐等常见因素后仍无改善。关键原因可能包括:RoPE位置编码实现差异、QKV权重转置错误、RMSNorm计算不一致、注意力掩码逻辑偏差、权重精度损失、KVCache切片错误等。这些不报错的隐性实现差异会导致模型语义理解失效和生成异常,建议重点检查位置编码、归一化层和注意力机制等核心组件的实现一致性。(1
MindIE(Mind Inference Engine,推理引擎)是华为昇腾针对AI全场景业务的推理加速套件。MindSpore是一种适用于端边云场景的新型开源深度学习训练/推理框架。从字面理解,MindIE 和 MindSpore 都能做推理,区别在哪?MindIE 未开源,MindSpore 已开源,原因是啥?这两个最终会不会统一?







