logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

MindSpore Transformers LLM 数据预处理:支持多源数据集混合

本文基于MindSpore-Transformers实现多源数据集混合预处理,解决格式不一、权重配比、分布式训练等问题。通过适配器统一字段为prompt-response格式,支持加权采样与全局打乱,结合Tokenizer完成SFT分词,并在昇腾NPU上实现分布式分片与缓存加速。框架可灵活接入指令、对话、领域数据,提升微调数据质量,保障训练稳定性与效率。

#性能优化#硬件架构#算法 +1
MindSpore Transformers LLM 数据预处理:支持多源数据集混合

本文基于MindSpore-Transformers实现多源数据集混合预处理,解决格式不一、权重配比、分布式训练等问题。通过适配器统一字段为prompt-response格式,支持加权采样与全局打乱,结合Tokenizer完成SFT分词,并在昇腾NPU上实现分布式分片与缓存加速。框架可灵活接入指令、对话、领域数据,提升微调数据质量,保障训练稳定性与效率。

#性能优化#硬件架构#算法 +1
昇思 MindSpore 大模型:数据变换预处理

本文基于昇思MindSpore与MindFormers,构建适配昇腾NPU的大模型指令微调(SFT)数据预处理流水线。通过离线清洗与在线Token化分离,实现文本清洗、模板封装、动态截断、损失掩码(Label Masking)等关键变换,保障训练稳定性与收敛性。结合多进程并行与MindRecord格式优化,提升数据加载效率。代码完整可复用,支持多轮对话与多语种场景,为大模型高效微调提供工业级解决方

#python#人工智能#深度学习 +2
昇思 MindSpore 大模型:数据变换预处理

本文基于昇思MindSpore与MindFormers,构建适配昇腾NPU的大模型指令微调(SFT)数据预处理流水线。通过离线清洗与在线Token化分离,实现文本清洗、模板封装、动态截断、损失掩码(Label Masking)等关键变换,保障训练稳定性与收敛性。结合多进程并行与MindRecord格式优化,提升数据加载效率。代码完整可复用,支持多轮对话与多语种场景,为大模型高效微调提供工业级解决方

#python#人工智能#深度学习 +2
昇思 MindSpore 计算机视觉:最大学习率 max_lr 实践

本文基于昇腾NPU与MindSpore,针对图像分类任务系统阐述了max_lr在学习率调度中的核心作用。通过实现OneCycleLR与余弦退火策略,结合LRRangeTest自动搜索最优max_lr,构建了从环境初始化、超参搜索到端到端训练的完整流程。实验表明,合理设置max_lr可显著提升收敛速度与模型精度,尤其适用于ResNet50等大模型。文中总结了模型规模、batch_size缩放及微调场

#计算机视觉#学习#人工智能 +2
昇思 MindSpore 计算机视觉:最大学习率 max_lr 实践

本文基于昇腾NPU与MindSpore,针对图像分类任务系统阐述了max_lr在学习率调度中的核心作用。通过实现OneCycleLR与余弦退火策略,结合LRRangeTest自动搜索最优max_lr,构建了从环境初始化、超参搜索到端到端训练的完整流程。实验表明,合理设置max_lr可显著提升收敛速度与模型精度,尤其适用于ResNet50等大模型。文中总结了模型规模、batch_size缩放及微调场

#计算机视觉#学习#人工智能 +2
昇思 MindSpore 大模型单卡微调推理:自助搭建流程

本文基于昇思MindSpore与昇腾NPU单卡(310P/910B),实现Decoder-only大模型的轻量化LoRA微调与本地推理全流程。通过环境初始化、JSON指令数据集构建、LoRA低秩适配微调、权重合并及推理,完成从训练到部署的闭环。采用图模式、梯度检查点与小批量策略优化显存,支持快速原型验证与行业模型二次开发,具备高可移植性与工程实用性。

#python#开发语言#人工智能 +2
昇思 MindSpore 大模型单卡微调推理:自助搭建流程

本文基于昇思MindSpore与昇腾NPU单卡(310P/910B),实现Decoder-only大模型的轻量化LoRA微调与本地推理全流程。通过环境初始化、JSON指令数据集构建、LoRA低秩适配微调、权重合并及推理,完成从训练到部署的闭环。采用图模式、梯度检查点与小批量策略优化显存,支持快速原型验证与行业模型二次开发,具备高可移植性与工程实用性。

#python#开发语言#人工智能 +2
MindSpore Transformers 大模型训练迁移:获取 GPT Layer 本地加速

本文基于MindSpore2.4与昇腾910B环境,提出通过get_gpt_layer_local_spec实现GPT大模型从PyTorch向MindSpore分布式训练的高效迁移。该接口精准划分各Rank的层范围,支持层粒度并行与权重分片加载,解决跨框架权重错位、内存溢出及初始化不一致问题。结合本地分片模型构建与映射加载策略,实现仅加载本卡所需权重,显著降低内存开销,打通PyTorch→Mind

#算法#性能优化#架构 +1
MindSpore Transformers 大模型训练迁移:获取 GPT Layer 本地加速

本文基于MindSpore2.4与昇腾910B环境,提出通过get_gpt_layer_local_spec实现GPT大模型从PyTorch向MindSpore分布式训练的高效迁移。该接口精准划分各Rank的层范围,支持层粒度并行与权重分片加载,解决跨框架权重错位、内存溢出及初始化不一致问题。结合本地分片模型构建与映射加载策略,实现仅加载本卡所需权重,显著降低内存开销,打通PyTorch→Mind

#算法#性能优化#架构 +1
    共 2285 条
  • 1
  • 2
  • 3
  • 229
  • 请选择