logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

基于VeRL框架在Atlas 800T A2上打通DeepSeek-671B DAPO强化学习训练流程实践

本文介绍了在Atlas 800T A2集群上实现DeepSeek-671B-R1-Zero模型DAPO强化学习训练的技术方案。针对大模型参数量大、结构复杂的特点,采用vLLM-Ascend推理引擎和Megatron训练后端并行适配的策略,通过权重转换、推理EP使能、Skip_rollout优化等关键技术,解决了显存溢出、精度对齐等问题。实践表明,该方法显著提升了训练效率,最终实现端到端性能达标,为

#人工智能#深度学习
基于VeRL框架在Atlas 800T A2上打通DeepSeek-671B DAPO强化学习训练流程实践

本文介绍了在Atlas 800T A2集群上实现DeepSeek-671B-R1-Zero模型DAPO强化学习训练的技术方案。针对大模型参数量大、结构复杂的特点,采用vLLM-Ascend推理引擎和Megatron训练后端并行适配的策略,通过权重转换、推理EP使能、Skip_rollout优化等关键技术,解决了显存溢出、精度对齐等问题。实践表明,该方法显著提升了训练效率,最终实现端到端性能达标,为

#人工智能#深度学习
【AscendC】MoeInitRoutingGroupedMatmulGrad 算子设计

本文针对MoE模型训练中反向传播阶段的显存溢出问题,提出了一种融合算子优化方案。通过将moe_permute和moe_group_matmul的反向计算合并为单一算子,避免了中间张量d_expanded_x的全量物化。该方案采用分块写入workspace ring buffer并即时执行scatter-add的方式,将显存需求从数GB降至MB级别。同时,通过将权重梯度计算拆分到独立算子,规避了中间

#数据挖掘#人工智能#c++
到底了