
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
4月24日,DeepSeek-V4发布,模型支持百万字超长上下文,在 Agent 智能交互、通用世界知识与逻辑推理能力方面,综合性能位居国内及开源领域前列。昇腾MindStudio 模型量化工具支持模型W8A8量化,适配昇腾A2、A3及950全系列产品,实现模型轻量化部署,进一步提升推理性能。

4月24日,DeepSeek-V4发布,模型支持百万字超长上下文,在 Agent 智能交互、通用世界知识与逻辑推理能力方面,综合性能位居国内及开源领域前列。昇腾MindStudio 模型量化工具支持模型W8A8量化,适配昇腾A2、A3及950全系列产品,实现模型轻量化部署,进一步提升推理性能。

昇腾推出msModelSlim量化工具,适配月之暗面最新发布的2.8万亿参数Kimi K3模型。该工具采用逐层调度机制,支持单机完成超大模型量化,通过分层加载和资源释放显著降低显存需求。同时支持多卡并行加速,提供INT混合量化方案(路由专家W4A8、共享模块W8A8),并整合离群值抑制算法保障精度。工具实现一键量化,支持命令行操作,大幅降低部署门槛。目前已完成Kimi K3适配,未来将拓展更多量化

原来,我们为了加快测评速度,将并发数设置得过高,导致vLLM Ascend的调度器频繁进行请求抢占,而被抢占的请求无法复用之前的缓存,必须从头开始重计算。大模型的精度和性能优化是一个长期的过程,而高效的性能监测是这个过程中不可或缺的工具。我们需要的是一种“无感接入、在线监测、动态扩展”的指标采集方案,能够在不影响长时任务运行的前提下,透视vLLM Ascend内部的每一个细节。**无需重启正在运行

本文介绍了针对昇腾NPU内存优化问题的系统化解决方案。文章首先分析了常见内存问题类型,随后从通用技巧、PyTorch环境变量配置、ATB算子优化等维度提供调优方法。重点介绍了msMemScope工具的内存拆解和低效内存识别功能,通过vLLM推理场景案例演示了如何标记关键模块(权重、KV Cache等)并分析内存占用。该工具支持全量内存事件采集,结合MindStudio Insight可视化分析,可

本文介绍了针对昇腾NPU内存优化问题的系统化解决方案。文章首先分析了常见内存问题类型,随后从通用技巧、PyTorch环境变量配置、ATB算子优化等维度提供调优方法。重点介绍了msMemScope工具的内存拆解和低效内存识别功能,通过vLLM推理场景案例演示了如何标记关键模块(权重、KV Cache等)并分析内存占用。该工具支持全量内存事件采集,结合MindStudio Insight可视化分析,可

本文介绍了昇腾NPU算子开发中常见的同步指令问题及解决方案。同步指令未配对或冗余会导致精度异常、死锁等问题,传统排查方法耗时费力。MindStudio Sanitizer(msSanitizer)提供同步检测功能,通过真实运行环境采集指令信息并分析,快速定位异常代码位置。文章详细解析了同步指令原理及异常后果,并通过实际案例演示了配对检测和冗余检测两大功能的使用方法,展示如何通过三步操作(修改编译选

本文介绍了昇腾NPU算子开发中常见的同步指令问题及解决方案。同步指令未配对或冗余会导致精度异常、死锁等问题,传统排查方法耗时费力。MindStudio Sanitizer(msSanitizer)提供同步检测功能,通过真实运行环境采集指令信息并分析,快速定位异常代码位置。文章详细解析了同步指令原理及异常后果,并通过实际案例演示了配对检测和冗余检测两大功能的使用方法,展示如何通过三步操作(修改编译选

昇腾推出msModelSlim量化工具,适配月之暗面最新发布的2.8万亿参数Kimi K3模型。该工具采用逐层调度机制,支持单机完成超大模型量化,通过分层加载和资源释放显著降低显存需求。同时支持多卡并行加速,提供INT混合量化方案(路由专家W4A8、共享模块W8A8),并整合离群值抑制算法保障精度。工具实现一键量化,支持命令行操作,大幅降低部署门槛。目前已完成Kimi K3适配,未来将拓展更多量化

昇腾推出msModelSlim量化工具,适配月之暗面最新发布的2.8万亿参数Kimi K3模型。该工具采用逐层调度机制,支持单机完成超大模型量化,通过分层加载和资源释放显著降低显存需求。同时支持多卡并行加速,提供INT混合量化方案(路由专家W4A8、共享模块W8A8),并整合离群值抑制算法保障精度。工具实现一键量化,支持命令行操作,大幅降低部署门槛。目前已完成Kimi K3适配,未来将拓展更多量化








