登录社区云,与社区用户共同成长
邀请您加入社区
B站预约链接:点击预约
基于 vllm-ascend 固定源码快照开展静态实证工程审计。仓库采用 Python+C/C++ 混合架构,作为 vLLM 适配昇腾硬件的推理后端。本文分层拆解调度层、csrc 算子内核、测试与 CI 工程体系,四维治理评估工程完备度,重点分析 CANN 版本绑定、内核调试门槛等国产算力落地特有风险,为昇腾集群部署 vLLM 推理引擎提供可复现的源码尽调方案。
步骤1:基于TKernel创建算子工程创建算子描述文件,定义输入输出、属性及计算逻辑步骤2:编写算子实现代码在中实现自注意力计算的核心逻辑,利用昇腾矢量指令(如vaddvmul// 示例:自注意力QKV投影计算// 昇腾矢量指令加速矩阵乘法步骤3:编译与部署算子将编译生成的*.o文件注册到MindSpore算子库,完成自定义算子部署这是一张图片,ocr 内容为:优化效果实测。
本文详细介绍了Qwen2.5-VL-32B多模态模型在昇腾MindIE框架下的实战应用,包括图片问答和视频分析的完整Demo流程。通过环境配置、模型部署、性能调优等步骤,展示了该模型在工业质检和医疗影像等场景的强大能力,帮助开发者快速掌握多模态AI技术的实际应用。
全新昇腾950系列课程上线,免费算力、多重好礼等你拿!📅 活动时间:即日起至2027年1月11日。
该命令用于启动一个具备NPU加速能力的Docker容器,通过--privileged和--device参数授权访问华为昇腾NPU设备(如davinci0~7、manager等),挂载驱动、工具及配置文件,并映射宿主机目录至容器内,适用于AI推理或训练场景。
👉 立即挑战,赢定制周边:https://gitcode.com/cann/cann-learning-hub/issues/730。📅 活动时间:9月9日至10月9日 24:00。
参考资料:部署DeepSeek-V3、R1模型浮点权重至少需要4台Atlas 800I A2(8x64G)服务器,W8A8量化权重至少需要2台Atlas 800I A2(8x64G服务器)上述方法可将deepseek量化为W8A8或者W8A16模型。
实用工具包MindCluster ToolBox中包括Ascend DMI工具、日志收集工具和Ascend Cert工具。Ascend DMI工具主要为Atlas产品的标卡、板卡及模组类产品提供带宽测试、算力测试、功耗测试等功能。日志收集工具主要在故障分析定位时收集运行环境信息、昇腾NPU健康信息、昇腾软件日志、Device的系统级日志和MindEdge、MindSDK日志。
AI变革正酣,之江潮水奔流。当宇树Unitree机器人火热出圈、DeepSeek/Qwen等大模型获得全球广泛关注、群核科技的空间智能影响多个行业……浙江,这片“敢为天下先”的土地,在人工智能产业又一次勇立潮头。数据显示,2024年浙江省人工智能核心产业营业收入接近5800亿元,增长势头强劲。浙江最新《关于支持人工智能创新发展的若干措施》(以下简称《若干措施》)更提出,到2027年,初步形成可持续
从人工智能技术、政策在福建落地生根,到人工智能普惠算力建设,再到现在基于昇腾 AI 创新应用在福建各地开花,本次探营活动见证了福建在人工智能发展进程。
开源贡献这件事的门槛,从来都不在技术深度,看文档、逛论坛、加群潜水,这些动作对开发者来说都不难。难的是真正动手那一刻而流程经验,恰恰是最没法靠「看」学会的——你必须。能不能把「贡献 CANN」这件事,从一句口号,变成一次当场上手的实操?——于是,有了这场工坊。
本周摘要CANN代码仓上新:cannbotCANN技术活动:CANN NEXT系列开播CANN 社区进展直达开源社区:https://gitcode.com/cannCANN 上新。
HiF8不只是节省带宽,而是通过QKPV全量化、紧凑数据表示、Scale复用以及访存/计算流水重构,进一步缓解了原有SparseMLA中明显的Scalar Bound。,HiF8 在权重、激活和KV Cache上均表现出较好的数值保真度,主要Benchmark与高精度基线基本持平;,通过RmsNorm+Quant、Rotary+Quant等融合,将中间结果尽可能留在片上,减少完整Tensor写回和
MoE Dispatch,也就是把 token 送给不同专家的过程,则改成一个 token 只读取、只量化一次,再发给多个专家,分发延迟下降 25% 到 30%,端到端最多改善约 5%。除了已经上线的模型权重、基础推理代码和技术报告,Ascend Tribe 当前还能看到 ascend-training-system、openPangu-2.0-Infer、openPangu-2.0-Op、asc
低比特量化是降低大语言模型推理成本和资源需求的重要手段。随着部署场景对显存占用、带宽压力和计算效率提出更高要求,量化研究正逐渐从 8-bit 进一步推进到 4-bit。HiFloat4(HiF4)是昇腾自研的一种 4-bit 数值格式,通过三级缩放机制显著扩展了低精度数值的动态范围,使其更适配大模型权重和激活中常见的动态范围分布。将高精度权重直接转化为 4 比特格式通常会带来量化误差。因此,量化校
下面这张图可以支撑:HiF8和MXFP8在KV cache上均能保持较高量化保真度,KV cache不是HiF8相比MXFP8的主要精度风险来源,在KV cache SQNR上,未观察到HiF8相比 MXFP8的系统性退化,两种格式整体稳定在相近水平。该结果表明,HiF8在KV cache量化中未引入额外的小值置零风险,并可能相比MXFP8更好地保留低幅值cache信息,HiF8在KV cache
大模型量化是推理优化的关键能力之一。通过降低权重和激活的数值精度,量化可以减少模型存储、显存占用和计算开销,是大模型在实际业务中高效部署的重要手段。AMCT 是 CANN 社区提供的模型压缩与量化工具,面向昇腾 AI 处理器支持 LLM 模型高效量化,覆盖 BF16 基线评估、PTQ 离线数据提取、PTQ 参数训练、fake quant 精度评估等典型流程。本文与配套使用,提供一份可参考、可跑通的
本文介绍了在Ascend 910PremiumA NPU环境下对DeepSeek-R1-Distill-Qwen-32B模型进行8位量化(W8A8)的过程。操作步骤包括执行量化命令,处理量化后文件(约41GB),以及解决两个关键报错:1) 需要在config.json中添加"quantize": "w8a8"参数;2) 需将quant_model_descr
本文详细解析了昇腾卡在Megatron-LM框架下训练时grad_norm出现NaN的问题,提供了从硬件检查到数据验证、参数映射及钩子函数追踪的完整解决方案。通过系统化排查方法,帮助开发者精准定位问题模块,有效解决模型训练中的数值不稳定问题。
本文详细解析在Atlas200DK开发板上运行摄像头物体检测样例时遇到的ATC模型转换卡死和Swap空间不足问题,提供华为昇腾平台的实战解决方案。通过配置交换文件、优化ATC参数和调整系统内存管理,帮助开发者高效完成AI模型部署,特别适用于边缘计算场景下的资源优化。
昇腾
——昇腾
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net