
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文揭示了目标检测中图像预处理耗时占比高的现象,并提出基于CANN ops-cv的优化方案。原生PyTorch预处理存在串行执行和数据搬运问题,导致43%时间消耗在预处理环节。ops-cv通过算子融合、零拷贝和批量处理等优化手段,将预处理时间从150ms降至30ms,总耗时减少一半。文章详细分析了Resize、Crop、Normalize等操作的优化原理,并给出三行代码即可接入的实践方案。实测显示

TorchAir是PyTorch与昇腾NPU之间的适配层,通过算子映射和格式转换实现模型在NPU上的运行。它不修改PyTorch源码,而是拦截算子调用并转换为AscendCL接口。TorchAir的核心能力包括自动算子映射(一对一、多对一融合、自定义算子)、调用GE图引擎优化计算图,以及高效的内存管理(内存复用率可达67%)。使用时只需简单导入并调用优化接口,即可获得性能提升。但需注意动态shap

你有没有想过一个问题:PyTorch已经有了一套完整的张量操作(torch.cat等),昇腾CANN为啥还要自己搞一套ops-tensor?是重复造轮子,还是真的有必要?第一次接触ops-tensor的时候,也被这个问题困扰过。明明PyTorch的张量操作已经很好用了,为啥还要学一套新的?是昇腾NPU的硬件有特殊要求,还是CANN的架构设计使然?带着这个疑问,翻了一遍ops-tensor的源码,跑

本文介绍了大模型训练中的通信瓶颈问题及解决方案。针对7B参数模型在多卡训练中的显存和通信问题,提出了基于昇腾NPU优化的FSDP(Fully Sharded Data Parallel)分布式训练框架。FSDP通过参数分片、混合精度和计算通信重叠等技术,将7B模型的单卡显存占用从56GB降至8GB,实现接近线性的7倍加速。文章详细解析了FSDP实现原理,提供了7B模型的训练配置代码,并分享了buc

本文对比了华为鸿蒙系统与Electron框架的技术特性与应用场景。鸿蒙作为国产分布式操作系统,采用ArkTS语言和ArkUI框架,具有轻量化、高性能和多端协同优势;而Electron基于Web技术,适合快速开发跨平台桌面应用,但存在内存占用高、包体积大等问题。分析表明,Electron在桌面领域仍具优势,而鸿蒙更适用于移动/IoT场景。未来若鸿蒙推出成熟的桌面版本,可能在高安全需求领域逐步替代El

摘要: 本文探讨鸿蒙PC与Electron应用融合的可能性,分析技术挑战并提出适配方案。鸿蒙PC基于ArkTS/ArkUI框架,支持多窗口、外设连接等桌面功能,而Electron依赖Chromium和Node.js,两者存在运行时环境、API兼容性等差异。适配方案包括:Web层迁移、混合开发模式或构建鸿蒙版Electron运行时。建议开发者解耦UI与逻辑,优先使用鸿蒙原生API,并关注生态演进。尽

通过本文,你已经完成了从环境搭建到第一个AscendCL程序运行的完整旅程。硬件准备(如昇腾AI处理器型号选择)驱动和固件安装指南CANN工具包的安装与配置开发环境验证方法。

华为昇腾AI全栈技术体系基于达芬奇架构处理器,构建了从芯片到应用的完整解决方案。Atlas 200 IDKA2开发板搭载昇腾310B芯片,支持8GB内存和24TOPS算力,适用于边缘AI任务。AscendC编程语言专为AI计算设计,支持多核并行和三级流水线编程。以YOLOv7模型部署为例,展示了模型转换、推理程序开发和性能优化过程。开发建议包括容器化环境配置、性能调优、内存管理等策略。昇腾平台将持

本文介绍了如何通过Flutter的Platform Channel在HarmonyOS应用中调用原生API。主要内容包括: 开发环境准备:需要DevEco Studio 4.0+、Flutter SDK和HarmonyOS 3.1+设备 创建Flutter for HarmonyOS项目结构 MethodChannel通信原理:Dart端调用invokeMethod,原生端注册处理方法 实战演示获

本文介绍了Flutter for Harmony技术方案,它通过适配Flutter引擎使其能在HarmonyOS/OpenHarmony系统上运行。文章对比了原生ArkTS开发与Flutter for Harmony的优势,指出后者可降低学习成本、提高代码复用率。详细讲解了环境搭建步骤,并提供了一个完整的Flutter应用示例,展示如何创建和运行第一个Flutter+Harmony应用。同时也指出








