logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

国产GPU/AI算力芯片现状(修订完整版 · 截至2026年9月

截至2026年9月,国产GPU/AI算力芯片实现规模化出货,国产加速卡出货占比突破41%,预计2026年将超50%。华为昇腾凭借全国性渠道与公开招标订单,居市场化销售首位;海光DCU业绩稳健、信创与互联网双轮驱动,盈利确定性强;寒武纪全面对外销售且已扭亏,但客户集中度仍高;昆仑芯外部订单快速增长,但需区分自用与投资人绑定订单。摩尔线程、沐曦等“四小龙”均已上市,完成从试点到规模出货跃迁,仍处亏损阶

#算法#人工智能
国产GPU/AI算力芯片现状(修订完整版 · 截至2026年9月

截至2026年9月,国产GPU/AI算力芯片实现规模化出货,国产加速卡出货占比突破41%,预计2026年将超50%。华为昇腾凭借全国性渠道与公开招标订单,居市场化销售首位;海光DCU业绩稳健、信创与互联网双轮驱动,盈利确定性强;寒武纪全面对外销售且已扭亏,但客户集中度仍高;昆仑芯外部订单快速增长,但需区分自用与投资人绑定订单。摩尔线程、沐曦等“四小龙”均已上市,完成从试点到规模出货跃迁,仍处亏损阶

#算法#人工智能
Ubuntu 版的 CANN 9.2.0-beta.1 的下载方式 三大云厂商的服务器系统

CANN 9.2.0-beta.1 虽在官网离线安装页面未显式列出 Ubuntu,但可通过在线安装(APT源)或Docker容器镜像获取。推荐路径:使用 apt-get 安装官方 APT 源,或拉取 swr.cn-south-1.myhuaweicloud.com/ascendhub/cann:9.2.0-beta.1-950-ubuntu22.04-py3.12 等容器镜像。生产环境建议优先选用

#人工智能#华为
ATK(华为算子测试平台)详细介绍 CANN(Compute Architecture for Neural Networks,神经网络计算架构

ATK 是一款轻量、易上手、可扩展的算子测试框架,核心价值在于把"构造用例 → 跑 NPU/CPU 对比 → 出报告"这条原本繁琐的链路标准化、自动化了。无论是自研算子的功能验证,还是官方算子的大规模精度回归,都能通过几条简单命令完成闭环,并且借助插件机制可以灵活适配各种自定义约束和比对逻辑。对于昇腾算子开发者而言,它是 CANN + MindStudio 工具链中"测试验证"环节的重要补充。

#人工智能#华为
ATK(华为算子测试平台)详细介绍 CANN(Compute Architecture for Neural Networks,神经网络计算架构

ATK 是一款轻量、易上手、可扩展的算子测试框架,核心价值在于把"构造用例 → 跑 NPU/CPU 对比 → 出报告"这条原本繁琐的链路标准化、自动化了。无论是自研算子的功能验证,还是官方算子的大规模精度回归,都能通过几条简单命令完成闭环,并且借助插件机制可以灵活适配各种自定义约束和比对逻辑。对于昇腾算子开发者而言,它是 CANN + MindStudio 工具链中"测试验证"环节的重要补充。

#人工智能#华为
昇腾 950PR/950DT 新增regbase 编程方式和MemBase SIMD/SIMT 混合编程模型

REGBASE 是昇腾 950PR/950DT 新增的寄存器级矢量编程模型,通过 __simd_vf__ 函数与 AscendC::Reg API 直接操作 SIMD Register File(VF Reg),将连续矢量计算全程保留在寄存器中,仅在入口和出口与 Unified Buffer(UB)交互一次,突破 MemBase 模型中中间结果反复落 UB 的性能瓶颈。该模型显著降低带宽压力与 B

#人工智能#华为
昇腾 950PR/950DT 新增regbase 编程方式和MemBase SIMD/SIMT 混合编程模型

REGBASE 是昇腾 950PR/950DT 新增的寄存器级矢量编程模型,通过 __simd_vf__ 函数与 AscendC::Reg API 直接操作 SIMD Register File(VF Reg),将连续矢量计算全程保留在寄存器中,仅在入口和出口与 Unified Buffer(UB)交互一次,突破 MemBase 模型中中间结果反复落 UB 的性能瓶颈。该模型显著降低带宽压力与 B

#人工智能#华为
cann ascendc 算子常驻 ub 的skill 还有 突破scalar墙的skill 下 gitcode.com/cann/cannbot-skills

两个都有。仓库里既有处理 UB 常驻(状态 buffer 跨循环驻留)的 Skill,也有专门解决 ScalarBound(Scalar 墙)的 Skill。

#人工智能#华为
华为 cann ascend npu 算子a 生成的数据 给 b,c,d 用

在Ascend 950架构下,算子A生成的数据若需被B/C/D跨核使用,因UB为物理隔离的私有SRAM(单核仅248KB),无法直接共享。数据必须通过MTE3指令写入全局显存(GM),再由其他核通过__gm__指针读取。跨核同步依赖SetFlag/WaitFlag机制保障顺序。因此,跨核复用依赖GM中转,不可绕过。

#算法#人工智能
cann 华为npu 算子开发直接访问L2高速缓存 的可行性分析

当前CANN不支持将L2作为可寻址的scratchpad(如__l2buf__),因编译器未提供对应地址空间限定符,且硬件指令集无直接支持,asc-devkit无法单独实现。但昇腾950已开放L2可控缓存功能,通过Cache Hint、Lock及预取机制实现算子级控制,相关接口(如SetL2CacheHint)已在asc-devkit中封装。因此,“L2直访”若指缓存管理,改asc-devkit可

#人工智能
    共 899 条
  • 1
  • 2
  • 3
  • 90
  • 请选择