logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

ascend-transformer-boost:昇腾上跑大模型推理,这个加速库到底加速了什么

摘要:ATB(Ascend Transformer Boost)是昇腾官方推出的大模型推理加速库,专注于Transformer类模型的算子层优化。它通过算子融合、内存优化和并行调度三大技术提升推理性能,支持主流大语言模型如Llama、Qwen等。ATB并非通用推理框架,而是基于CANN底层算子能力的高层封装,适合批量推理场景。使用时需注意模型格式转换、参数配置等关键点,并了解其适用边界。该库将复杂

文章图片
#transformer#深度学习#人工智能
ops-nn:昇腾 NPU 上的神经网络算子库,你每天都在用它

昇腾NPU上的神经网络算子库ops-nn是CANN生态的核心基础组件,提供matmul、activation、softmax等高频基础算子。作为AOL算子库中最核心的部分,ops-nn支撑着PyTorch等框架在昇腾上的运行。其特点包括:1)提供矩阵运算、激活函数、归一化等基础算子;2)包含融合算子提升性能;3)底层依赖catlass的GEMM模板实现。虽然用户通常通过框架间接调用,但了解ops-

文章图片
#神经网络#人工智能#深度学习
ops-nn:昇腾 NPU 上的神经网络算子库,你每天都在用它

昇腾NPU上的神经网络算子库ops-nn是CANN生态的核心基础组件,提供matmul、activation、softmax等高频基础算子。作为AOL算子库中最核心的部分,ops-nn支撑着PyTorch等框架在昇腾上的运行。其特点包括:1)提供矩阵运算、激活函数、归一化等基础算子;2)包含融合算子提升性能;3)底层依赖catlass的GEMM模板实现。虽然用户通常通过框架间接调用,但了解ops-

文章图片
#神经网络#人工智能#深度学习
catlass:昇腾算子开发者的“模板库“,和 NVIDIA 的 CUTLASS 是什么关系

昇腾NPU算子开发利器catlass解析:降低高性能算子开发门槛的模板库。catlass是昇腾官方推出的算子模板库,针对Ascend C编程模型和达芬奇架构优化,提供GEMM、卷积等核心算子的高性能实现模板。开发者无需手动处理tiling、SRAM管理等底层细节,通过配置模板参数即可快速生成优化算子。与NVIDIA的CUTLASS类似但实现不同,catlass显著提升开发效率,将原本需要数周的开发

文章图片
#人工智能#深度学习#transformer
catlass:昇腾算子开发者的“模板库“,和 NVIDIA 的 CUTLASS 是什么关系

昇腾NPU算子开发利器catlass解析:降低高性能算子开发门槛的模板库。catlass是昇腾官方推出的算子模板库,针对Ascend C编程模型和达芬奇架构优化,提供GEMM、卷积等核心算子的高性能实现模板。开发者无需手动处理tiling、SRAM管理等底层细节,通过配置模板参数即可快速生成优化算子。与NVIDIA的CUTLASS类似但实现不同,catlass显著提升开发效率,将原本需要数周的开发

文章图片
#人工智能#深度学习#transformer
catlass:昇腾算子开发者的“模板库“,和 NVIDIA 的 CUTLASS 是什么关系

昇腾NPU算子开发利器catlass解析:降低高性能算子开发门槛的模板库。catlass是昇腾官方推出的算子模板库,针对Ascend C编程模型和达芬奇架构优化,提供GEMM、卷积等核心算子的高性能实现模板。开发者无需手动处理tiling、SRAM管理等底层细节,通过配置模板参数即可快速生成优化算子。与NVIDIA的CUTLASS类似但实现不同,catlass显著提升开发效率,将原本需要数周的开发

文章图片
#人工智能#深度学习#transformer
ascend-transformer-boost:昇腾上跑大模型推理,这个加速库到底加速了什么

摘要:ATB(Ascend Transformer Boost)是昇腾官方推出的大模型推理加速库,专注于Transformer类模型的算子层优化。它通过算子融合、内存优化和并行调度三大技术提升推理性能,支持主流大语言模型如Llama、Qwen等。ATB并非通用推理框架,而是基于CANN底层算子能力的高层封装,适合批量推理场景。使用时需注意模型格式转换、参数配置等关键点,并了解其适用边界。该库将复杂

文章图片
#transformer#深度学习#人工智能
ascend-transformer-boost:昇腾上跑大模型推理,这个加速库到底加速了什么

摘要:ATB(Ascend Transformer Boost)是昇腾官方推出的大模型推理加速库,专注于Transformer类模型的算子层优化。它通过算子融合、内存优化和并行调度三大技术提升推理性能,支持主流大语言模型如Llama、Qwen等。ATB并非通用推理框架,而是基于CANN底层算子能力的高层封装,适合批量推理场景。使用时需注意模型格式转换、参数配置等关键点,并了解其适用边界。该库将复杂

文章图片
#transformer#深度学习#人工智能
ascend-transformer-boost:昇腾上跑大模型推理,这个加速库到底加速了什么

摘要:ATB(Ascend Transformer Boost)是昇腾官方推出的大模型推理加速库,专注于Transformer类模型的算子层优化。它通过算子融合、内存优化和并行调度三大技术提升推理性能,支持主流大语言模型如Llama、Qwen等。ATB并非通用推理框架,而是基于CANN底层算子能力的高层封装,适合批量推理场景。使用时需注意模型格式转换、参数配置等关键点,并了解其适用边界。该库将复杂

文章图片
#transformer#深度学习#人工智能
hixl:PD 分离背后的单边通信库,到底是个什么东西

本文介绍了昇腾NPU通信库hixl在PD分离架构中的关键作用。hixl是一种单边通信库,与需要同步的hccl/hcomm不同,它允许发送方独立完成数据传输,接收方无需实时配合。这一特性使其特别适合LLM推理中的Prefill-Decode分离场景,可异步传输大容量KV Cache数据。文章还分析了hixl的零拷贝机制如何通过共享内存实现高效传输,并比较了hixl与shmem等其他通信组件的关系。最

文章图片
#人工智能
    共 11 条
  • 1
  • 2
  • 请选择