登录社区云,与社区用户共同成长
邀请您加入社区
是面向生命科学领域、负责建设昇腾原生算子库的开源兴趣小组,算子仓为bio-ops-molecule。SIG聚焦多组学数据处理、生物分子模拟和生物基础模型训练等场景,通过高性能行业算子解决计算效率、显存占用和数据访存等底层性能瓶颈。面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!CANN社区新开发者首
B站直播预约:点击预约
【代码】AMCT structured pruning: MoE expert selection, method and measurement。
需要注意的是,FLOPs会独立于数值精度统计multiply-accumulate operations:它反映的是token剪枝带来的FLOPs降低,但并不能体现HiF8带来的收益,例如低比特宽度带来的memory和bandwidth节省,以及低比特矩阵计算单元上的更高吞吐。因此,它能够在不依赖细粒度per-token / per-block scale的情况下,同时兼顾宽动态范围和高精度表示,
AI Studio则为同算力级别的算力盒,通过Type-C(USB4)接口连接台式机或笔记本使用,深度适配DeepSeek-R1蒸馏模型,支持本地离线部署,适合已有主机的用户扩展AI推理能力。对于依赖特定CUDA生态的项目,迁移成本需要纳入考量。总体而言,香橙派这一系列产品的价值在于提供了覆盖多场景的国产化AI算力硬件选择,特别是在边缘部署需求上升和AI应用多样化的背景下,为开发者提供了从原型到部
💡提示:本场直播为外籍讲师全程英文分享,配有双语字幕,内容具有一定技术门槛,欢迎感兴趣的开发者观看。
📅 活动时间: 8月19日至8月26日。
B站预约链接:点击预约
点击参与CANN开源开发者满意度有奖调研
摘要: CubeStudio是一款国产开源AI平台,支持传统机器学习、深度学习与大模型全流程,适配昇腾、寒武纪等国产算力及x86/ARM架构,提供多租户管理、分布式训练、大模型微调、推理服务等功能。平台标准化国产算力接入流程,覆盖驱动安装、容器运行时、K8s插件等八步操作,并支持ARM64部署。针对信创需求,提供昇腾、海光等七家国产卡的落地文档,支持异构算力统一调度。开源免费商用,已服务数千家企业
PyPTO Professional 的赌注是:算子开发者应该把时间花在「切多大的块、开几级流水、Buffer 怎么摆」上,而不是花在「这个 offset 算对了吗、这个 event id 配对了吗」上。前者是创造性的、决定性能上限的工作;后者是机械的、只决定你今晚能不能下班的工作。PyPTO Professional 把后者全部接管,同时一寸不让地把前者留给你——因为想摸到理论峰值 0.9x 以
在 AI 大模型时代,模型部署时会遇到容量压力、带宽与吞吐压力和工程适配压力。同时,本可以收敛成一条工具链的工作被分散在各个流程中,进而导致在适配不同模型时做重复工作。如何低成本的部署模型,如何把模型量化收敛成一条统一的工作流,是这个时代需要解决的问题。AMCT-LLM 是一款面向大语言模型低比特量化的模型压缩工具,将模型适配、精度评估、量化优化与部署导出收敛为统一工作流。
本文详细介绍了CodeLlama在昇腾生态中的工业级部署实践,涵盖环境标准化、容器化部署、自动化测试、服务化架构及持续优化等关键环节。通过昇腾平台的高效开发工具链和标准化配置,帮助MLOps工程师实现从原型到生产系统的平滑过渡,提升AI模型部署的可靠性和性能。
本文揭秘了在昇腾NPU上部署Llama-2-7B大模型的五大非常规优化策略,包括张量内存布局重组、混合精度调度、NPU缓存预热等技巧,显著提升推理速度30%以上。这些隐藏技巧通过硬件特性深度优化,为开发者提供了超越官方文档的性能提升方案。
本文详细介绍了Qwen1.5-MoE在昇腾NPU上的工业化部署路线图,涵盖从容器化封装到集群调优的全流程关键节点。通过动态批处理、计算碎片整理和负载均衡设计等技术,显著提升模型在生产环境中的性能和效率,适用于云端部署和本地数据中心场景。
本文详细介绍了在昇腾NPU上部署Llama-2-7B大模型的实战指南,包括环境准备、模型加载、核心代码优化、性能调优及异常处理等关键步骤。特别提供了GitCode免费资源,帮助开发者避开常见陷阱,实现高效部署和性能提升。
本文详细介绍了昇腾MindIE多机集群自动化部署工具在Deepseek R1/V3推理环境中的实战应用。通过全链路自动化和智能环境检测技术,用户可在5分钟内完成复杂集群部署,显著提升效率。文章还提供了环境准备、配置文件解析、性能调优等实用技巧,帮助开发者快速掌握这一高效部署方案。
本文详细解析了在昇腾硬件上使用MindIE 1.0.RC2部署Qwen2大模型时遇到的`undefined symbol`错误,提供了系统性排查方法和精准解决方案。通过版本依赖图谱构建、环境隔离和高级调试技巧,帮助开发者解决torch-npu版本匹配问题,确保推理套件稳定运行。
👉 立即挑战,赢定制周边:https://gitcode.com/cann/cann-learning-hub/issues/540。📅 活动时间: 8月12日至8月19日。
无论是每一场演讲结束后的问答环节,还是茶歇时间与最后的自由交流时段,现场的交流都格外踊跃:有人关心 Agent 优化工作流在全新架构模型上能否稳定复现,有人追问 KDA 算子的矩阵求逆如何在 Cube 上高效实现、PyPTO 底层是否生成 Ascend C 代码,也有人围绕 DSpark 多流并行是否带来 Cube 抢占、Longcat 2.0 是否做了 KV Cache offload 等工程细
CANN 全面开源开放,致力于为开发者构建统一、高效的算力使能平台,助力 AI 应用创新与加速落地。为进一步促进区域开发者交流、共建 CANN 生态,CANN 开源社区联合 AtomGit 正式发起「CANN 开发者 Meetup」南京站。
2026年8月3日,MiniMax新一代多模态生成模型MiniMax H3正式开源,在Artificial Analysis视频模型榜单中,视频编辑能力排名全球第一。作为MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索,H3不再以图片、视频、声音的生成、编辑和参考等单一任务为边界,而是在多模态上下文中统一理解创作意图,完成更加自然、连贯的生成与表达。
本文深入探讨了在昇腾平台上部署Llama2推理服务时遇到的工业级陷阱及解决方案,包括版本兼容性、内存泄漏、容器化权限管理等关键问题。通过vLLM-Ascend实战案例,提供了性能调优、高可用架构设计及SRE运维检查清单,帮助开发者规避常见部署风险,提升推理服务稳定性与效率。
昇腾
——昇腾
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net