
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
昇腾NPU算子优化解密:突破大模型性能瓶颈 在大模型部署中,昇腾NPU的性能表现不仅取决于硬件算力,更关键的是算子执行效率。达芬奇架构采用计算与存储分离设计,包含Cube Unit、Vector Unit和Unified Buffer(UB)三大核心组件。未优化时,数据在HBM和UB间频繁搬运导致计算单元"饥饿"。 CANN软件栈通过三大技术破解这一困境: 算子融合:将多个小算

本文详细介绍了在华为昇腾AI平台上部署Llama大模型的完整流程。首先阐述了昇腾平台作为国产化AI解决方案的优势,然后分步骤指导环境配置:包括云端免费算力资源申请(无需物理硬件)和自有硬件部署方案(推荐Atlas 300T Pro训练卡)。软件环境搭建部分提供了代码验证NPU可用性,并安装必要的Python依赖包。重点讲解了Llama-3-8B模型的下载方法(通过ModelScope)和转换为昇腾

其中,模型介绍详细说明了该模型的特点、适用场景与核心优势;该仓库的核心内容围绕主流大模型的推理优化展开,全面覆盖当下热门的大语言模型、多模态模型,包括LLaMA系列(LLaMA2-7B、LLaMA2-13B)、ChatGLM系列(ChatGLM3-6B、ChatGLM3-9B)、Qwen系列(Qwen-7B、Qwen-14B)、Stable Diffusion(图文生成模型)、Whisper(语音
算子融合、FlashAttention、Transformer优化、Ascend C在构建基于 Transformer 架构的大语言模型(LLM)应用时,标准的通用算子往往难以压榨出专用硬件(NPU)的极致性能。ops-adv(Advanced Operators)仓库作为 CANN 生态中专注于“高性能融合算子”的核心代码库,其存在的本质是为了解决通用算子在复杂模型结构下的效率瓶颈问题。
集合通信、分布式训练、HCCS、拓扑感知、Ring-AllReduce在万卡集群训练大模型的时代,单卡算力不再是唯一的决胜点,直接决定了集群的线性加速比。hccl(Huawei Collective Communication Library) 仓库作为昇腾 AI 异构计算架构中负责“多机多卡”通信的核心组件,其地位等同于 NVIDIA 生态中的 NCCL。它是连接成千上万个 NPU 的神经网络,
魔珐星云具身智能3D数字人开放平台 - 全球领先的3D具身智能体基础设施用户提问 / 点击数据卡片→ [检索层] Qwen3-Embedding-8B 语义匹配内容库(同源于大屏数据)→ [生成层] Qwen3-VL 流式生成讲解词→ [净化层] optimizeTextForAvatar 去 markdown/emoji→ [表达层] 魔珐星云的端侧渲染 + 流式 speak(isStart/i

几乎每个用手机的人,每天都被推荐算法默默影响着。打开电商,首页排着你可能想买的;点开音乐软件,每日推荐里总有几首对味。这些看似懂你的背后,是一套相当成熟的方法论。这篇文章讲解推荐算法,它有哪些主流的模型思路,训练一个能上线的系统要走过哪些步骤,以及工程落地时几个容易踩的坑。

摘要:作者分享了自己搭建AI面试官的经验,通过Nexent平台整合个人简历、岗位JD、面经等资料创建专属知识库,使用DeepSeek-V3.2模型进行模拟面试。相比通用AI工具,该方案能提供针对性提问和精准反馈,帮助优化回答逻辑与表达。文中详细介绍了知识库构建技巧、模型选择、提示词优化等实用方法,并强调该过程本身就是高效的面试准备方式。这种可复用的AI面试官能显著提升面试准备效率。

本文介绍了如何通过Docker部署MiGPT GUI服务,将小爱音箱接入AI大模型(以阿里云百炼为例),实现更智能的语音交互。方案无需更换硬件,通过中间服务连接现有设备与大模型,支持自定义角色设定、语音合成和远程管理。部署过程包括:1)Docker一键安装;2)配置小米账号和设备信息;3)接入大模型API;4)设置TTS语音服务;5)解决登录验证问题;6)调整人设参数;7)使用cpolar实现远程

摘要 n8n是一款开源、可自托管的低代码自动化工作流工具,支持300+应用集成,适合构建各类自动化流程。本文详细介绍了在Linux服务器通过Docker部署n8n的完整步骤,包括: Docker环境准备与配置 n8n容器部署与基础认证设置 数据目录挂载和时区配置 系统初始化与永久密钥激活 部署完成后,用户可通过浏览器访问n8n的可视化界面,用拖拽节点的方式构建自动化流程,实现数据采集、API调用、








