登录社区云,与社区用户共同成长
邀请您加入社区
大模型推理中GPU利用率低的系统瓶颈分析 本文从系统架构角度深入分析了大模型推理中GPU利用率低的本质原因。主要内容包括: GPU利用率的真实含义:反映SM忙碌程度而非工作时间占比 训练与推理的本质差异:推理面临小Batch、动态请求导致计算不连续 Decode阶段的瓶颈:Token逐个生成形成超小矩阵,GPU"吃不饱" Memory带宽限制:权重和KV Cache读取时间常超过计算时间 KV C
近日,北京大学EvoPhys团队推出以“人”为中心、面向“场景级万物可控”的5D世界模型 EvoPhys-World。这一前沿研究成果,在斯坦福大学WorldScore公开评测榜单中,荣登“世界生成(World Generation)”赛道第一名。而EvoPhys的原生训练全程都在摩尔线程MTT S5000全功能GPU上完成,并由MUSA软件栈提供全栈支撑。
5月19日,AMD公司宣布,其在上海举办的AMD AI开发者大会 (AMD AI DevDay 2026) 吸引了超过两千名开发者到场参加,这是这一面向AI 开发者的AMD技术盛会首次登陆中国。AMD董事会主席及首席执行官苏姿丰博士(Dr. Lisa Su)为大会发表主旨演讲。
通过与SGLang、TileLang、Triton、Mooncake等开源社区的紧密协作,摩尔线程不仅推动了MUSA平台与主流AI框架的深度适配,更以实际行动赋能开发者,持续助力国产算力与全球开源生态的深度融合,加速AI应用的创新与落地。
近日,摩尔线程与光轮智能达成战略合作。双方将依托摩尔线程全功能GPU与夸娥(KUAE)智算集群,结合光轮智能“求解—测量—生成”三位一体全栈自研仿真平台,联合打造高置信度仿真数据合成方案,以国产算力与仿真算法的深度融合,为具身智能发展夯实自主可控的基础设施。
4月24日,由智源研究院牵头研发的众智FlagOS第一时间对DeepSeek-V4-Pro 1.6T 旗舰模型(1.86万亿参数)及DeepSeek-V4-Flash 284B 高效模型(2840亿)两个“巨无霸”模型进行全量适配,已经完成 DeepSeek-V4-Flash在 8款以上 AI 芯片上的全量适配与推理部署。
近日,摩尔线程基于旗舰级AI训推一体全功能GPU智算卡MTT S5000,完整适配了FlagOS训练全要素软件栈——包括FlagScale系统调度决策框架、Megatron-LM分布式训练框架、Transformer Engine加速库、FlagGems与Triton算子库,以及FlagCX通信库。
2025年12月5日,摩尔线程(股票代码:688795.SH)正式在上海证券交易所科创板挂牌上市,成为中国首家登陆资本市场的全功能GPU企业。
10 月 28 日,NVIDIA宣布,xAI的Colossus 超级计算机集群达到了 10 万颗 NVIDIA® HopperGPU的巨大规模。该集群使用了 NVIDIA Spectrum-X™ 以太网网络平台,该平台是专为多租户、超大规模的 AI 工厂提供卓越性能而设计的RDMA(Remote Direct Memory Access)网络。