登录社区云,与社区用户共同成长
邀请您加入社区
本文探讨了大模型时代GPU计算的不同技术层次,以PyTorch矩阵乘法为例,揭示了从高层代码到底层GPU执行的复杂优化过程。重点分析了深度学习编译器的必要性,详细解读了TVM的架构设计及其核心思想——计算与调度分离,深入阐述了Tiling技术的重要性及其与GPU内存层次的关系。文章对比了TVM和Triton两种不同的编程范式,指出TVM虽然强大但编程模型复杂,而Triton提供了更符合Kernel
混合专家(MoE)模型正成为超大规模语言模型的核心架构,但其动态路由带来的kernel启动抖动、显存碎片和调试困难,严重制约推理性能与工程落地。DeepSeek-V4提出“Trace + Tile”双范式:通过计算图迹化(trace moe)将路由决策固化为确定性CUDA Graph子图,结合领域专用语言TileLang实现显存的声明式瓷砖化划分,从编译期消除运行时不确定性。该方案在A100/H1