AI Infra 学习路线与资料清单

一、什么是 AI Infra?

AI Infra(AI 基础设施)的目标是:让几十亿参数的模型在数千张 GPU 上跑得又快、又稳、又省钱。它主要解决两大问题:

  • 训练 Infra:如何把超大模型切分到海量 GPU 上,并高效通信,把训练时间从几个月缩短到几天。
  • 推理 Infra:如何在用户请求到来时,以极低延迟和成本,快速给出结果。

学习 AI Infra,本质上是成为懂算法、懂系统、懂硬件的工程型人才。


二、先导基础(2~3 个月)

1. 计算机系统

  • 书:《深入理解计算机系统》(CSAPP)
    • 重点章节:存储器层次结构(第6章)、并发编程(第12章)
    • 目的:理解缓存、内存带宽、并行优化基础

2. 分布式系统基础

  • 书:《数据密集型应用系统设计》(DDIA)
    • 重点章节:复制(5)、分区(6)、分布式问题(8)、一致性与共识(9)
    • 目的:为分布式训练/推理服务打理论基础

3. GPU 编程入门

  • 文档:《CUDA C++ Programming Guide》(NVIDIA 官方)
    • 通读前 5 章,理解线程层次、内存模型、核函数
  • 书:《CUDA C编程权威指南》(Professional CUDA C Programming)
    • 系统学习 GPU 优化,配合 Nsight 工具进行性能分析

三、核心技能一:GPU 编程与性能调优

实战项目

  1. 用 CUDA C/C++ 写高性能矩阵乘法(GEMM),比较不同内存布局和 tile 大小的性能
  2. 用 Nsight Systems/Compute 分析 kernel,学会读占用率、带宽利用率

前沿 Kernel 语言

  • 文档:OpenAI Triton Language 官方教程
    • 重点:跟着教程手写 FlashAttention kernel,理解 IO 感知优化

四、核心技能二:分布式训练系统

必读论文(按顺序)

  1. PyTorch 官方教程Getting Started with Distributed Data Parallel
  2. ZeRO 论文(微软 DeepSpeed):ZeRO: Memory Optimizations Toward Training Trillion Parameter Models —— 基石论文
  3. Megatron-LM 论文(英伟达):理解张量并行(TP)、流水线并行(PP)

核心代码库(必须跑通并读源码)

  • DeepSpeed:clone 仓库,用 examples 跑通 HuggingFace 模型训练,重点读 ZeRO 部分源码
  • PyTorch FSDP:对比 DeepSpeed ZeRO,理解 PyTorch 原生方案

五、核心技能三:模型推理与部署

主力推理框架(主攻 vLLM)

  • 项目:vLLM (github.com/vllm-project/vllm)
    • 先读完官方博客:How continuous batching enables 23x throughputPagedAttention
    • 深入源码重点模块:Scheduler(连续批处理)、BlockManager(PagedAttention 显存管理)

NVIDIA 推理生态

  • TensorRT-LLM:跟着官方 examples 把 Llama/GPT 构建为 TensorRT Engine
  • Triton Inference Server:将 vLLM 或 TRT-LLM 包装为标准 API 服务,配置动态批处理和并发

补充课程

  • NVIDIA 免费课程:《深度学习推理 (Deep Learning Inference)》

六、前沿高地:AI 编译器

编译器框架

  • Apache TVM 官方教程:跟着一步步实现计算图优化与调度
  • 书:《MLIR 入门与实践》(中文):了解底层编译器基础设施

必读论文

  • FlashAttention 论文 + 用 Triton 手写简易版,这是算法与系统协同设计的典范

七、工程底座:集群、网络与存储

  • 网络:阅读 NVIDIA NCCL 文档,理解 AllReduce 等集合通信算法;了解 RDMA/RoCE 原理
  • 调度:学习 Kubernetes + Volcano,跑通 GPU 作业队列和 Gang Scheduling
  • 存储:了解 JuiceFS、Alluxio 等云原生数据加速方案,理解缓存预热和元数据加速

八、三个月启动计划(建议)

时间 任务
第 1 周 配置 CUDA 环境,跟着 Triton 教程写第一个融合 Kernel
第 2~4 周 用 DeepSpeed examples 跑通 GPT-2 训练,切换 ZeRO-1/2/3 观察显存变化
第 5~8 周 拉取 vLLM,本地部署 Llama-7B,用 benchmark_serving.py 压测,尝试 FP16/INT8 量化
第 9 周+ 深入某一个方向(训练加速/推理优化/编译器),复现论文或参与开源项目

九、持续进阶

  • 关注顶级公司技术博客:NVIDIA Developer Blog、PyTorch Medium、ColossalAI 博客
  • 跟进顶会论文:MLSys、OSDI、SOSP、ASPLOS
  • 动手复现、部署、调优:跑过的代码、复现过的论文、调过的性能,是这个方向最硬的通货
Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐