AI Infra 学习路线与资料清单
·
AI Infra 学习路线与资料清单
一、什么是 AI Infra?
AI Infra(AI 基础设施)的目标是:让几十亿参数的模型在数千张 GPU 上跑得又快、又稳、又省钱。它主要解决两大问题:
- 训练 Infra:如何把超大模型切分到海量 GPU 上,并高效通信,把训练时间从几个月缩短到几天。
- 推理 Infra:如何在用户请求到来时,以极低延迟和成本,快速给出结果。
学习 AI Infra,本质上是成为懂算法、懂系统、懂硬件的工程型人才。
二、先导基础(2~3 个月)
1. 计算机系统
- 书:《深入理解计算机系统》(CSAPP)
- 重点章节:存储器层次结构(第6章)、并发编程(第12章)
- 目的:理解缓存、内存带宽、并行优化基础
2. 分布式系统基础
- 书:《数据密集型应用系统设计》(DDIA)
- 重点章节:复制(5)、分区(6)、分布式问题(8)、一致性与共识(9)
- 目的:为分布式训练/推理服务打理论基础
3. GPU 编程入门
- 文档:《CUDA C++ Programming Guide》(NVIDIA 官方)
- 通读前 5 章,理解线程层次、内存模型、核函数
- 书:《CUDA C编程权威指南》(Professional CUDA C Programming)
- 系统学习 GPU 优化,配合 Nsight 工具进行性能分析
三、核心技能一:GPU 编程与性能调优
实战项目
- 用 CUDA C/C++ 写高性能矩阵乘法(GEMM),比较不同内存布局和 tile 大小的性能
- 用 Nsight Systems/Compute 分析 kernel,学会读占用率、带宽利用率
前沿 Kernel 语言
- 文档:OpenAI Triton Language 官方教程
- 重点:跟着教程手写 FlashAttention kernel,理解 IO 感知优化
四、核心技能二:分布式训练系统
必读论文(按顺序)
- PyTorch 官方教程:
Getting Started with Distributed Data Parallel - ZeRO 论文(微软 DeepSpeed):
ZeRO: Memory Optimizations Toward Training Trillion Parameter Models—— 基石论文 - Megatron-LM 论文(英伟达):理解张量并行(TP)、流水线并行(PP)
核心代码库(必须跑通并读源码)
- DeepSpeed:clone 仓库,用 examples 跑通 HuggingFace 模型训练,重点读 ZeRO 部分源码
- PyTorch FSDP:对比 DeepSpeed ZeRO,理解 PyTorch 原生方案
五、核心技能三:模型推理与部署
主力推理框架(主攻 vLLM)
- 项目:vLLM (github.com/vllm-project/vllm)
- 先读完官方博客:
How continuous batching enables 23x throughput和PagedAttention - 深入源码重点模块:Scheduler(连续批处理)、BlockManager(PagedAttention 显存管理)
- 先读完官方博客:
NVIDIA 推理生态
- TensorRT-LLM:跟着官方 examples 把 Llama/GPT 构建为 TensorRT Engine
- Triton Inference Server:将 vLLM 或 TRT-LLM 包装为标准 API 服务,配置动态批处理和并发
补充课程
- NVIDIA 免费课程:《深度学习推理 (Deep Learning Inference)》
六、前沿高地:AI 编译器
编译器框架
- Apache TVM 官方教程:跟着一步步实现计算图优化与调度
- 书:《MLIR 入门与实践》(中文):了解底层编译器基础设施
必读论文
- FlashAttention 论文 + 用 Triton 手写简易版,这是算法与系统协同设计的典范
七、工程底座:集群、网络与存储
- 网络:阅读 NVIDIA NCCL 文档,理解 AllReduce 等集合通信算法;了解 RDMA/RoCE 原理
- 调度:学习 Kubernetes + Volcano,跑通 GPU 作业队列和 Gang Scheduling
- 存储:了解 JuiceFS、Alluxio 等云原生数据加速方案,理解缓存预热和元数据加速
八、三个月启动计划(建议)
| 时间 | 任务 |
|---|---|
| 第 1 周 | 配置 CUDA 环境,跟着 Triton 教程写第一个融合 Kernel |
| 第 2~4 周 | 用 DeepSpeed examples 跑通 GPT-2 训练,切换 ZeRO-1/2/3 观察显存变化 |
| 第 5~8 周 | 拉取 vLLM,本地部署 Llama-7B,用 benchmark_serving.py 压测,尝试 FP16/INT8 量化 |
| 第 9 周+ | 深入某一个方向(训练加速/推理优化/编译器),复现论文或参与开源项目 |
九、持续进阶
- 关注顶级公司技术博客:NVIDIA Developer Blog、PyTorch Medium、ColossalAI 博客
- 跟进顶会论文:MLSys、OSDI、SOSP、ASPLOS
- 动手复现、部署、调优:跑过的代码、复现过的论文、调过的性能,是这个方向最硬的通货
更多推荐




所有评论(0)