智算中心网络(AI Infra 网络)系统学习大纲

教材型大纲 · 第一版
适用对象:大二在读、备考专升本、HCIP 数通方向在学,目标为智算中心网络 / 数据中心网络工程师
设计依据:中国信通院《人工智能算力基础设施赋能研究报告(2025年)》、工信部《算力基础设施高质量发展行动计划》、ODCC 系列白皮书、Cisco AI 网络流量报告、NVIDIA NCP-AIN 认证体系、华为 HCIE-DC 认证体系
时间跨度:大二下 ~ 本科毕业(约 3.5 年)


使用说明

  • 本大纲以"教材"体例编写:篇 → 章 → 节 → 知识点,每章包含【学习目标】【正文大纲】【实验与实操】【推荐阅读】【思考题】五个部分。
  • 标记说明:
    • ★★★ 核心章节(必读必练,决定就业竞争力)
    • ★★☆ 重要章节(需掌握,可与并行线穿插)
    • ★☆☆ 了解章节(按时间余量选择性学习)
  • 每章【推荐阅读】映射自总书单(见附录 A),带编号便于回溯。
  • 建议按附录 E 的进度追踪表记录完成情况,每章完成后打勾并写下 3 条要点笔记。

第 0 篇 导论

第 1 章 智算中心网络导论 ★★☆

1.1 学习目标

  • 理解"智算中心网络"的定义、在 AI 基础设施中的位置
  • 掌握产业数据:算力规模、市场规模、政策目标
  • 明确本方向的职业定位与成长路径

1.2 正文大纲

  1. 从数据中心网络到智算中心网络的演进
    • 传统 DC:南北向流量为主,网关在核心
    • 智算 DC:东西向流量爆发,GPU 集群间全互联
  2. 智算网络的技术全景图
    • 计算层:GPU/昇腾 NPU 集群
    • 网络层:RoCE/IB/无损以太,Scale-up + Scale-out
    • 存储层:NVMe-oF 存储网络
    • 调度层:集合通信库(NCCL/RCCL)、集群调度器
  3. 权威数据与政策背景
    • 信通院:2025 年算力规模 788 EFlops,AI 算力市场 190 亿美元
    • 工信部《算力基础设施高质量发展行动计划》:2025 年算力超 300 EFLOPS、智能算力占比 35%
    • 中国移动 GSE 全调度以太网标准发布
  4. 岗位画像与成长路径
    • 智算网络工程师 / 网络架构师 / 网络智能运维工程师
    • 数通 → DC → 智算的三级跳跃

1.3 实验与实操

  • 阅读 ODCC《2025 下一代智算 DC 高速互联网络需求白皮书》并输出 1 页摘要

1.4 推荐阅读

  • 【报告 R1】信通院《人工智能算力基础设施赋能研究报告(2025年)》(免费下载)
  • 【报告 R2】ODCC《2025 下一代智算 DC 高速互联网络需求白皮书》
  • 【书 B1】《计算机网络:自顶向下方法》(第 7 版)第 1 章

1.5 思考题

  1. 为什么智算中心网络被称为"AI 时代的基建"?与 5G 基建有何异同?
  2. 你所在省份的算力政策文件中,对智算网络有哪些表述?

第一篇 网络基础(复习与深化)

本篇用于巩固 HCIP 数通所学,并补齐 DC/智算所需的深层协议认知。已有 HCIP 基础者可快速过,重点是"从配置到原理"的认知升级。

第 2 章 计算机网络原理精要 ★★★

2.1 学习目标

  • 建立从物理层到应用层的完整体系化认知
  • 深刻理解"分组交换、排队、拥塞"三大核心机制
  • 掌握协议分层与封装解封装思维(后续所有章节的基础)

2.2 正文大纲

  1. 网络体系结构
    • OSI 七层与 TCP/IP 四层模型对照
    • 各层 PDU 名称与封装过程
  2. 应用层
    • HTTP/HTTPS、DNS、DHCP 工作原理
    • 常见应用的端口与流量特征
  3. 传输层
    • TCP:三次握手、四次挥手、可靠传输、滑动窗口、拥塞控制(慢启动/拥塞避免/快重传/快恢复)
    • UDP:无连接特性、适用场景(视频、实时通信、RDMA 数据面
  4. 网络层
    • IP 编址与子网划分、CIDR、NAT/NAPT
    • 路由与转发的基本模型(最长前缀匹配、转发表)
    • ICMP 与排障工具
  5. 数据链路层与物理层
    • 以太网帧格式、MAC 地址、VLAN
    • 交换机转发原理(MAC 表、泛洪、学习)
    • 物理层与光互连概念(为智算大带宽铺垫)

2.3 实验与实操

  • Wireshark 抓包分析:TCP 握手、UDP 流、DNS 查询全流程
  • eNSP:三层交换、VLAN 间路由、DHCP 中继综合实验

2.4 推荐阅读

  • 【书 B1】《计算机网络:自顶向下方法》(第 7 版)第 2~6 章
  • 【书 B2】《TCP/IP详解 卷1:协议》(第 2 版)第 1~17 章
  • 【书 B3】《图解TCP/IP》(入门对照)

2.5 思考题

  1. TCP 拥塞控制与 RoCE 无损网络中的 ECN 有何联系?(带着问题进入第 11 章)
  2. 为什么 UDP 更适合 RDMA 而 TCP 不适合?

第 3 章 路由与交换进阶(HCIP 对接篇) ★★★

3.1 学习目标

  • 以"考试 + 原理"双轨完成 HCIP-Datacom 核心内容
  • 深度理解 OSPF/BGP/MPLS 的机制而非仅会配置
  • 为 EVPN、Segment Routing 打底

3.2 正文大纲

  1. 动态路由基础
    • 路由优先级、度量、路由表与 FIB
    • 静态路由与策略路由的适用场景
  2. OSPF 深度
    • 区域设计(骨干区/普通区/特殊区)
    • LSA 类型、SPF 计算、邻居状态机
    • 网络类型与 DR/BDR
  3. BGP 深度
    • 报文与状态机、路径属性(AS_PATH、MED、Local-Pref)
    • 选路原则、路由反射器、联邦
    • IBGP/EBGP、BGP 在 DC 中的角色(为 EVPN 铺垫)
  4. MPLS 基础
    • 标签交换原理、LDP、MPLS VPN 模型
    • 与 Segment Routing 的传承关系
  5. 常见故障排查方法论
    • 分层排查法、抓包对照法、路由追踪法

3.3 实验与实操

  • eNSP 完成 HCIP 全部实验手册(建议 40+ 个实验)
  • 综合项目:多区域 OSPF + 跨域 BGP + MPLS VPN 三网合一

3.4 推荐阅读

  • 【书 B4】《华为HCIP-Datacom路由交换学习指南》
  • 【书 B2】《TCP/IP详解 卷1》第 18~20 章(路由协议补充)
  • 【书 B5】《MPLS和VPN体系结构》(Ivan Pepelnjak)

3.5 思考题

  1. BGP 为什么是 DC 叠加网络(EVPN)的控制面首选?
  2. MPLS 标签转发与 SRv6 分段路由的异同?

第二篇 数据中心网络(DC)

智算网络的"母体"。本篇是数通向智算跳跃的桥梁,也是 HCIE-DC 的主干内容。

第 4 章 数据中心网络架构 ★★★

4.1 学习目标

  • 掌握传统三层架构与 Spine-Leaf(CLOS)架构的对比
  • 理解大规模 DC 的冗余与扩展设计原则
  • 建立"架构决定性能"的设计思维

4.2 正文大纲

  1. 传统 DC 三层架构
    • 核心-汇聚-接入,STP 时代的问题
    • 南北向瓶颈、东西向带宽不足
  2. Spine-Leaf(CLOS)架构
    • 等长路径、无阻塞设计、L2/L3 分界(大 L3 设计)
    • 横向扩展(scale-out)vs 纵向扩展(scale-up)
  3. 关键设计要素
    • 扇出比(oversubscription)与带宽规划
    • ECMP(等价多路径)负载均衡
    • 分区/租户隔离与 VPC 模型
    • 服务器接入:ToR 交换机、多网卡 bonding
  4. 高可用设计
    • 设备冗余、链路冗余、网关冗余(VRRP/M-LAG)
    • 故障域划分与爆炸半径控制

4.3 实验与实操

  • eNSP Pro / EVE-NG:搭建 4 脊 8 叶 Spine-Leaf 拓扑
  • 计算题:给定服务器数量与带宽需求,求交换机端口规划

4.4 推荐阅读

  • 【书 B6】《Data Center Networks: A Practical Guide》(或华为 CloudFabric 白皮书系列)
  • 【书 B1】《计算机网络:自顶向下》第 6 章(链路层复习)
  • 【报告 R3】Gartner《2026 数据中心交换机市场指南》(了解市场格局)

4.5 思考题

  1. Spine-Leaf 中 Leaf 与 Spine 的职责边界在哪里?
  2. 为什么智算集群普遍采用"大 L3 + ECMP"而不是大二层?

第 5 章 VXLAN 叠加网络 ★★★

5.1 学习目标

  • 理解叠加网络(Overlay)与底层网络(Underlay)的分离思想
  • 掌握 VXLAN 封装、VTEP、VNI 的核心机制
  • 能独立设计 VXLAN 接入方案

5.2 正文大纲

  1. 叠加网络的动机
    • VLAN 4000 上限、大二层需求、租户隔离、虚拟机迁移
    • Overlay/Underlay 解耦模型
  2. VXLAN 协议机制
    • 报文封装(MAC-in-UDP)、VNI 标识
    • VTEP(VXLAN Tunnel Endpoint)、BUM 泛洪与抑制
    • 静态 VXLAN vs 动态 VXLAN
  3. VXLAN 网关
    • L2 网关 / L3 网关 / 分布式网关(Anycast GW)
    • 与外部网络互通设计
  4. VXLAN 与 EVPN 的关系(引出第 6 章)

5.3 实验与实操

  • eNSP:静态 VXLAN 二层互通实验
  • Wireshark 抓取 VXLAN 报文,解析封装字段(VNI、外层 MAC/IP)

5.4 推荐阅读

  • 【书 B6】DC 网络实践指南 VXLAN 章节
  • 【书 B2】UDP 封装相关知识复习
  • RFC 7348(VXLAN 官方规范,英文原文精读第 1~5 节)

5.5 思考题

  1. VNI 与 VLAN 的对应关系如何设计才能兼顾扩展与运维?
  2. 分布式网关相比集中式网关的优势与代价?

第 6 章 BGP-EVPN 控制面 ★★★

6.1 学习目标

  • 掌握 EVPN 的核心概念与路由类型
  • 理解"控制面与数据面分离"在现代 DC 的实现
  • 能配置并排障 BGP-EVPN VXLAN 网络

6.2 正文大纲

  1. EVPN 概述
    • 为什么用 BGP 承载以太网信息(对比传统 MAC 学习)
    • MP-BGP、地址族(L2VPN EVPN)
  2. EVPN 核心路由类型
    • Type 1(Ethernet Auto-Discovery)
    • Type 2(MAC/IP Advertisement Route)★
    • Type 3(Inclusive Multicast Ethernet Tag)
    • Type 5(IP Prefix Route)★
  3. EVPN 关键特性
    • MAC/IP 同步、防环、快速收敛
    • 分布式网关与 ARP 抑制
    • 多租户(VRF + EVPN 实例)模型
  4. 典型组网与配置
    • 华为 CE 系列 EVPN-VXLAN 配置实例
    • 常见故障:RT 不匹配、隧道建立失败、MAC 黑洞

6.3 实验与实操

  • eNSP:BGP-EVPN + VXLAN 分布式网关完整实验(建议 3 台 VTEP + 2 台 Spine)
  • 故障演练:故意配错 RT 值,观察 BGP 邻居与隧道状态并修复

6.4 推荐阅读

  • 【书 B6】DC 网络实践指南 EVPN 章节
  • 【书 B7】《BGP 设计与实现》(Randy Zhang,EVPN 前 BGP 底子)
  • RFC 7432(BGP MPLS-Based Ethernet VPN,精读 Type 2/3/5)

6.5 思考题

  1. EVPN Type 2 与 Type 5 路由分别解决什么问题?
  2. 分布式网关下,主机间跨 Leaf 通信的数据路径是怎样的?

第 7 章 Segment Routing(SR) ★★☆

7.1 学习目标

  • 理解 SR 的转发模型与 MPLS/SRv6 两种数据面
  • 了解 SR 在 DC 与智算网络中的角色(灵活路径、快速重路由)

7.2 正文大纲

  1. 从 MPLS LDP 到 Segment Routing
    • 标签分发方式的改变、IGP 扩展(OSPF/SR、IS-IS/SR)
    • 源路由思想:分段列表(Segment List)
  2. SR-MPLS 基础
    • SID(Segment Identifier)、Prefix-SID、Adj-SID
    • 隧道建立与转发流程
  3. SRv6 基础
    • IPv6 扩展头、SRH(Segment Routing Header)
    • SRv6 与云网融合、网络编程
  4. SR 在智算/DC 的应用前景
    • 灵活路径调度、TE 流量工程、确定性网络

7.3 实验与实操

  • eNSP:SR-MPLS 基础实验(IGP 自动分发 SID)
  • 阅读 SRv6 网络编程案例(华为官方文档)

7.4 推荐阅读

  • 【书 B5】《MPLS和VPN体系结构》MPLS 部分(先修)
  • 华为《SRv6 技术白皮书》/ IETF RFC 8402(SR 架构)

7.5 思考题

  1. SRv6 相比 SR-MPLS 的优势与部署成本?
  2. 智算网络为什么需要"灵活路径"而不仅仅是 ECMP?

第 8 章 数据中心网络可靠性与运维 ★★☆

8.1 学习目标

  • 掌握 BFD、M-LAG、堆叠等可靠性技术
  • 建立 DC 运维的监控与变更管理思维

8.2 正文大纲

  1. 快速检测与收敛
    • BFD(双向转发检测)原理与配置
    • 与 OSPF/BGP/静态路由联动
  2. 链路聚合与双活
    • LACP、M-LAG(跨设备链路聚合)、堆叠(CSS)
    • 双活网关与环路避免
  3. 运维基础
    • 监控指标:CPU/内存/端口流量/丢包/时延
    • 日志与告警体系、配置备份与版本管理
    • 变更窗口与回滚预案

8.3 实验与实操

  • eNSP:M-LAG 双活网关实验;BFD 联动 BGP 快速切换实验

8.4 推荐阅读

  • 【书 B6】DC 实践指南可靠性章节
  • 华为 CE 系列《配置指南-BFD》《配置指南-M-LAG》

8.5 思考题

  1. BFD 检测时间与网络负载的关系如何权衡?
  2. 一次 DC 变更事故的完整复盘流程应该包含哪些环节?

第三篇 无损网络与 RDMA(智算网络的心脏)

本篇是智算网络区别于传统数通的核心分水岭,也是面试中区分"真懂智算"与"概念党"的关键。

第 9 章 RDMA 技术基础 ★★★

9.1 学习目标

  • 理解 RDMA 解决的根本问题(CPU 卸载、内核旁路、零拷贝)
  • 掌握 InfiniBand / RoCE / iWARP 三种实现与选型
  • 理解 RDMA 与 AI 训练的关系

9.2 正文大纲

  1. 传统网络通信的瓶颈
    • 内核协议栈开销、多次拷贝、CPU 中断
    • 延迟与吞吐的数学边界
  2. RDMA 核心机制
    • 内核旁路(Kernel Bypass)、零拷贝(Zero-Copy)、CPU 卸载
    • Verbs API 模型:QP(Queue Pair)、CQ(Completion Queue)、MR(Memory Region)
  3. 三大实现对比
    • InfiniBand(IB):专用网络,RDMA 原生
    • RoCEv1/v2:基于以太网,v2 使用 UDP 封装★
    • iWARP:基于 TCP
  4. 应用场景
    • HPC、AI 训练(NCCL 底层)、存储(NVMe-oF)、大数据

9.3 实验与实操

  • Linux 双机部署 SoftRoCE(RXE)或真机 RoCE 网卡
  • 使用 ib_write_bw/ib_read_lat 工具测量带宽与延迟
  • rdma linkibstatibv_devinfo 命令实操

9.4 推荐阅读

  • 【书 B8】《InfiniBand Architecture Specification》(IBTA 官方规范,按需查阅)
  • 【书 B9】《Handbook of Fiber Optic Data Communication》(第 4 版)RDMA 章节
  • NVIDIA 官方《RDMA 技术文档》(docs.nvidia.com,RoCE 章节)

9.5 思考题

  1. RoCEv2 为什么选择 UDP 封装而不是 TCP?
  2. 内核旁路带来的好处与安全/管理上的代价是什么?

第 10 章 RoCEv2 协议栈与部署 ★★★

10.1 学习目标

  • 掌握 RoCEv2 报文结构、GID/流标(流控)机制
  • 能规划并部署一个 RoCEv2 集群网络

10.2 正文大纲

  1. RoCEv2 报文格式
    • 以太头 + IP + UDP(目标端口 4791)+ IB BTH + Payload
    • PSN(Packet Sequence Number)、重传机制
  2. 寻址与路由
    • GID(Global ID)/ GRH(Global Routing Header)
    • RoCEv2 跨子网路由、VLAN 与 PCP 标记
  3. 部署要点
    • 交换机/网卡/服务器三端配置
    • MTU 一致性(建议 9000 Jumbo)、流控开启
    • RoCE 流量与普通流量的隔离(专用 VLAN/PFC 队列)
  4. 常见问题
    • 丢包导致性能骤降、流控风暴、队列死锁

10.3 实验与实操

  • Wireshark 抓取 RoCEv2 报文(filter: udp.port == 4791
  • 在交换机上配置 RoCE 专用队列与优先级映射

10.4 推荐阅读

  • 【书 B9】光通信手册 RoCE 相关章节
  • NVIDIA《RoCE 部署指南》(官方,含交换机配置模板)
  • 华为 CloudFabric 智算网络解决方案文档

10.5 思考题

  1. 为什么 RoCE 对丢包极其敏感(0.1% 丢包即大幅掉速)?
  2. Jumbo MTU 在 RoCE 部署中的必要性是什么?

第 11 章 无损网络拥塞控制 ★★★(本篇最核心)

11.1 学习目标

  • 深刻理解 PFC 与 ECN 的原理、优缺点与协同
  • 掌握 DCQCN 等端到端拥塞控制算法
  • 理解"无损网络"为何需要全链路协同

11.2 正文大纲

  1. 拥塞的本质与代价
    • 传统 TCP 丢包重传 vs RDMA 对丢包的不可容忍
    • 拥塞树(Congestion Tree)、HoL 阻塞(Head-of-Line Blocking)
  2. PFC(Priority-based Flow Control)802.1Qbb
    • 按优先级暂停机制、PAUSE 帧
    • 优点:链路级无损;缺点:死锁风险、流控风暴、公平性问题
  3. ECN(Explicit Congestion Notification)802.1Qau
    • 标记机制(CE 标记)、与 TCP/DCQCN 联动
    • 优点:端到端反馈;缺点:依赖端侧算法
  4. 经典拥塞控制算法
    • DCQCN(RoCE 标配)★、QCN、DCTCP
    • 参数调优:K 值、W 值、标记阈值
  5. 无损网络的工程协同
    • 队列设计(无损队列/普通队列隔离)
    • 端到端 QoS 映射(PCP/DSCP 映射链)
    • 网络级方案:华为 iLossless、无损以太(UEC)的演进

11.3 实验与实操

  • 理论实验:用 ns-3 或华为 iMaster NCE 模拟器观察 PFC 暂停帧与 ECN 标记
  • 真机实验(有条件时):制造拥塞观察队列深度与流控计数器
  • 精读 ODCC《数据中心智能无损网络白皮书》并画原理图

11.4 推荐阅读

  • 【报告 R4】ODCC《数据中心智能无损网络白皮书》(必读,中文权威)
  • 【报告 R5】ODCC《2025 以太网智算集群互联技术白皮书》
  • 【书 B2】《TCP/IP详解》ECN 相关章节(RFC 3168)
  • IEEE 802.1Qbb / 802.1Qau 标准原文(按需)

11.5 思考题

  1. PFC 为什么可能引起"死锁"?如何通过设计避免?
  2. DCQCN 中 ECN 标记与 PFC 暂停是如何配合工作的?
  3. 为什么说"无损网络"是全链路(网卡+交换机+协议)协同的结果?

第 12 章 超以太网与新一代智算网络协议 ★★☆

12.1 学习目标

  • 了解 UEC(Ultra Ethernet Consortium)的技术方向
  • 掌握国内 GSE(全调度以太网)与 FlexLane 的进展
  • 建立"标准演进"的长期跟踪能力

12.2 正文大纲

  1. 为什么需要"超以太网"
    • IB 的封闭性 vs 以太网的开放生态
    • 以太网在 AI 场景的三大短板(拥塞、时延、规模)
  2. Ultra Ethernet(UEC)
    • 成立背景与成员(AMD、博通、思科、华为等)
    • 技术方向:UET(传输层)、改进流控、可扩展性
  3. 中国方案:GSE 全调度以太网
    • 中国移动发布 GSE 全套标准与商用设备
    • 逐跳调度 vs 端到端拥塞控制的对比
    • FlexLane 弹性通道技术
  4. 光互联与长距智算
    • 无损智算 OTN(HIC-OTN)技术白皮书
    • 跨数据中心智算互联(DCI)

12.3 实验与实操

  • 跟踪 UEC 官网与 ODCC 白皮书更新,做标准对比表
  • 阅读中国移动《云智算新一代网络基础设施白皮书》输出思维导图

12.4 推荐阅读

  • 【报告 R6】中国移动《云智算新一代网络基础设施白皮书》
  • 【报告 R7】ODCC《2025 下一代智算 DC 高速互联网络需求白皮书》
  • UEC 官网技术文档(ultraethernet.org)

12.5 思考题

  1. GSE 与 UEC 在解决拥塞问题上的思路差异?
  2. 未来 3 年,智算网络会形成"IB vs 以太网"的何种格局?

第 13 章 存储网络与 NVMe-oF ★★☆

13.1 学习目标

  • 理解 AI 数据管线对存储网络的需求
  • 掌握 NVMe-oF 与 RDMA 的结合方式

13.2 正文大纲

  1. 存储网络演进
    • FC-SAN → iSCSI → NVMe-oF
    • AI 训练中 checkpoint 与数据集加载的带宽压力
  2. NVMe-oF 基础
    • NVMe over Fabrics:RoCE / FC / TCP 三种传输
    • 与 RDMA 的结合(NVMe/RDMA)
  3. 智算存储架构
    • 并行文件系统(Lustre/GPFS)与网络的关系
    • 存储网络与计算网络的隔离/融合设计

13.3 实验与实操

  • 了解 nvme 命令行工具与 target 配置(软环境)
  • 画出"训练集群 + 存储集群"的网络拓扑图

13.4 推荐阅读

  • 【书 B9】光通信手册存储章节
  • SNIA 官方 NVMe-oF 技术教程(免费在线)

13.5 思考题

  1. 为什么 checkpoint 写入会成为训练瓶颈?网络如何缓解?
  2. 存储网络是否需要"无损"?与计算网络的要求有何异同?

第四篇 智算系统与 AI 集群

从"网络"扩展到"系统",理解网络如何服务 AI 训练,这是智算网络工程师区别于普通网工的分水岭。

第 14 章 AI 训练通信模式与集合通信 ★★★

14.1 学习目标

  • 理解分布式训练的基本范式与通信模式
  • 掌握 NCCL/RCCL 集合通信与网络负载的关系
  • 能根据通信模式反推网络设计需求

14.2 正文大纲

  1. 分布式训练基础
    • 数据并行 / 模型并行 / 张量并行 / 流水线并行
    • PS 架构(参数服务器)vs All-Reduce 架构
  2. 集合通信原语
    • AllReduce(全归约)★、AllGather、AlltoAll、ReduceScatter
    • 环形(Ring)与树形(Tree)算法、通信量计算
  3. NCCL 与 RCCL
    • NCCL(英伟达)/ RCCL(昇腾)的角色
    • 通信库对网络的要求:低延迟、高带宽、无丢包
  4. 通信与网络设计的映射
    • 大模型训练 → 东西向流量爆发的量化
    • 网络拓扑(Fat-Tree/3D-Torus)与通信效率

14.3 实验与实操

  • 阅读《Megatron-LM》/《DeepSeek》技术报告中的并行策略章节
  • 计算题:8 卡 / 64 卡 AllReduce 的理论通信时间

14.4 推荐阅读

  • 【书 B10】《高性能计算导论》相关章节(并行编程模型)
  • NVIDIA NCCL 官方文档(docs.nvidia.com/deeplearning/nccl)
  • 华为昇腾社区 RCCL 文档

14.5 思考题

  1. 为什么 AllReduce 在 Ring 算法下与节点数几乎无关?
  2. 模型并行相比数据并行对网络延迟更敏感还是更不敏感?

第 15 章 GPU 集群与算力网络架构 ★★★

15.1 学习目标

  • 掌握 NVIDIA Spectrum-X 与昇腾集群的组网架构
  • 理解 Scale-up(机内互联)与 Scale-out(机间互联)
  • 了解 DPU/智能网卡的卸载能力

15.2 正文大纲

  1. Scale-up 与 Scale-out
    • 机内:NVLink / 昇腾 HCCS 高速互联
    • 机间:RoCE/IB 网络(Scale-out Fabric)
  2. NVIDIA 方案
    • Spectrum-X:Spectrum 交换机 + BlueField DPU + DOCA
    • 拥塞控制增强(Adaptive Routing、Per-Packet 动态路由)
    • 参考架构:8 卡节点 → 数千卡集群的组网
  3. 华为昇腾方案
    • 昇腾 910 集群、HCCS/HCCL、CloudFabric 智算网络
    • 与国产化政策的衔接
  4. DPU / 智能网卡
    • 网络卸载:OVS 卸载、RDMA 卸载、安全卸载
    • 裸金属与虚拟化的网络一致性

15.3 实验与实操

  • 云 GPU 实例(按小时租用)搭建 2~4 卡训练环境,跑通 NCCL 测试(all_reduce_perf
  • 阅读 NVIDIA《Spectrum-X Networking Platform Administration》官方培训教材并做笔记(免费获取

15.4 推荐阅读

  • 【书 B11】NVIDIA《Spectrum-X 管理教材》(官方免费)
  • 【书 B12】华为《昇腾 AI 集群网络》系列资料
  • 【报告 R6】中国移动云智算白皮书(架构章节)

15.5 思考题

  1. Scale-up 与 Scale-out 的边界由什么决定?
  2. DPU 卸载对网络运维(可观测性、排障)带来了哪些新挑战?

第 16 章 智算中心网络设计 ★★★

16.1 学习目标

  • 能独立完成一个千卡级智算集群的网络设计
  • 掌握带宽规划、拓扑选型、分区设计的方法论

16.2 正文大纲

  1. 需求分析
    • 训练/推理/存储流量占比测算
    • 故障容忍度与服务等级约定(SLA)
  2. 拓扑设计
    • Fat-Tree(Clos 扩展)、Dragonfly、3D-Torus 对比
    • 脊叶规模计算:给定 GPU 数量求端口数
  3. 带宽规划
    • 收敛比设计(1:1 无收敛 vs 3:1)
    • 400G/800G/1.6T 演进路线(智研咨询报告显示已进入 800G/1.6T 周期)
  4. 分区与隔离
    • 计算/存储/管理三网分离
    • 多租户与安全域设计
  5. 部署与验收
    • 验收标准:带宽/时延/丢包基线、性能测试方法

16.3 实验与实操

  • 课程设计:设计一个 1024 卡 GPU 集群的网络方案(含拓扑图、端口清单、预算表)
  • 用 Excel/在线工具计算带宽需求并形成设计文档

16.4 推荐阅读

  • 【书 B6】DC 实践指南架构章节(先修)
  • 【报告 R2/R7】ODCC 智算 DC 高速互联需求白皮书
  • 智研咨询《中国数据中心交换机行业报告》(市场与技术趋势)

16.5 思考题

  1. 无收敛(1:1)网络在 1024 卡集群中的成本是多少?是否值得?
  2. 训练任务对网络的"长尾时延"为何比"平均时延"更敏感?

第 17 章 智算网络调优与排障 ★★★

17.1 学习目标

  • 掌握智算网络性能基线与瓶颈定位方法
  • 能处理"训练慢"类问题的完整排查流程

17.2 正文大纲

  1. 性能基线
    • 带宽测试(iperf3/ib_write_bw)、时延测试
    • NCCL 测试与训练框架实测(Megatron 吞吐)
  2. 丢包与拥塞定位
    • 网卡侧:ethtool -S、RDMA 计数器、rdma statistic
    • 交换机侧:队列深度、PFC 暂停帧计数、ECN 标记计数
    • 端到端:ucx_perftestnvidia-smi 通信利用率
  3. 常见问题库
    • MTU/流控配置不一致、VLAN/PFC 优先级映射错误
    • 网卡固件与驱动版本、DPU 配置
    • 训练框架通信配置(NCCL 环境变量调优)
  4. 调优方法论
    • 单点隔离法、二分定位法、对照实验法
    • 输出标准排障报告模板

17.3 实验与实操

  • 搭建"故障工单"演练:给出 5 个预置故障场景,逐一定位修复
  • 编写一份《智算网络排障手册》(个人知识库)

17.4 推荐阅读

  • 【书 B11】Spectrum-X 管理教材(监控与排障章节)
  • NVIDIA 官方《RoCE 排障指南》
  • 华为《CloudFabric 智算网络运维指南》

17.5 思考题

  1. 训练性能下降时,如何快速判断瓶颈在网络还是计算?
  2. PFC 暂停帧计数持续增长意味着什么?该如何处理?

第五篇 自动化与智能运维

贯穿全程的并行线。智算网络的规模决定了"手工运维"不可行,自动化是护城河。

第 18 章 网络自动化基础(Python 实战) ★★★

18.1 学习目标

  • 用 Python 独立完成网络设备的批量操作与巡检
  • 掌握 Netmiko/Nornir/Ansible 三件套

18.2 正文大纲

  1. Python 必备基础
    • 数据类型、函数、文件、异常、正则表达式
    • 面向对象入门(为 Netmiko 源码阅读铺垫)
  2. Netmiko
    • SSH 连接管理、命令下发、回显解析
    • 批量备份配置脚本实战
  3. Nornir
    • 并行任务框架、Inventory 模型
    • 全网络巡检与配置一致性检查
  4. Ansible
    • Playbook 语法、华为模块(community.network/华为官方集合)
    • 配置模板化(Jinja2)与滚动变更

18.3 实验与实操

  • 项目:编写"自动巡检 + 告警"脚本(连接 eNSP 桥接或真机),输出 Excel 报告
  • 项目:Ansible 批量下发 30 台交换机的基础配置

18.4 推荐阅读

  • 【书 B13】《Python编程:从入门到实践》(Eric Matthes)
  • 【书 B14】《网络自动化运维实战》(Netmiko/Nornir)
  • 【书 B15】《Network Programmability and Automation》(O’Reilly)

18.5 思考题

  1. Netmiko(SSH 命令行)与 NETCONF 的本质区别?
  2. 自动化脚本在"变更事故"场景下如何做安全控制(灰度/回滚)?

第 19 章 网络可编程性(NETCONF/YANG/gNMI) ★★★

19.1 学习目标

  • 理解结构化网络管理与传统 CLI 的差异
  • 掌握 NETCONF/YANG 的基本操作与 gNMI/Telemetry

19.2 正文大纲

  1. NETCONF 协议
    • 会话与操作(get/get-config/edit-config)、能力协商
  2. YANG 数据建模
    • 模块结构、容器/列表/叶子
    • 与 JSON/XML 编码的对应
  3. RESTCONF 与 gNMI
    • RESTful 接口、gNMI Subscribe(流式遥测)
  4. Telemetry 遥测
    • 推模式 vs 拉模式
    • 华为 gRPC 遥测与 Prometheus 对接

19.3 实验与实操

  • yangson/ncclient(Python)对模拟器执行 NETCONF 查询
  • 搭建 Prometheus + Grafana 监控交换机指标

19.4 推荐阅读

  • RFC 6241(NETCONF)、RFC 7950(YANG 1.1)
  • 【书 B15】可编程性章节
  • 华为《YANG 模型开发指南》(官方文档)

19.5 思考题

  1. Telemetry 相比 SNMP 轮询的优势?
  2. 为什么说 YANG 是网络设备的"数据库 Schema"?

第 20 章 监控与智能运维(AIOps) ★★☆

20.1 学习目标

  • 掌握监控体系搭建与告警收敛
  • 了解 AIOps 在智算网络的应用方向

20.2 正文大纲

  1. 监控体系设计
    • 指标(Metrics)/日志(Logs)/追踪(Traces)三支柱
    • Prometheus + Grafana + Loki/ELK 组合
  2. 告警管理
    • 告警分级、抑制、收敛、值班闭环
    • 告警与自动化联动(自愈脚本)
  3. AIOps 基础
    • 异常检测(时序)、根因分析(RCA)
    • 智能运维在智算集群的实践(信通院报告中"智能运维"章节)

20.3 实验与实操

  • 搭建一套监控大屏:交换机 + 服务器指标可视化
  • 设计一个"告警 → 自动重启/切换"的自愈流程(模拟)

20.4 推荐阅读

  • 【报告 R1】信通院报告智能运维章节
  • 《Site Reliability Engineering》(Google SRE 中文版,可选)
  • 中国通信企业协会《智能网络运维工程师》课程大纲(官方通知

20.5 思考题

  1. 告警风暴的根因与收敛手段有哪些?
  2. AIOps 能替代网络工程师的哪些工作?不能替代什么?

第 21 章 云原生网络(K8s CNI) ★★☆

21.1 学习目标

  • 理解容器网络模型与 CNI 插件
  • 了解云原生网络与智算调度的关系

21.2 正文大纲

  1. Kubernetes 网络模型
    • Pod 网络、Service 与 kube-proxy、DNS
    • CNI 规范与常见插件(Flannel/Calico/Cilium)
  2. 多网卡与 SR-IOV
    • 智算场景的专用网卡(RDMA 网卡进 Pod)
    • SR-IOV/DPDK 与 RDMA 虚拟化
  3. 智算调度中的网络
    • 拓扑感知调度(NCCL 拓扑匹配)
    • Volcano/KubeFlow 与网络协同

21.3 实验与实操

  • 本地 K8s(k3s/minikube)安装 Calico,观察网络策略生效
  • 阅读"RDMA 网卡 + SR-IOV + Pod"的部署文档

21.4 推荐阅读

  • 【书 B16】《Kubernetes 权威指南》(CNI 章节)
  • Cilium/Calico 官方文档

21.5 思考题

  1. Pod 网络与物理网络如何衔接?NodePort/LoadBalancer 的数据路径?
  2. 为什么大模型训练集群要用"专用网络"而不是默认 Pod 网络?

第六篇 认证、项目与就业

第 22 章 认证体系对标 ★★☆

22.1 学习目标

  • 明确 HCIE-DC 与 NCP-AIN 的考试结构与备考策略
  • 制定与学业时间线匹配的认证计划

22.2 正文大纲

  1. 华为认证路线
    • HCIE-Data Center:笔试 + 实验 + 面试
    • 华为 HCSP-Presales-Data Center(售前方向,可选)
    • 备考资源:官方培训教材(HCIE-DC V2.0 教材
  2. NVIDIA 认证路线
  3. 备考策略
    • 认证与课程进度的对应关系表
    • 刷题节奏与实验验证结合

22.3 实验与实操

  • 下载 NCP-AIN 官方考试大纲,逐条对照本大纲打勾
  • 参加华为 ICT 大赛(数通/云赛道)作为实战练兵

22.4 推荐阅读

  • 【书 B11】Spectrum-X 官方教材(NCP-AIN 核心)
  • 【书 B17】《华为HCIP-Datacom路由交换学习指南》(数通底座复习)

22.5 思考题

  1. HCIE-DC 与 NCP-AIN 的含金量与就业场景差异?
  2. 认证在简历中的定位:敲门砖还是能力证明?

第 23 章 实验环境与项目实践 ★★★

23.1 学习目标

  • 搭建可持续演进的个人实验环境
  • 产出 3 个可写进简历的完整项目

23.2 正文大纲

  1. 环境选型
    • 免费层:eNSP / EVE-NG / GNS3(网络模拟)
    • 云层:华为云免费实验、云 GPU 按小时(训练验证)
    • 真机层:二手设备(可选)、学校实验室
  2. 项目库设计(简历级)
    • 项目 1:HCIP 综合园区网(已具备)
    • 项目 2:Spine-Leaf + EVPN-VXLAN 数据中心(模拟器)
    • 项目 3:网络自动化巡检系统(Python + 报告)
    • 项目 4:智算集群网络方案设计(千卡级设计文档)
    • 项目 5:RoCE 性能测试与调优报告(云 GPU)
  3. 知识沉淀
    • GitHub 仓库结构、文档规范、排障笔记模板

23.3 实验与实操

  • 本周任务:初始化 GitHub 仓库 + 完成项目 2 的拓扑设计

23.4 推荐阅读

23.5 思考题

  1. 简历项目如何体现"从配置到设计"的进阶?
  2. 模拟器实验与真机实验的差距在哪里?如何弥补?

第 24 章 求职与职业发展 ★☆☆

24.1 学习目标

  • 明确目标岗位画像与简历策略
  • 建立 5 年职业发展路径

24.2 正文大纲

  1. 目标岗位画像
    • 智算中心网络工程师 / 网络架构师 / 网络智能运维工程师
    • 云厂商 DC 网络工程师、运营商算力网络工程师
  2. 简历与面试
    • 项目叙述的 STAR 法则
    • 高频面试题清单(BGP/EVPN/PFC/ECN/NCCL)
    • 谈薪与城市选择(一线/新一线智算产业聚集区)
  3. 职业发展路径
    • 0-2 年:运维/实施(打基础)
    • 2-5 年:方案设计/架构(形成体系)
    • 5 年+:架构师/团队负责人/专家
    • 持续跟踪:UEC、GSE、信通院年度报告

24.3 实验与实操

  • 写一版简历,用本大纲的章节标题作为技能树自查清单

24.4 推荐阅读

  • 【报告 R1】信通院报告(产业趋势用于面试)
  • 【报告 R3】Gartner 市场指南(市场格局)

24.5 思考题

  1. 你的差异化竞争力是什么?(HCIP 数通 + 自动化 + 智算认知?)
  2. 如果 2028 年智算网络岗位竞争加剧,你的第二技能是什么?

附录

附录 A 总书单(按优先级分级)

A 级(必读精读)

编号书名作者/出版对应章节
B1《计算机网络:自顶向下方法》(第 7 版)Kurose/Ross,机械工业出版社第 2、4 章
B2《TCP/IP详解 卷1:协议》(第 2 版)Kevin Fall 等,机械工业出版社第 2、3、11 章
B3《图解TCP/IP》(第 5 版)竹下隆史,人民邮电出版社第 2 章
B4《华为HCIP-Datacom路由交换学习指南》华为技术认证教材第 3 章
B5《MPLS和VPN体系结构》Ivan Pepelnjak,人民邮电出版社第 3、7 章
B6《Data Center Networks: A Practical Guide》华为 CloudFabric 白皮书系列第 4、5、6、8、16 章
B7《BGP 设计与实现》Randy Zhang,人民邮电出版社第 6 章
B8《InfiniBand Architecture Specification》IBTA 官方规范第 9 章
B9《Handbook of Fiber Optic Data Communication》(第 4 版)Casimer DeCusatis,Elsevier第 9、10、13 章
B10《高性能计算导论》相关经典教材(任选)第 14 章
B11NVIDIA《Spectrum-X Networking Platform Administration》NVIDIA 官方(免费)第 15、17、22 章
B12华为《昇腾 AI 集群网络》系列资料华为官方文档第 15 章
B13《Python编程:从入门到实践》Eric Matthes,人民邮电出版社第 18 章
B14《网络自动化运维实战》相关实战教材(Netmiko/Nornir)第 18 章
B15《Network Programmability and Automation》O’Reilly第 18、19 章
B16《Kubernetes 权威指南》闫健勇等,电子工业出版社第 21 章

B 级(选读参考)

  • 《华为HCIA-Datacom认证实验指南》(打底实验)
  • 《路由与交换技术教程——基于eNSP的网络设备配置》(北邮社)
  • 《Site Reliability Engineering》(Google SRE)
  • 《深入理解Kubernetes》
  • 《软件定义网络:SDN 与 OpenFlow 解析》

附录 B 权威报告与白皮书索引

编号报告机构用途
R1《人工智能算力基础设施赋能研究报告(2025年)》中国信通院产业背景、市场规模、智能运维
R2《2025 下一代智算 DC 高速互联网络需求白皮书》ODCC需求与技术方向
R3《2026 数据中心交换机市场指南》Gartner市场格局
R4《数据中心智能无损网络白皮书》ODCC无损网络核心
R5《2025 以太网智算集群互联技术白皮书》ODCC智算互联技术
R6《云智算新一代网络基础设施白皮书》中国移动运营商方案、GSE
R7《无损智算OTN(HIC-OTN)技术白皮书》行业联盟长距智算互联
R8《算力基础设施高质量发展行动计划》工信部等六部门政策与时间表
R9《算力互联互通行动计划》工信部政策方向
R10《中国数据中心交换机行业发展报告》智研咨询800G/1.6T 演进

附录 C 工具与命令速查

  • 网络模拟:eNSP、eNSP Pro、EVE-NG、GNS3
  • 抓包分析:Wireshark(RoCE filter: udp.port == 4791
  • 性能测试:iperf3、ib_write_bw、ib_read_lat、ucx_perftest
  • RDMA 管理:ibstatibv_devinfordma linkethtool -S
  • 自动化:Python、Netmiko、Nornir、Ansible、ncclient
  • 监控:Prometheus、Grafana、Loki
  • 容器:k3s/minikube、Calico/Cilium
  • 云资源:华为云免费实验、云 GPU 按小时租用

附录 D 术语表(节选)

术语全称/含义
RDMARemote Direct Memory Access,远程直接内存访问
RoCERDMA over Converged Ethernet,基于融合以太网的 RDMA
PFCPriority-based Flow Control,基于优先级的流控(802.1Qbb)
ECNExplicit Congestion Notification,显式拥塞通知(802.1Qau)
DCQCNData Center Quantized Congestion Notification
VXLANVirtual eXtensible LAN,虚拟可扩展局域网
EVPNEthernet VPN,以太网 VPN(BGP 承载)
VTEPVXLAN Tunnel End Point
VNIVXLAN Network Identifier
SRSegment Routing(SR-MPLS/SRv6)
NCCLNVIDIA Collective Communications Library
RCCL华为集合通信库(昇腾)
Scale-up机内扩展(NVLink/HCCS)
Scale-out机间扩展(网络互联)
DPUData Processing Unit,数据处理单元
GSE全调度以太网(中国移动)
UECUltra Ethernet Consortium,超以太网联盟
NVMe-oFNVMe over Fabrics
Telemetry遥测(推模式监控)
AIOps智能运维(AI for IT Operations)

附录 E 学习进度追踪表

章节核心程度计划完成日期实际完成要点笔记(3 条)
第 1 章 导论★★☆
第 2 章 网络原理★★★
第 3 章 路由交换进阶★★★
第 4 章 DC 架构★★★
第 5 章 VXLAN★★★
第 6 章 BGP-EVPN★★★
第 7 章 SR★★☆
第 8 章 可靠性运维★★☆
第 9 章 RDMA 基础★★★
第 10 章 RoCEv2★★★
第 11 章 无损拥塞控制★★★
第 12 章 超以太网/GSE★★☆
第 13 章 存储网络★★☆
第 14 章 集合通信★★★
第 15 章 集群架构★★★
第 16 章 智算网络设计★★★
第 17 章 调优排障★★★
第 18 章 自动化基础★★★
第 19 章 可编程性★★★
第 20 章 AIOps★★☆
第 21 章 云原生网络★★☆
第 22 章 认证对标★★☆
第 23 章 实验与项目★★★
第 24 章 求职发展★☆☆

版本记录

  • v1.0(本版):初版发布。依据信通院/工信部/ODCC/Cisco/NVIDIA 公开资料编撰,书单映射完整,适配大二-专升本-本科毕业三年半周期。
  • 后续建议:每学期更新一次,同步 UEC/GSE 标准进展与信通院年度报告数据。
  • 欢迎交流学习,以上内容按本人情况调整

更多推荐