智算中心网络AI-Infra系统学习大纲
·
智算中心网络(AI Infra 网络)系统学习大纲
教材型大纲 · 第一版
适用对象:大二在读、备考专升本、HCIP 数通方向在学,目标为智算中心网络 / 数据中心网络工程师
设计依据:中国信通院《人工智能算力基础设施赋能研究报告(2025年)》、工信部《算力基础设施高质量发展行动计划》、ODCC 系列白皮书、Cisco AI 网络流量报告、NVIDIA NCP-AIN 认证体系、华为 HCIE-DC 认证体系
时间跨度:大二下 ~ 本科毕业(约 3.5 年)
使用说明
- 本大纲以"教材"体例编写:篇 → 章 → 节 → 知识点,每章包含【学习目标】【正文大纲】【实验与实操】【推荐阅读】【思考题】五个部分。
- 标记说明:
- ★★★ 核心章节(必读必练,决定就业竞争力)
- ★★☆ 重要章节(需掌握,可与并行线穿插)
- ★☆☆ 了解章节(按时间余量选择性学习)
- 每章【推荐阅读】映射自总书单(见附录 A),带编号便于回溯。
- 建议按附录 E 的进度追踪表记录完成情况,每章完成后打勾并写下 3 条要点笔记。
第 0 篇 导论
第 1 章 智算中心网络导论 ★★☆
1.1 学习目标
- 理解"智算中心网络"的定义、在 AI 基础设施中的位置
- 掌握产业数据:算力规模、市场规模、政策目标
- 明确本方向的职业定位与成长路径
1.2 正文大纲
- 从数据中心网络到智算中心网络的演进
- 传统 DC:南北向流量为主,网关在核心
- 智算 DC:东西向流量爆发,GPU 集群间全互联
- 智算网络的技术全景图
- 计算层:GPU/昇腾 NPU 集群
- 网络层:RoCE/IB/无损以太,Scale-up + Scale-out
- 存储层:NVMe-oF 存储网络
- 调度层:集合通信库(NCCL/RCCL)、集群调度器
- 权威数据与政策背景
- 信通院:2025 年算力规模 788 EFlops,AI 算力市场 190 亿美元
- 工信部《算力基础设施高质量发展行动计划》:2025 年算力超 300 EFLOPS、智能算力占比 35%
- 中国移动 GSE 全调度以太网标准发布
- 岗位画像与成长路径
- 智算网络工程师 / 网络架构师 / 网络智能运维工程师
- 数通 → DC → 智算的三级跳跃
1.3 实验与实操
- 阅读 ODCC《2025 下一代智算 DC 高速互联网络需求白皮书》并输出 1 页摘要
1.4 推荐阅读
- 【报告 R1】信通院《人工智能算力基础设施赋能研究报告(2025年)》(免费下载)
- 【报告 R2】ODCC《2025 下一代智算 DC 高速互联网络需求白皮书》
- 【书 B1】《计算机网络:自顶向下方法》(第 7 版)第 1 章
1.5 思考题
- 为什么智算中心网络被称为"AI 时代的基建"?与 5G 基建有何异同?
- 你所在省份的算力政策文件中,对智算网络有哪些表述?
第一篇 网络基础(复习与深化)
本篇用于巩固 HCIP 数通所学,并补齐 DC/智算所需的深层协议认知。已有 HCIP 基础者可快速过,重点是"从配置到原理"的认知升级。
第 2 章 计算机网络原理精要 ★★★
2.1 学习目标
- 建立从物理层到应用层的完整体系化认知
- 深刻理解"分组交换、排队、拥塞"三大核心机制
- 掌握协议分层与封装解封装思维(后续所有章节的基础)
2.2 正文大纲
- 网络体系结构
- OSI 七层与 TCP/IP 四层模型对照
- 各层 PDU 名称与封装过程
- 应用层
- HTTP/HTTPS、DNS、DHCP 工作原理
- 常见应用的端口与流量特征
- 传输层
- TCP:三次握手、四次挥手、可靠传输、滑动窗口、拥塞控制(慢启动/拥塞避免/快重传/快恢复)
- UDP:无连接特性、适用场景(视频、实时通信、RDMA 数据面)
- 网络层
- IP 编址与子网划分、CIDR、NAT/NAPT
- 路由与转发的基本模型(最长前缀匹配、转发表)
- ICMP 与排障工具
- 数据链路层与物理层
- 以太网帧格式、MAC 地址、VLAN
- 交换机转发原理(MAC 表、泛洪、学习)
- 物理层与光互连概念(为智算大带宽铺垫)
2.3 实验与实操
- Wireshark 抓包分析:TCP 握手、UDP 流、DNS 查询全流程
- eNSP:三层交换、VLAN 间路由、DHCP 中继综合实验
2.4 推荐阅读
- 【书 B1】《计算机网络:自顶向下方法》(第 7 版)第 2~6 章
- 【书 B2】《TCP/IP详解 卷1:协议》(第 2 版)第 1~17 章
- 【书 B3】《图解TCP/IP》(入门对照)
2.5 思考题
- TCP 拥塞控制与 RoCE 无损网络中的 ECN 有何联系?(带着问题进入第 11 章)
- 为什么 UDP 更适合 RDMA 而 TCP 不适合?
第 3 章 路由与交换进阶(HCIP 对接篇) ★★★
3.1 学习目标
- 以"考试 + 原理"双轨完成 HCIP-Datacom 核心内容
- 深度理解 OSPF/BGP/MPLS 的机制而非仅会配置
- 为 EVPN、Segment Routing 打底
3.2 正文大纲
- 动态路由基础
- 路由优先级、度量、路由表与 FIB
- 静态路由与策略路由的适用场景
- OSPF 深度
- 区域设计(骨干区/普通区/特殊区)
- LSA 类型、SPF 计算、邻居状态机
- 网络类型与 DR/BDR
- BGP 深度
- 报文与状态机、路径属性(AS_PATH、MED、Local-Pref)
- 选路原则、路由反射器、联邦
- IBGP/EBGP、BGP 在 DC 中的角色(为 EVPN 铺垫)
- MPLS 基础
- 标签交换原理、LDP、MPLS VPN 模型
- 与 Segment Routing 的传承关系
- 常见故障排查方法论
- 分层排查法、抓包对照法、路由追踪法
3.3 实验与实操
- eNSP 完成 HCIP 全部实验手册(建议 40+ 个实验)
- 综合项目:多区域 OSPF + 跨域 BGP + MPLS VPN 三网合一
3.4 推荐阅读
- 【书 B4】《华为HCIP-Datacom路由交换学习指南》
- 【书 B2】《TCP/IP详解 卷1》第 18~20 章(路由协议补充)
- 【书 B5】《MPLS和VPN体系结构》(Ivan Pepelnjak)
3.5 思考题
- BGP 为什么是 DC 叠加网络(EVPN)的控制面首选?
- MPLS 标签转发与 SRv6 分段路由的异同?
第二篇 数据中心网络(DC)
智算网络的"母体"。本篇是数通向智算跳跃的桥梁,也是 HCIE-DC 的主干内容。
第 4 章 数据中心网络架构 ★★★
4.1 学习目标
- 掌握传统三层架构与 Spine-Leaf(CLOS)架构的对比
- 理解大规模 DC 的冗余与扩展设计原则
- 建立"架构决定性能"的设计思维
4.2 正文大纲
- 传统 DC 三层架构
- 核心-汇聚-接入,STP 时代的问题
- 南北向瓶颈、东西向带宽不足
- Spine-Leaf(CLOS)架构
- 等长路径、无阻塞设计、L2/L3 分界(大 L3 设计)
- 横向扩展(scale-out)vs 纵向扩展(scale-up)
- 关键设计要素
- 扇出比(oversubscription)与带宽规划
- ECMP(等价多路径)负载均衡
- 分区/租户隔离与 VPC 模型
- 服务器接入:ToR 交换机、多网卡 bonding
- 高可用设计
- 设备冗余、链路冗余、网关冗余(VRRP/M-LAG)
- 故障域划分与爆炸半径控制
4.3 实验与实操
- eNSP Pro / EVE-NG:搭建 4 脊 8 叶 Spine-Leaf 拓扑
- 计算题:给定服务器数量与带宽需求,求交换机端口规划
4.4 推荐阅读
- 【书 B6】《Data Center Networks: A Practical Guide》(或华为 CloudFabric 白皮书系列)
- 【书 B1】《计算机网络:自顶向下》第 6 章(链路层复习)
- 【报告 R3】Gartner《2026 数据中心交换机市场指南》(了解市场格局)
4.5 思考题
- Spine-Leaf 中 Leaf 与 Spine 的职责边界在哪里?
- 为什么智算集群普遍采用"大 L3 + ECMP"而不是大二层?
第 5 章 VXLAN 叠加网络 ★★★
5.1 学习目标
- 理解叠加网络(Overlay)与底层网络(Underlay)的分离思想
- 掌握 VXLAN 封装、VTEP、VNI 的核心机制
- 能独立设计 VXLAN 接入方案
5.2 正文大纲
- 叠加网络的动机
- VLAN 4000 上限、大二层需求、租户隔离、虚拟机迁移
- Overlay/Underlay 解耦模型
- VXLAN 协议机制
- 报文封装(MAC-in-UDP)、VNI 标识
- VTEP(VXLAN Tunnel Endpoint)、BUM 泛洪与抑制
- 静态 VXLAN vs 动态 VXLAN
- VXLAN 网关
- L2 网关 / L3 网关 / 分布式网关(Anycast GW)
- 与外部网络互通设计
- VXLAN 与 EVPN 的关系(引出第 6 章)
5.3 实验与实操
- eNSP:静态 VXLAN 二层互通实验
- Wireshark 抓取 VXLAN 报文,解析封装字段(VNI、外层 MAC/IP)
5.4 推荐阅读
- 【书 B6】DC 网络实践指南 VXLAN 章节
- 【书 B2】UDP 封装相关知识复习
- RFC 7348(VXLAN 官方规范,英文原文精读第 1~5 节)
5.5 思考题
- VNI 与 VLAN 的对应关系如何设计才能兼顾扩展与运维?
- 分布式网关相比集中式网关的优势与代价?
第 6 章 BGP-EVPN 控制面 ★★★
6.1 学习目标
- 掌握 EVPN 的核心概念与路由类型
- 理解"控制面与数据面分离"在现代 DC 的实现
- 能配置并排障 BGP-EVPN VXLAN 网络
6.2 正文大纲
- EVPN 概述
- 为什么用 BGP 承载以太网信息(对比传统 MAC 学习)
- MP-BGP、地址族(L2VPN EVPN)
- EVPN 核心路由类型
- Type 1(Ethernet Auto-Discovery)
- Type 2(MAC/IP Advertisement Route)★
- Type 3(Inclusive Multicast Ethernet Tag)
- Type 5(IP Prefix Route)★
- EVPN 关键特性
- MAC/IP 同步、防环、快速收敛
- 分布式网关与 ARP 抑制
- 多租户(VRF + EVPN 实例)模型
- 典型组网与配置
- 华为 CE 系列 EVPN-VXLAN 配置实例
- 常见故障:RT 不匹配、隧道建立失败、MAC 黑洞
6.3 实验与实操
- eNSP:BGP-EVPN + VXLAN 分布式网关完整实验(建议 3 台 VTEP + 2 台 Spine)
- 故障演练:故意配错 RT 值,观察 BGP 邻居与隧道状态并修复
6.4 推荐阅读
- 【书 B6】DC 网络实践指南 EVPN 章节
- 【书 B7】《BGP 设计与实现》(Randy Zhang,EVPN 前 BGP 底子)
- RFC 7432(BGP MPLS-Based Ethernet VPN,精读 Type 2/3/5)
6.5 思考题
- EVPN Type 2 与 Type 5 路由分别解决什么问题?
- 分布式网关下,主机间跨 Leaf 通信的数据路径是怎样的?
第 7 章 Segment Routing(SR) ★★☆
7.1 学习目标
- 理解 SR 的转发模型与 MPLS/SRv6 两种数据面
- 了解 SR 在 DC 与智算网络中的角色(灵活路径、快速重路由)
7.2 正文大纲
- 从 MPLS LDP 到 Segment Routing
- 标签分发方式的改变、IGP 扩展(OSPF/SR、IS-IS/SR)
- 源路由思想:分段列表(Segment List)
- SR-MPLS 基础
- SID(Segment Identifier)、Prefix-SID、Adj-SID
- 隧道建立与转发流程
- SRv6 基础
- IPv6 扩展头、SRH(Segment Routing Header)
- SRv6 与云网融合、网络编程
- SR 在智算/DC 的应用前景
- 灵活路径调度、TE 流量工程、确定性网络
7.3 实验与实操
- eNSP:SR-MPLS 基础实验(IGP 自动分发 SID)
- 阅读 SRv6 网络编程案例(华为官方文档)
7.4 推荐阅读
- 【书 B5】《MPLS和VPN体系结构》MPLS 部分(先修)
- 华为《SRv6 技术白皮书》/ IETF RFC 8402(SR 架构)
7.5 思考题
- SRv6 相比 SR-MPLS 的优势与部署成本?
- 智算网络为什么需要"灵活路径"而不仅仅是 ECMP?
第 8 章 数据中心网络可靠性与运维 ★★☆
8.1 学习目标
- 掌握 BFD、M-LAG、堆叠等可靠性技术
- 建立 DC 运维的监控与变更管理思维
8.2 正文大纲
- 快速检测与收敛
- BFD(双向转发检测)原理与配置
- 与 OSPF/BGP/静态路由联动
- 链路聚合与双活
- LACP、M-LAG(跨设备链路聚合)、堆叠(CSS)
- 双活网关与环路避免
- 运维基础
- 监控指标:CPU/内存/端口流量/丢包/时延
- 日志与告警体系、配置备份与版本管理
- 变更窗口与回滚预案
8.3 实验与实操
- eNSP:M-LAG 双活网关实验;BFD 联动 BGP 快速切换实验
8.4 推荐阅读
- 【书 B6】DC 实践指南可靠性章节
- 华为 CE 系列《配置指南-BFD》《配置指南-M-LAG》
8.5 思考题
- BFD 检测时间与网络负载的关系如何权衡?
- 一次 DC 变更事故的完整复盘流程应该包含哪些环节?
第三篇 无损网络与 RDMA(智算网络的心脏)
本篇是智算网络区别于传统数通的核心分水岭,也是面试中区分"真懂智算"与"概念党"的关键。
第 9 章 RDMA 技术基础 ★★★
9.1 学习目标
- 理解 RDMA 解决的根本问题(CPU 卸载、内核旁路、零拷贝)
- 掌握 InfiniBand / RoCE / iWARP 三种实现与选型
- 理解 RDMA 与 AI 训练的关系
9.2 正文大纲
- 传统网络通信的瓶颈
- 内核协议栈开销、多次拷贝、CPU 中断
- 延迟与吞吐的数学边界
- RDMA 核心机制
- 内核旁路(Kernel Bypass)、零拷贝(Zero-Copy)、CPU 卸载
- Verbs API 模型:QP(Queue Pair)、CQ(Completion Queue)、MR(Memory Region)
- 三大实现对比
- InfiniBand(IB):专用网络,RDMA 原生
- RoCEv1/v2:基于以太网,v2 使用 UDP 封装★
- iWARP:基于 TCP
- 应用场景
- HPC、AI 训练(NCCL 底层)、存储(NVMe-oF)、大数据
9.3 实验与实操
- Linux 双机部署 SoftRoCE(RXE)或真机 RoCE 网卡
- 使用
ib_write_bw/ib_read_lat工具测量带宽与延迟 rdma link、ibstat、ibv_devinfo命令实操
9.4 推荐阅读
- 【书 B8】《InfiniBand Architecture Specification》(IBTA 官方规范,按需查阅)
- 【书 B9】《Handbook of Fiber Optic Data Communication》(第 4 版)RDMA 章节
- NVIDIA 官方《RDMA 技术文档》(docs.nvidia.com,RoCE 章节)
9.5 思考题
- RoCEv2 为什么选择 UDP 封装而不是 TCP?
- 内核旁路带来的好处与安全/管理上的代价是什么?
第 10 章 RoCEv2 协议栈与部署 ★★★
10.1 学习目标
- 掌握 RoCEv2 报文结构、GID/流标(流控)机制
- 能规划并部署一个 RoCEv2 集群网络
10.2 正文大纲
- RoCEv2 报文格式
- 以太头 + IP + UDP(目标端口 4791)+ IB BTH + Payload
- PSN(Packet Sequence Number)、重传机制
- 寻址与路由
- GID(Global ID)/ GRH(Global Routing Header)
- RoCEv2 跨子网路由、VLAN 与 PCP 标记
- 部署要点
- 交换机/网卡/服务器三端配置
- MTU 一致性(建议 9000 Jumbo)、流控开启
- RoCE 流量与普通流量的隔离(专用 VLAN/PFC 队列)
- 常见问题
- 丢包导致性能骤降、流控风暴、队列死锁
10.3 实验与实操
- Wireshark 抓取 RoCEv2 报文(filter:
udp.port == 4791) - 在交换机上配置 RoCE 专用队列与优先级映射
10.4 推荐阅读
- 【书 B9】光通信手册 RoCE 相关章节
- NVIDIA《RoCE 部署指南》(官方,含交换机配置模板)
- 华为 CloudFabric 智算网络解决方案文档
10.5 思考题
- 为什么 RoCE 对丢包极其敏感(0.1% 丢包即大幅掉速)?
- Jumbo MTU 在 RoCE 部署中的必要性是什么?
第 11 章 无损网络拥塞控制 ★★★(本篇最核心)
11.1 学习目标
- 深刻理解 PFC 与 ECN 的原理、优缺点与协同
- 掌握 DCQCN 等端到端拥塞控制算法
- 理解"无损网络"为何需要全链路协同
11.2 正文大纲
- 拥塞的本质与代价
- 传统 TCP 丢包重传 vs RDMA 对丢包的不可容忍
- 拥塞树(Congestion Tree)、HoL 阻塞(Head-of-Line Blocking)
- PFC(Priority-based Flow Control)802.1Qbb
- 按优先级暂停机制、PAUSE 帧
- 优点:链路级无损;缺点:死锁风险、流控风暴、公平性问题
- ECN(Explicit Congestion Notification)802.1Qau
- 标记机制(CE 标记)、与 TCP/DCQCN 联动
- 优点:端到端反馈;缺点:依赖端侧算法
- 经典拥塞控制算法
- DCQCN(RoCE 标配)★、QCN、DCTCP
- 参数调优:K 值、W 值、标记阈值
- 无损网络的工程协同
- 队列设计(无损队列/普通队列隔离)
- 端到端 QoS 映射(PCP/DSCP 映射链)
- 网络级方案:华为 iLossless、无损以太(UEC)的演进
11.3 实验与实操
- 理论实验:用 ns-3 或华为 iMaster NCE 模拟器观察 PFC 暂停帧与 ECN 标记
- 真机实验(有条件时):制造拥塞观察队列深度与流控计数器
- 精读 ODCC《数据中心智能无损网络白皮书》并画原理图
11.4 推荐阅读
- 【报告 R4】ODCC《数据中心智能无损网络白皮书》(必读,中文权威)
- 【报告 R5】ODCC《2025 以太网智算集群互联技术白皮书》
- 【书 B2】《TCP/IP详解》ECN 相关章节(RFC 3168)
- IEEE 802.1Qbb / 802.1Qau 标准原文(按需)
11.5 思考题
- PFC 为什么可能引起"死锁"?如何通过设计避免?
- DCQCN 中 ECN 标记与 PFC 暂停是如何配合工作的?
- 为什么说"无损网络"是全链路(网卡+交换机+协议)协同的结果?
第 12 章 超以太网与新一代智算网络协议 ★★☆
12.1 学习目标
- 了解 UEC(Ultra Ethernet Consortium)的技术方向
- 掌握国内 GSE(全调度以太网)与 FlexLane 的进展
- 建立"标准演进"的长期跟踪能力
12.2 正文大纲
- 为什么需要"超以太网"
- IB 的封闭性 vs 以太网的开放生态
- 以太网在 AI 场景的三大短板(拥塞、时延、规模)
- Ultra Ethernet(UEC)
- 成立背景与成员(AMD、博通、思科、华为等)
- 技术方向:UET(传输层)、改进流控、可扩展性
- 中国方案:GSE 全调度以太网
- 中国移动发布 GSE 全套标准与商用设备
- 逐跳调度 vs 端到端拥塞控制的对比
- FlexLane 弹性通道技术
- 光互联与长距智算
- 无损智算 OTN(HIC-OTN)技术白皮书
- 跨数据中心智算互联(DCI)
12.3 实验与实操
- 跟踪 UEC 官网与 ODCC 白皮书更新,做标准对比表
- 阅读中国移动《云智算新一代网络基础设施白皮书》输出思维导图
12.4 推荐阅读
- 【报告 R6】中国移动《云智算新一代网络基础设施白皮书》
- 【报告 R7】ODCC《2025 下一代智算 DC 高速互联网络需求白皮书》
- UEC 官网技术文档(ultraethernet.org)
12.5 思考题
- GSE 与 UEC 在解决拥塞问题上的思路差异?
- 未来 3 年,智算网络会形成"IB vs 以太网"的何种格局?
第 13 章 存储网络与 NVMe-oF ★★☆
13.1 学习目标
- 理解 AI 数据管线对存储网络的需求
- 掌握 NVMe-oF 与 RDMA 的结合方式
13.2 正文大纲
- 存储网络演进
- FC-SAN → iSCSI → NVMe-oF
- AI 训练中 checkpoint 与数据集加载的带宽压力
- NVMe-oF 基础
- NVMe over Fabrics:RoCE / FC / TCP 三种传输
- 与 RDMA 的结合(NVMe/RDMA)
- 智算存储架构
- 并行文件系统(Lustre/GPFS)与网络的关系
- 存储网络与计算网络的隔离/融合设计
13.3 实验与实操
- 了解
nvme命令行工具与 target 配置(软环境) - 画出"训练集群 + 存储集群"的网络拓扑图
13.4 推荐阅读
- 【书 B9】光通信手册存储章节
- SNIA 官方 NVMe-oF 技术教程(免费在线)
13.5 思考题
- 为什么 checkpoint 写入会成为训练瓶颈?网络如何缓解?
- 存储网络是否需要"无损"?与计算网络的要求有何异同?
第四篇 智算系统与 AI 集群
从"网络"扩展到"系统",理解网络如何服务 AI 训练,这是智算网络工程师区别于普通网工的分水岭。
第 14 章 AI 训练通信模式与集合通信 ★★★
14.1 学习目标
- 理解分布式训练的基本范式与通信模式
- 掌握 NCCL/RCCL 集合通信与网络负载的关系
- 能根据通信模式反推网络设计需求
14.2 正文大纲
- 分布式训练基础
- 数据并行 / 模型并行 / 张量并行 / 流水线并行
- PS 架构(参数服务器)vs All-Reduce 架构
- 集合通信原语
- AllReduce(全归约)★、AllGather、AlltoAll、ReduceScatter
- 环形(Ring)与树形(Tree)算法、通信量计算
- NCCL 与 RCCL
- NCCL(英伟达)/ RCCL(昇腾)的角色
- 通信库对网络的要求:低延迟、高带宽、无丢包
- 通信与网络设计的映射
- 大模型训练 → 东西向流量爆发的量化
- 网络拓扑(Fat-Tree/3D-Torus)与通信效率
14.3 实验与实操
- 阅读《Megatron-LM》/《DeepSeek》技术报告中的并行策略章节
- 计算题:8 卡 / 64 卡 AllReduce 的理论通信时间
14.4 推荐阅读
- 【书 B10】《高性能计算导论》相关章节(并行编程模型)
- NVIDIA NCCL 官方文档(docs.nvidia.com/deeplearning/nccl)
- 华为昇腾社区 RCCL 文档
14.5 思考题
- 为什么 AllReduce 在 Ring 算法下与节点数几乎无关?
- 模型并行相比数据并行对网络延迟更敏感还是更不敏感?
第 15 章 GPU 集群与算力网络架构 ★★★
15.1 学习目标
- 掌握 NVIDIA Spectrum-X 与昇腾集群的组网架构
- 理解 Scale-up(机内互联)与 Scale-out(机间互联)
- 了解 DPU/智能网卡的卸载能力
15.2 正文大纲
- Scale-up 与 Scale-out
- 机内:NVLink / 昇腾 HCCS 高速互联
- 机间:RoCE/IB 网络(Scale-out Fabric)
- NVIDIA 方案
- Spectrum-X:Spectrum 交换机 + BlueField DPU + DOCA
- 拥塞控制增强(Adaptive Routing、Per-Packet 动态路由)
- 参考架构:8 卡节点 → 数千卡集群的组网
- 华为昇腾方案
- 昇腾 910 集群、HCCS/HCCL、CloudFabric 智算网络
- 与国产化政策的衔接
- DPU / 智能网卡
- 网络卸载:OVS 卸载、RDMA 卸载、安全卸载
- 裸金属与虚拟化的网络一致性
15.3 实验与实操
- 云 GPU 实例(按小时租用)搭建 2~4 卡训练环境,跑通 NCCL 测试(
all_reduce_perf) - 阅读 NVIDIA《Spectrum-X Networking Platform Administration》官方培训教材并做笔记(免费获取)
15.4 推荐阅读
- 【书 B11】NVIDIA《Spectrum-X 管理教材》(官方免费)
- 【书 B12】华为《昇腾 AI 集群网络》系列资料
- 【报告 R6】中国移动云智算白皮书(架构章节)
15.5 思考题
- Scale-up 与 Scale-out 的边界由什么决定?
- DPU 卸载对网络运维(可观测性、排障)带来了哪些新挑战?
第 16 章 智算中心网络设计 ★★★
16.1 学习目标
- 能独立完成一个千卡级智算集群的网络设计
- 掌握带宽规划、拓扑选型、分区设计的方法论
16.2 正文大纲
- 需求分析
- 训练/推理/存储流量占比测算
- 故障容忍度与服务等级约定(SLA)
- 拓扑设计
- Fat-Tree(Clos 扩展)、Dragonfly、3D-Torus 对比
- 脊叶规模计算:给定 GPU 数量求端口数
- 带宽规划
- 收敛比设计(1:1 无收敛 vs 3:1)
- 400G/800G/1.6T 演进路线(智研咨询报告显示已进入 800G/1.6T 周期)
- 分区与隔离
- 计算/存储/管理三网分离
- 多租户与安全域设计
- 部署与验收
- 验收标准:带宽/时延/丢包基线、性能测试方法
16.3 实验与实操
- 课程设计:设计一个 1024 卡 GPU 集群的网络方案(含拓扑图、端口清单、预算表)
- 用 Excel/在线工具计算带宽需求并形成设计文档
16.4 推荐阅读
- 【书 B6】DC 实践指南架构章节(先修)
- 【报告 R2/R7】ODCC 智算 DC 高速互联需求白皮书
- 智研咨询《中国数据中心交换机行业报告》(市场与技术趋势)
16.5 思考题
- 无收敛(1:1)网络在 1024 卡集群中的成本是多少?是否值得?
- 训练任务对网络的"长尾时延"为何比"平均时延"更敏感?
第 17 章 智算网络调优与排障 ★★★
17.1 学习目标
- 掌握智算网络性能基线与瓶颈定位方法
- 能处理"训练慢"类问题的完整排查流程
17.2 正文大纲
- 性能基线
- 带宽测试(iperf3/ib_write_bw)、时延测试
- NCCL 测试与训练框架实测(Megatron 吞吐)
- 丢包与拥塞定位
- 网卡侧:
ethtool -S、RDMA 计数器、rdma statistic - 交换机侧:队列深度、PFC 暂停帧计数、ECN 标记计数
- 端到端:
ucx_perftest、nvidia-smi通信利用率
- 网卡侧:
- 常见问题库
- MTU/流控配置不一致、VLAN/PFC 优先级映射错误
- 网卡固件与驱动版本、DPU 配置
- 训练框架通信配置(NCCL 环境变量调优)
- 调优方法论
- 单点隔离法、二分定位法、对照实验法
- 输出标准排障报告模板
17.3 实验与实操
- 搭建"故障工单"演练:给出 5 个预置故障场景,逐一定位修复
- 编写一份《智算网络排障手册》(个人知识库)
17.4 推荐阅读
- 【书 B11】Spectrum-X 管理教材(监控与排障章节)
- NVIDIA 官方《RoCE 排障指南》
- 华为《CloudFabric 智算网络运维指南》
17.5 思考题
- 训练性能下降时,如何快速判断瓶颈在网络还是计算?
- PFC 暂停帧计数持续增长意味着什么?该如何处理?
第五篇 自动化与智能运维
贯穿全程的并行线。智算网络的规模决定了"手工运维"不可行,自动化是护城河。
第 18 章 网络自动化基础(Python 实战) ★★★
18.1 学习目标
- 用 Python 独立完成网络设备的批量操作与巡检
- 掌握 Netmiko/Nornir/Ansible 三件套
18.2 正文大纲
- Python 必备基础
- 数据类型、函数、文件、异常、正则表达式
- 面向对象入门(为 Netmiko 源码阅读铺垫)
- Netmiko
- SSH 连接管理、命令下发、回显解析
- 批量备份配置脚本实战
- Nornir
- 并行任务框架、Inventory 模型
- 全网络巡检与配置一致性检查
- Ansible
- Playbook 语法、华为模块(
community.network/华为官方集合) - 配置模板化(Jinja2)与滚动变更
- Playbook 语法、华为模块(
18.3 实验与实操
- 项目:编写"自动巡检 + 告警"脚本(连接 eNSP 桥接或真机),输出 Excel 报告
- 项目:Ansible 批量下发 30 台交换机的基础配置
18.4 推荐阅读
- 【书 B13】《Python编程:从入门到实践》(Eric Matthes)
- 【书 B14】《网络自动化运维实战》(Netmiko/Nornir)
- 【书 B15】《Network Programmability and Automation》(O’Reilly)
18.5 思考题
- Netmiko(SSH 命令行)与 NETCONF 的本质区别?
- 自动化脚本在"变更事故"场景下如何做安全控制(灰度/回滚)?
第 19 章 网络可编程性(NETCONF/YANG/gNMI) ★★★
19.1 学习目标
- 理解结构化网络管理与传统 CLI 的差异
- 掌握 NETCONF/YANG 的基本操作与 gNMI/Telemetry
19.2 正文大纲
- NETCONF 协议
- 会话与操作(get/get-config/edit-config)、能力协商
- YANG 数据建模
- 模块结构、容器/列表/叶子
- 与 JSON/XML 编码的对应
- RESTCONF 与 gNMI
- RESTful 接口、gNMI Subscribe(流式遥测)
- Telemetry 遥测
- 推模式 vs 拉模式
- 华为 gRPC 遥测与 Prometheus 对接
19.3 实验与实操
- 用
yangson/ncclient(Python)对模拟器执行 NETCONF 查询 - 搭建 Prometheus + Grafana 监控交换机指标
19.4 推荐阅读
- RFC 6241(NETCONF)、RFC 7950(YANG 1.1)
- 【书 B15】可编程性章节
- 华为《YANG 模型开发指南》(官方文档)
19.5 思考题
- Telemetry 相比 SNMP 轮询的优势?
- 为什么说 YANG 是网络设备的"数据库 Schema"?
第 20 章 监控与智能运维(AIOps) ★★☆
20.1 学习目标
- 掌握监控体系搭建与告警收敛
- 了解 AIOps 在智算网络的应用方向
20.2 正文大纲
- 监控体系设计
- 指标(Metrics)/日志(Logs)/追踪(Traces)三支柱
- Prometheus + Grafana + Loki/ELK 组合
- 告警管理
- 告警分级、抑制、收敛、值班闭环
- 告警与自动化联动(自愈脚本)
- AIOps 基础
- 异常检测(时序)、根因分析(RCA)
- 智能运维在智算集群的实践(信通院报告中"智能运维"章节)
20.3 实验与实操
- 搭建一套监控大屏:交换机 + 服务器指标可视化
- 设计一个"告警 → 自动重启/切换"的自愈流程(模拟)
20.4 推荐阅读
- 【报告 R1】信通院报告智能运维章节
- 《Site Reliability Engineering》(Google SRE 中文版,可选)
- 中国通信企业协会《智能网络运维工程师》课程大纲(官方通知)
20.5 思考题
- 告警风暴的根因与收敛手段有哪些?
- AIOps 能替代网络工程师的哪些工作?不能替代什么?
第 21 章 云原生网络(K8s CNI) ★★☆
21.1 学习目标
- 理解容器网络模型与 CNI 插件
- 了解云原生网络与智算调度的关系
21.2 正文大纲
- Kubernetes 网络模型
- Pod 网络、Service 与 kube-proxy、DNS
- CNI 规范与常见插件(Flannel/Calico/Cilium)
- 多网卡与 SR-IOV
- 智算场景的专用网卡(RDMA 网卡进 Pod)
- SR-IOV/DPDK 与 RDMA 虚拟化
- 智算调度中的网络
- 拓扑感知调度(NCCL 拓扑匹配)
- Volcano/KubeFlow 与网络协同
21.3 实验与实操
- 本地 K8s(k3s/minikube)安装 Calico,观察网络策略生效
- 阅读"RDMA 网卡 + SR-IOV + Pod"的部署文档
21.4 推荐阅读
- 【书 B16】《Kubernetes 权威指南》(CNI 章节)
- Cilium/Calico 官方文档
21.5 思考题
- Pod 网络与物理网络如何衔接?NodePort/LoadBalancer 的数据路径?
- 为什么大模型训练集群要用"专用网络"而不是默认 Pod 网络?
第六篇 认证、项目与就业
第 22 章 认证体系对标 ★★☆
22.1 学习目标
- 明确 HCIE-DC 与 NCP-AIN 的考试结构与备考策略
- 制定与学业时间线匹配的认证计划
22.2 正文大纲
- 华为认证路线
- HCIE-Data Center:笔试 + 实验 + 面试
- 华为 HCSP-Presales-Data Center(售前方向,可选)
- 备考资源:官方培训教材(HCIE-DC V2.0 教材)
- NVIDIA 认证路线
- NCP-AIN(AI Networking Professional)结构:Spectrum-X、BlueField、RoCE、SONiC
- 免费官方培训 + 模拟考试(NVIDIA 官方、Spectrum-X 公开课)
- 备考策略
- 认证与课程进度的对应关系表
- 刷题节奏与实验验证结合
22.3 实验与实操
- 下载 NCP-AIN 官方考试大纲,逐条对照本大纲打勾
- 参加华为 ICT 大赛(数通/云赛道)作为实战练兵
22.4 推荐阅读
- 【书 B11】Spectrum-X 官方教材(NCP-AIN 核心)
- 【书 B17】《华为HCIP-Datacom路由交换学习指南》(数通底座复习)
22.5 思考题
- HCIE-DC 与 NCP-AIN 的含金量与就业场景差异?
- 认证在简历中的定位:敲门砖还是能力证明?
第 23 章 实验环境与项目实践 ★★★
23.1 学习目标
- 搭建可持续演进的个人实验环境
- 产出 3 个可写进简历的完整项目
23.2 正文大纲
- 环境选型
- 免费层:eNSP / EVE-NG / GNS3(网络模拟)
- 云层:华为云免费实验、云 GPU 按小时(训练验证)
- 真机层:二手设备(可选)、学校实验室
- 项目库设计(简历级)
- 项目 1:HCIP 综合园区网(已具备)
- 项目 2:Spine-Leaf + EVPN-VXLAN 数据中心(模拟器)
- 项目 3:网络自动化巡检系统(Python + 报告)
- 项目 4:智算集群网络方案设计(千卡级设计文档)
- 项目 5:RoCE 性能测试与调优报告(云 GPU)
- 知识沉淀
- GitHub 仓库结构、文档规范、排障笔记模板
23.3 实验与实操
- 本周任务:初始化 GitHub 仓库 + 完成项目 2 的拓扑设计
23.4 推荐阅读
- 【书 B14】自动化项目章节(项目参照)
- 华为 eNSP 官方实验手册(HCIA-Datacom 实验指南)
23.5 思考题
- 简历项目如何体现"从配置到设计"的进阶?
- 模拟器实验与真机实验的差距在哪里?如何弥补?
第 24 章 求职与职业发展 ★☆☆
24.1 学习目标
- 明确目标岗位画像与简历策略
- 建立 5 年职业发展路径
24.2 正文大纲
- 目标岗位画像
- 智算中心网络工程师 / 网络架构师 / 网络智能运维工程师
- 云厂商 DC 网络工程师、运营商算力网络工程师
- 简历与面试
- 项目叙述的 STAR 法则
- 高频面试题清单(BGP/EVPN/PFC/ECN/NCCL)
- 谈薪与城市选择(一线/新一线智算产业聚集区)
- 职业发展路径
- 0-2 年:运维/实施(打基础)
- 2-5 年:方案设计/架构(形成体系)
- 5 年+:架构师/团队负责人/专家
- 持续跟踪:UEC、GSE、信通院年度报告
24.3 实验与实操
- 写一版简历,用本大纲的章节标题作为技能树自查清单
24.4 推荐阅读
- 【报告 R1】信通院报告(产业趋势用于面试)
- 【报告 R3】Gartner 市场指南(市场格局)
24.5 思考题
- 你的差异化竞争力是什么?(HCIP 数通 + 自动化 + 智算认知?)
- 如果 2028 年智算网络岗位竞争加剧,你的第二技能是什么?
附录
附录 A 总书单(按优先级分级)
A 级(必读精读)
| 编号 | 书名 | 作者/出版 | 对应章节 |
|---|---|---|---|
| B1 | 《计算机网络:自顶向下方法》(第 7 版) | Kurose/Ross,机械工业出版社 | 第 2、4 章 |
| B2 | 《TCP/IP详解 卷1:协议》(第 2 版) | Kevin Fall 等,机械工业出版社 | 第 2、3、11 章 |
| B3 | 《图解TCP/IP》(第 5 版) | 竹下隆史,人民邮电出版社 | 第 2 章 |
| B4 | 《华为HCIP-Datacom路由交换学习指南》 | 华为技术认证教材 | 第 3 章 |
| B5 | 《MPLS和VPN体系结构》 | Ivan Pepelnjak,人民邮电出版社 | 第 3、7 章 |
| B6 | 《Data Center Networks: A Practical Guide》 | 华为 CloudFabric 白皮书系列 | 第 4、5、6、8、16 章 |
| B7 | 《BGP 设计与实现》 | Randy Zhang,人民邮电出版社 | 第 6 章 |
| B8 | 《InfiniBand Architecture Specification》 | IBTA 官方规范 | 第 9 章 |
| B9 | 《Handbook of Fiber Optic Data Communication》(第 4 版) | Casimer DeCusatis,Elsevier | 第 9、10、13 章 |
| B10 | 《高性能计算导论》 | 相关经典教材(任选) | 第 14 章 |
| B11 | NVIDIA《Spectrum-X Networking Platform Administration》 | NVIDIA 官方(免费) | 第 15、17、22 章 |
| B12 | 华为《昇腾 AI 集群网络》系列资料 | 华为官方文档 | 第 15 章 |
| B13 | 《Python编程:从入门到实践》 | Eric Matthes,人民邮电出版社 | 第 18 章 |
| B14 | 《网络自动化运维实战》 | 相关实战教材(Netmiko/Nornir) | 第 18 章 |
| B15 | 《Network Programmability and Automation》 | O’Reilly | 第 18、19 章 |
| B16 | 《Kubernetes 权威指南》 | 闫健勇等,电子工业出版社 | 第 21 章 |
B 级(选读参考)
- 《华为HCIA-Datacom认证实验指南》(打底实验)
- 《路由与交换技术教程——基于eNSP的网络设备配置》(北邮社)
- 《Site Reliability Engineering》(Google SRE)
- 《深入理解Kubernetes》
- 《软件定义网络:SDN 与 OpenFlow 解析》
附录 B 权威报告与白皮书索引
| 编号 | 报告 | 机构 | 用途 |
|---|---|---|---|
| R1 | 《人工智能算力基础设施赋能研究报告(2025年)》 | 中国信通院 | 产业背景、市场规模、智能运维 |
| R2 | 《2025 下一代智算 DC 高速互联网络需求白皮书》 | ODCC | 需求与技术方向 |
| R3 | 《2026 数据中心交换机市场指南》 | Gartner | 市场格局 |
| R4 | 《数据中心智能无损网络白皮书》 | ODCC | 无损网络核心 |
| R5 | 《2025 以太网智算集群互联技术白皮书》 | ODCC | 智算互联技术 |
| R6 | 《云智算新一代网络基础设施白皮书》 | 中国移动 | 运营商方案、GSE |
| R7 | 《无损智算OTN(HIC-OTN)技术白皮书》 | 行业联盟 | 长距智算互联 |
| R8 | 《算力基础设施高质量发展行动计划》 | 工信部等六部门 | 政策与时间表 |
| R9 | 《算力互联互通行动计划》 | 工信部 | 政策方向 |
| R10 | 《中国数据中心交换机行业发展报告》 | 智研咨询 | 800G/1.6T 演进 |
附录 C 工具与命令速查
- 网络模拟:eNSP、eNSP Pro、EVE-NG、GNS3
- 抓包分析:Wireshark(RoCE filter:
udp.port == 4791) - 性能测试:iperf3、ib_write_bw、ib_read_lat、ucx_perftest
- RDMA 管理:
ibstat、ibv_devinfo、rdma link、ethtool -S - 自动化:Python、Netmiko、Nornir、Ansible、ncclient
- 监控:Prometheus、Grafana、Loki
- 容器:k3s/minikube、Calico/Cilium
- 云资源:华为云免费实验、云 GPU 按小时租用
附录 D 术语表(节选)
| 术语 | 全称/含义 |
|---|---|
| RDMA | Remote Direct Memory Access,远程直接内存访问 |
| RoCE | RDMA over Converged Ethernet,基于融合以太网的 RDMA |
| PFC | Priority-based Flow Control,基于优先级的流控(802.1Qbb) |
| ECN | Explicit Congestion Notification,显式拥塞通知(802.1Qau) |
| DCQCN | Data Center Quantized Congestion Notification |
| VXLAN | Virtual eXtensible LAN,虚拟可扩展局域网 |
| EVPN | Ethernet VPN,以太网 VPN(BGP 承载) |
| VTEP | VXLAN Tunnel End Point |
| VNI | VXLAN Network Identifier |
| SR | Segment Routing(SR-MPLS/SRv6) |
| NCCL | NVIDIA Collective Communications Library |
| RCCL | 华为集合通信库(昇腾) |
| Scale-up | 机内扩展(NVLink/HCCS) |
| Scale-out | 机间扩展(网络互联) |
| DPU | Data Processing Unit,数据处理单元 |
| GSE | 全调度以太网(中国移动) |
| UEC | Ultra Ethernet Consortium,超以太网联盟 |
| NVMe-oF | NVMe over Fabrics |
| Telemetry | 遥测(推模式监控) |
| AIOps | 智能运维(AI for IT Operations) |
附录 E 学习进度追踪表
| 章节 | 核心程度 | 计划完成日期 | 实际完成 | 要点笔记(3 条) |
|---|---|---|---|---|
| 第 1 章 导论 | ★★☆ | |||
| 第 2 章 网络原理 | ★★★ | |||
| 第 3 章 路由交换进阶 | ★★★ | |||
| 第 4 章 DC 架构 | ★★★ | |||
| 第 5 章 VXLAN | ★★★ | |||
| 第 6 章 BGP-EVPN | ★★★ | |||
| 第 7 章 SR | ★★☆ | |||
| 第 8 章 可靠性运维 | ★★☆ | |||
| 第 9 章 RDMA 基础 | ★★★ | |||
| 第 10 章 RoCEv2 | ★★★ | |||
| 第 11 章 无损拥塞控制 | ★★★ | |||
| 第 12 章 超以太网/GSE | ★★☆ | |||
| 第 13 章 存储网络 | ★★☆ | |||
| 第 14 章 集合通信 | ★★★ | |||
| 第 15 章 集群架构 | ★★★ | |||
| 第 16 章 智算网络设计 | ★★★ | |||
| 第 17 章 调优排障 | ★★★ | |||
| 第 18 章 自动化基础 | ★★★ | |||
| 第 19 章 可编程性 | ★★★ | |||
| 第 20 章 AIOps | ★★☆ | |||
| 第 21 章 云原生网络 | ★★☆ | |||
| 第 22 章 认证对标 | ★★☆ | |||
| 第 23 章 实验与项目 | ★★★ | |||
| 第 24 章 求职发展 | ★☆☆ |
版本记录
- v1.0(本版):初版发布。依据信通院/工信部/ODCC/Cisco/NVIDIA 公开资料编撰,书单映射完整,适配大二-专升本-本科毕业三年半周期。
- 后续建议:每学期更新一次,同步 UEC/GSE 标准进展与信通院年度报告数据。
- 欢迎交流学习,以上内容按本人情况调整
更多推荐

所有评论(0)