在 2026 世界人工智能大会(WAIC)上,华为展示了其最新的算力基础设施核心成果,重点聚焦于Atlas 950 SuperPoD 超节点系统,而非单独展示孤立的“计算刀片”。该系统代表了从单卡性能比拼向系统级协同竞争的架构转变 。以下是关于华为 NPU与 CPU 计算单元在该系统中的具体形态、架构逻辑及技术特征的详细解析。

1. 核心架构:Atlas 950 SuperPoD 超节点

华为在 WAIC 2026 展出的核心展品为Atlas 950 SuperPoD,这是一个集成了 8192 张昇腾(Ascend)NPU 卡的超大规模集群系统 。在此架构下,传统的独立刀片概念被升级为系统级的“超节点”设计,旨在解决万卡集群下的通信瓶颈和能效问题 。

特性维度 NPU 计算单元 (昇腾 Ascend) CPU 计算单元 (鲲鹏 Kunpeng) 系统级协同特征
核心角色 AI 训练与推理的主力算力,负责矩阵运算和张量处理 。 负责通用逻辑控制、数据预处理、任务调度及操作系统运行 。 通过 UB-Mesh 高速互联技术实现 NPU 与 CPU 间的低延迟数据交换 。
部署规模 单超节点集成高达 8192 卡,支持万卡集群线性加速比 。 按配比部署,通常作为管理节点或数据加载节点嵌入超节点架构中。 采用系统级架构替代单卡堆叠,显著提升算力利用率并降低单 Token 成本 。
互联技术 依托昇腾专有高速互联协议,支持多维集合通信。 通过 PCIe 或专用总线与 NPU集群紧密耦合。 引入光互连技术替代传统电信号,突破存储墙与通信带宽瓶颈 。
应用场景 原生多模态大模型训练(如 MiniMax M3 等模型的底层支撑)。 运行 Agent 操作系统(如阶跃 Agent OS)及具身智能控制逻辑 。 支撑从“工具型 AI"向具备任务规划能力的"Agent 操作系统”转型 。

2. 技术逻辑与代码示例

在 Atlas 950 SuperPoD 架构中,NPU 与 CPU 的协同不再依赖简单的进程间通信,而是通过底层的资源池化和统一调度实现。以下代码示例展示了在华为昇腾 CANN(Compute Architecture for Neural Networks)软件栈中,如何通过 Python 接口调用 NPU 资源并进行 CPU-NPU 协同的任务分发逻辑。

# 华为昇腾 CANN 架构下的 CPU-NPU 协同任务调度示例
# 环境要求:Ascend CANN Toolkit, PyTorch with Ascend backend

import torch
import torch_npu  # 导入昇腾后端支持
from torch_npu.contrib import transfer_to_npu  # 自动触发设备注册

def run_hybrid_computation(data_input, model_weights):
    """
    执行 CPU 预处理与 NPU 核心计算的协同流程对应 Atlas 950 SuperPoD 中的异构计算逻辑
    """
    
    # 1. CPU 阶段:数据预处理与逻辑控制
    # 在鲲鹏 CPU 上进行复杂的数据清洗、解码及任务路由
    print("[CPU] 开始数据预处理与任务调度...")
    processed_data = data_preprocessing_on_cpu(data_input)
    
    # 2. 内存迁移:CPU 到 NPU 的零拷贝或高速传输
    # 利用 UB-Mesh 互联技术降低数据传输延迟
    device = torch.device("npu:0")  # 指定昇腾 NPU 设备
    npu_data = processed_data.to(device, non_blocking=True)
    npu_weights = model_weights.to(device, non_blocking=True)
    
    # 3. NPU 阶段:核心矩阵运算
    # 在昇腾950 NPU 上执行大模型推理或训练步骤
    print("[NPU] 启动昇腾 950 核心计算引擎...")
    with torch.npu.stream(torch.npu.default_stream()):
        output = execute_model_forward(npu_data, npu_weights)
    
    # 4. 结果回传:NPU 到 CPU
    # 将计算结果返回至 CPU 进行后续业务逻辑处理或 Agent 决策
    final_result = output.cpu()
    print("[CPU] 接收计算结果并生成 Agent 响应...")
    
    return final_result

def data_preprocessing_on_cpu(raw_data):
    """模拟 CPU 端的数据清洗逻辑"""
    # 实际场景中包含图像解码、Tokenization 等操作
    return raw_data.float() / 255.0

def execute_model_forward(inputs, weights):
    """模拟 NPU 端的矩阵乘法核心算子"""
    # 调用昇腾优化的算子库
    return torch.matmul(inputs, weights)

# 主程序入口
if __name__ == "__main__":
    # 模拟输入数据
    dummy_input = torch.randn(1024, 1024)
    dummy_weights = torch.randn(1024, 1024)
    
    # 执行协同计算
    result = run_hybrid_computation(dummy_input, dummy_weights)
    print(f"计算完成,输出维度:{result.shape}")

3. 关键创新点解析

  • 系统级重构:2026 WAIC 展示的 Atlas 950 标志着算力竞争从单芯片参数转向系统级架构。通过 SuperPoD 设计,华为实现了 8192 卡规模的无缝协同,解决了传统刀片服务器在万卡集群中常见的通信效率低下问题 。
  • 光互连与液冷:为了支撑如此高密度的 NPU 和 CPU 刀片运行,系统采用了光互连技术替代传统电信号传输,大幅降低了功耗和延迟;同时结合液冷散热方案,实现了低 PUE(能源使用效率)运行,符合绿色智算中心的趋势 。
  • 软硬一体化闭环:该硬件架构直接服务于国产大模型与 Agent 生态。例如,阶跃星辰的 Agent OS 和华为自身的盘古大模型均基于此底座运行,实现了从底层算力(NPU/CPU)到上层应用(Agent/具身智能)的全栈国产化闭环 。

综上所述,2026 WAIC 上的华为展品并非单纯的“刀片”硬件展示,而是以Atlas 950 SuperPoD为载体,呈现了高密度昇腾 NPU 与鲲鹏 CPU 深度融合的系统级算力解决方案,旨在为大模型训练、推理及具身智能应用提供高性能、低成本的国产算力底座 。


参考来源

 

更多推荐