作者​:昇腾实战派
知识地图​:https://blog.csdn.net/Lumos_Lovegood/article/details/161601003

背景概述

采用Atlas 800I A2(8*64G)服务器进行双机部署时,若ranktable配置不当,可能导致通信组创建失败,进而引发推理服务无法启动的问题。本文结合一次典型故障案例,系统梳理问题现象、根因分析及解决方案,为开发者提供可复用的部署实践参考。

问题现象

在使用MindIE 2.3版本部署DeepSeek-V3/R1模型时,双机环境下启动服务报错:

[RankableCheck] The IP address in the rankable is inconsistent with the IP address of the network adapter

日志显示HCCL通信初始化失败,服务无法正常启动。该问题仅出现在特定节点组合中,且在单机部署时正常。
image

根因分析

  1. 排查网络连通性
    确认两台服务器间NPU网卡可互相ping通,网络层无异常。
  2. 检查NPU网卡IP与网关信息
    通过hccn\_tool工具分别查询各NPU设备的IP地址与网关地址:
   for i in {0..7}; do hccn\_tool -i $i -ip -g; done

image

   for i in {0..7}; do hccn\_tool -i $i -gateway -g; done

image
对比发现:ranktable文件中配置的device\_ip字段使用的是网关地址,而NPU实际绑定的网卡IP为另一地址,存在不一致。

问题根因

ranktable文件中device\_ip参数错误地填写了网关IP,而非NPU网卡的真实IP地址。由于HCCL通信依赖于NPU设备间基于真实网卡IP的直连通信,使用网关地址会导致通信路径错误,从而触发RankableCheck校验失败。

解决措施

  1. 修正ranktable文件配置
    打开各节点的ranktable文件,将device\_ip字段更新为对应NPU网卡的实际IP地址(非网关地址)。

    示例配置片段:

   {
     "device\_id": 0,
     "device\_ip": "192.168.1.101",
     "rank\_id": 0
   }
  1. 验证配置一致性
    确保双机中所有节点的ranktable文件中device\_iphccn\_tool查询结果完全一致。
  2. 重启服务验证
    重新启动MindIE推理服务,观察日志,确认HCCL通信成功,模型加载与推理流程正常。

建议与总结

  • 配置规范:在多机部署中,ranktable文件的device\_ip必须为NPU网卡的物理IP地址,严禁使用网关或管理IP。
  • 部署前检查:建议在部署前执行以下命令,快速核对IP配置:
  for i in {0..7}; do echo "NPU $i IP: $(hccn\_tool -i $i -ip -g)"; done
  • 参考文档:部署DeepSeek-V3/R1模型时,建议参考《DeepSeekV3推理部署指南》中的通信配置章节,确保环境一致性。

更多推荐