Qwen25大模型微调实战系列

LLM线上监控指标

大模型(LLM, Large Language Model)推理服务的生产环境中,核心监测指标需覆盖 性能、资源、服务质量、成本和稳定性 五大维度。以下是经过工业实践验证的关键指标清单,适用于如 vLLM、TGI、TensorRT-LLM 或自研推理引擎等部署场景。

  高效的大模型服务 = 用最低的资源成本,在稳定延迟下提供最高吞吐。


1.1 GPU资源

  • 核心观测指标 SM Utilization:算力使用率,关注avg指标即可;
  • 核心观测指标 Occupancy:warp 利用率,反映并行效率,关注avg指标即可;
  • PCIe:网络通讯速度(Mb/s);
  • NvLink:多张卡卡间通信速度(Gb/s);

1.2 内存瓶颈

  • GPU KV Cache Usage:KV Cache 显存占用(%),长文本推理瓶颈;

1.3 系统吞吐

  • QPS(Queries Per Second):每秒处理的请求数(req/s);
  • TPS(Tokens Per Second):每秒生成/处理的 token 数(token/s);

1.4 服务质量

  • 核心观测指标 E2E Request Latency:端到端请求延迟,即完整生成响应的总耗时,包含从发出请求到生成响应的整个过程,关注avg指标即可;
  • TTFT(Time To First Token):首Token延迟,即从请求发出到收到第一个输出 token 的时间;
  • Token Throughput:请求token量(token/s);

1.5 资源成本

  • TPM:Token Per Minute,每分钟处理的token数量。

DONE

更多推荐