一、背景

对大多数开发来说,只要知道/v1/chat/completions就可以了,但对于运维来说,这个是不够的,运维上如果要做模型的高可用部署(即部署多个节点,然后做负载均衡)一般需要health接口,代理层(例如apisix)可以做主动检查,自动将异常节点下掉。同时,运维也要做性能监控,接入promethus。那这些vllm是否支持呢,这就要看vllm有哪些接口了

二、vllm接口

1. 模型信息

GET/v1/models

{
  "object": "list",
  "data": [
    {
      "id": "your-model-name",
      "object": "model",
      "created": 1700000000,
      "owned_by": "vllm"
    }
  ]
}

2. 聊天补全(Chat Completion)

POST /v1/chat/completions

用于对话式生成(类似 gpt-3.5-turbo 的格式)。

支持 messages、temperature、max_tokens、stream(SSE 流式响应)、logprobs 等参数。

示例请求体:

{
  "model": "your-model",
  "messages": [{"role": "user", "content": "Hello!"}],
  "stream": false
}

3.文本补全(Text Completion)

POST /v1/completions

传统 prompt-based 生成(类似 text-davinci-003)。

注意:vLLM 官方推荐使用 /chat/completions,/completions 可能在未来移除。

仅支持单个 prompt 字符串

4. 嵌入(Embeddings)(需模型支持)

POST /v1/embeddings

生成文本向量嵌入(仅当加载的是 embedding 模型时有效,如 BAAI/bge-*)。

vLLM 从 0.4.0+ 开始实验性支持 embedding 模型。

若加载的是 LLM(如 Llama、Qwen),此接口会报错

5. Prometheus 指标接口

GET /metrics

返回模型的各种指标数据,可以接入prometheus

6. Health检测接口

GET /health

接口没数据返回,但可以通过http的状态码检测模型是否正常

三、大模型学习推荐

阿里云百炼平台提供了7000万的免费token,想学习agent开发的可以试一下

阿里云https://www.aliyun.com/minisite/goods?userCode=nz4rlhu7

Logo

免费领 150 小时云算力,进群参与显卡、AI PC 幸运抽奖

更多推荐