推理框架vllm有哪些接口
一、背景
对大多数开发来说,只要知道/v1/chat/completions就可以了,但对于运维来说,这个是不够的,运维上如果要做模型的高可用部署(即部署多个节点,然后做负载均衡)一般需要health接口,代理层(例如apisix)可以做主动检查,自动将异常节点下掉。同时,运维也要做性能监控,接入promethus。那这些vllm是否支持呢,这就要看vllm有哪些接口了
二、vllm接口
1. 模型信息
GET/v1/models
{
"object": "list",
"data": [
{
"id": "your-model-name",
"object": "model",
"created": 1700000000,
"owned_by": "vllm"
}
]
}
2. 聊天补全(Chat Completion)
POST /v1/chat/completions
用于对话式生成(类似 gpt-3.5-turbo 的格式)。
支持 messages、temperature、max_tokens、stream(SSE 流式响应)、logprobs 等参数。
示例请求体:
{
"model": "your-model",
"messages": [{"role": "user", "content": "Hello!"}],
"stream": false
}
3.文本补全(Text Completion)
POST /v1/completions
传统 prompt-based 生成(类似 text-davinci-003)。
注意:vLLM 官方推荐使用 /chat/completions,/completions 可能在未来移除。
仅支持单个 prompt 字符串
4. 嵌入(Embeddings)(需模型支持)
POST /v1/embeddings
生成文本向量嵌入(仅当加载的是 embedding 模型时有效,如 BAAI/bge-*)。
vLLM 从 0.4.0+ 开始实验性支持 embedding 模型。
若加载的是 LLM(如 Llama、Qwen),此接口会报错
5. Prometheus 指标接口
GET /metrics
返回模型的各种指标数据,可以接入prometheus
6. Health检测接口
GET /health
接口没数据返回,但可以通过http的状态码检测模型是否正常
三、大模型学习推荐
阿里云百炼平台提供了7000万的免费token,想学习agent开发的可以试一下
更多推荐

所有评论(0)