vLLM 使用介绍:功能、价格与上手指南
本文系统介绍 vLLM 的核心功能(PagedAttention、连续批处理、OpenAI 兼容 API)、成本影响因素与优化方法,并提供从安装到部署、调用、压测的完整上手指南。适合 AI 工程师、运维人员和成本敏感型团队快速落地高吞吐 LLM 推理服务。
vLLM 是当前最受关注的开源大模型推理引擎之一。它以高吞吐、低延迟和易用性著称,被广泛用于生产环境部署。本文从功能、价格和上手三个角度,帮你快速理解 vLLM 是否适合你的场景,并给出可执行的部署步骤。
vLLM 是什么
vLLM 是一个面向大语言模型(LLM)的高性能推理和服务库。它最初由加州大学伯克利分校团队提出,核心创新是 PagedAttention,将 KV Cache 分页管理,显著降低显存浪费,从而提升并发能力。
简单说,如果你需要部署一个能同时服务很多用户的 LLM API,vLLM 通常是首选方案之一。
核心功能一览
1. PagedAttention 显存管理
传统推理框架在生成时按最大长度预留显存,浪费严重。vLLM 将 KV Cache 切分成块,按需分配,显存利用率可提升数倍,相同 GPU 能承载更多并发请求。
2. 连续批处理(Continuous Batching)
vLLM 支持动态合并请求,不用等整批结束再处理下一批。新请求可随时加入,显著降低平均延迟,提高 GPU 利用率。
3. OpenAI 兼容 API
vLLM 自带 OpenAI 兼容的 HTTP 服务端,你可以用 openai Python 库直接调用,只需改 base_url。迁移成本极低。
4. 多模型与量化支持
支持 Hugging Face 上主流模型(Llama、Qwen、Mistral 等),并支持 AWQ、GPTQ、FP8 等量化方式,方便在消费级显卡或低成本 GPU 上运行。
5. 分布式推理
支持张量并行(Tensor Parallelism)和流水线并行,可在多卡多机上部署超大模型。
价格与成本:vLLM 免费,但 GPU 要钱
vLLM 本身是开源软件,采用 Apache 2.0 许可证,软件零成本。真正的开销来自运行它的硬件和运维。
| 成本项 | 说明 | 大致范围 |
|---|---|---|
| 软件许可 | vLLM 开源免费 | 0 元 |
| GPU 租赁 | 云 GPU 按小时计费 | 约 2-30 元/小时 |
| 自有显卡 | 一次性购买 | 数千至数万元 |
| 电费与运维 | 机房、散热、人力 | 视规模而定 |
降低成本的常用方法:
- 使用量化模型(AWQ/GPTQ),降低显存需求
- 开启连续批处理,提高 GPU 利用率
- 按需启停云实例,避开高峰期闲置
- 用较小模型替代大模型,先满足业务再升级
上手指南:从安装到部署
第一步:环境准备
建议使用 Linux + NVIDIA GPU,CUDA 12.1 以上。Python 3.9-3.12。
pip install vllm
如果使用 Docker,官方镜像更省事:
docker run --gpus all -p 8000:8000 vllm/vllm-openai:latest \
--model Qwen/Qwen2.5-7B-Instruct
第二步:启动 OpenAI 兼容服务
vllm serve Qwen/Qwen2.5-7B-Instruct \
--host 0.0.0.0 --port 8000 \
--tensor-parallel-size 1 \
--max-model-len 8192
常用参数:
--tensor-parallel-size:多卡并行数--gpu-memory-utilization:显存使用比例,默认 0.9--max-model-len:最大上下文长度--quantization:量化方式,如 awq
第三步:调用 API
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="Qwen/Qwen2.5-7B-Instruct",
messages=[{"role": "user", "content": "用一句话解释 vLLM"}]
)
print(resp.choices[0].message.content)
第四步:压测与调优
用 vllm bench serve 或 Locust 压测,观察吞吐(tokens/s)和 P99 延迟。若显存不足,优先降低 --max-model-len 或启用量化。若吞吐低,增加并发或检查是否触发显存交换。
适用场景与注意事项
适合:
- 需要高并发 API 的 LLM 服务
- 自托管开源模型,控制数据隐私
- 成本敏感、希望替代闭源 API 的团队
注意:
- vLLM 主要面向 NVIDIA GPU,其他硬件支持有限
- 首次加载模型较慢,需预热
- 超大模型需多卡,配置复杂度上升
结论
vLLM 是免费开源的高性能 LLM 推理引擎,核心优势是 PagedAttention 和连续批处理带来的高吞吐。软件本身不收费,成本主要在 GPU。上手只需安装、启动服务、用 OpenAI 兼容接口调用三步。如果你的业务需要自托管大模型且关注并发与成本,vLLM 值得优先尝试。建议先用 7B 模型在单卡上跑通,再逐步扩展。