vLLM 使用介绍:功能、价格与上手指南

本文系统介绍 vLLM 的核心功能(PagedAttention、连续批处理、OpenAI 兼容 API)、成本影响因素与优化方法,并提供从安装到部署、调用、压测的完整上手指南。适合 AI 工程师、运维人员和成本敏感型团队快速落地高吞吐 LLM 推理服务。

vLLM 是当前最受关注的开源大模型推理引擎之一。它以高吞吐、低延迟和易用性著称,被广泛用于生产环境部署。本文从功能、价格和上手三个角度,帮你快速理解 vLLM 是否适合你的场景,并给出可执行的部署步骤。

vLLM 是什么

vLLM 是一个面向大语言模型(LLM)的高性能推理和服务库。它最初由加州大学伯克利分校团队提出,核心创新是 PagedAttention,将 KV Cache 分页管理,显著降低显存浪费,从而提升并发能力。

简单说,如果你需要部署一个能同时服务很多用户的 LLM API,vLLM 通常是首选方案之一。

核心功能一览

1. PagedAttention 显存管理

传统推理框架在生成时按最大长度预留显存,浪费严重。vLLM 将 KV Cache 切分成块,按需分配,显存利用率可提升数倍,相同 GPU 能承载更多并发请求。

2. 连续批处理(Continuous Batching)

vLLM 支持动态合并请求,不用等整批结束再处理下一批。新请求可随时加入,显著降低平均延迟,提高 GPU 利用率。

3. OpenAI 兼容 API

vLLM 自带 OpenAI 兼容的 HTTP 服务端,你可以用 openai Python 库直接调用,只需改 base_url。迁移成本极低。

4. 多模型与量化支持

支持 Hugging Face 上主流模型(Llama、Qwen、Mistral 等),并支持 AWQ、GPTQ、FP8 等量化方式,方便在消费级显卡或低成本 GPU 上运行。

5. 分布式推理

支持张量并行(Tensor Parallelism)和流水线并行,可在多卡多机上部署超大模型。

价格与成本:vLLM 免费,但 GPU 要钱

vLLM 本身是开源软件,采用 Apache 2.0 许可证,软件零成本。真正的开销来自运行它的硬件和运维。

成本项说明大致范围
软件许可vLLM 开源免费0 元
GPU 租赁云 GPU 按小时计费约 2-30 元/小时
自有显卡一次性购买数千至数万元
电费与运维机房、散热、人力视规模而定

降低成本的常用方法:

  • 使用量化模型(AWQ/GPTQ),降低显存需求
  • 开启连续批处理,提高 GPU 利用率
  • 按需启停云实例,避开高峰期闲置
  • 用较小模型替代大模型,先满足业务再升级

上手指南:从安装到部署

第一步:环境准备

建议使用 Linux + NVIDIA GPU,CUDA 12.1 以上。Python 3.9-3.12。

pip install vllm

如果使用 Docker,官方镜像更省事:

docker run --gpus all -p 8000:8000 vllm/vllm-openai:latest \
  --model Qwen/Qwen2.5-7B-Instruct

第二步:启动 OpenAI 兼容服务

vllm serve Qwen/Qwen2.5-7B-Instruct \
  --host 0.0.0.0 --port 8000 \
  --tensor-parallel-size 1 \
  --max-model-len 8192

常用参数:

  • --tensor-parallel-size:多卡并行数
  • --gpu-memory-utilization:显存使用比例,默认 0.9
  • --max-model-len:最大上下文长度
  • --quantization:量化方式,如 awq

第三步:调用 API

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

resp = client.chat.completions.create(
    model="Qwen/Qwen2.5-7B-Instruct",
    messages=[{"role": "user", "content": "用一句话解释 vLLM"}]
)
print(resp.choices[0].message.content)

第四步:压测与调优

vllm bench serve 或 Locust 压测,观察吞吐(tokens/s)和 P99 延迟。若显存不足,优先降低 --max-model-len 或启用量化。若吞吐低,增加并发或检查是否触发显存交换。

适用场景与注意事项

适合:

  • 需要高并发 API 的 LLM 服务
  • 自托管开源模型,控制数据隐私
  • 成本敏感、希望替代闭源 API 的团队

注意:

  • vLLM 主要面向 NVIDIA GPU,其他硬件支持有限
  • 首次加载模型较慢,需预热
  • 超大模型需多卡,配置复杂度上升

结论

vLLM 是免费开源的高性能 LLM 推理引擎,核心优势是 PagedAttention 和连续批处理带来的高吞吐。软件本身不收费,成本主要在 GPU。上手只需安装、启动服务、用 OpenAI 兼容接口调用三步。如果你的业务需要自托管大模型且关注并发与成本,vLLM 值得优先尝试。建议先用 7B 模型在单卡上跑通,再逐步扩展。

返回 AI 教程列表