Vellum 使用介绍:功能、价格与上手指南
Vellum 是一款面向 AI 产品团队的提示词管理与评估平台,支持多模型对比、版本管理、测试集评估和 API 部署。本文介绍它的核心功能、价格方案和快速上手步骤,帮助你判断是否值得使用。
Vellum 是一款面向 AI 产品团队的提示词管理与评估平台,主要解决大模型应用开发中的提示词版本混乱、效果难以量化、多模型切换成本高等问题。如果你正在开发基于 LLM 的产品,Vellum 可以帮助你把提示词从“散落在代码里的字符串”变成可管理、可测试、可部署的资产。
Vellum 是什么
Vellum 提供从提示词编辑、测试到部署的完整工作流。它支持 OpenAI、Anthropic、Google、Cohere 等主流模型,也支持开源模型。核心用户是 AI 工程师、产品经理和提示词工程师。
核心功能
提示词管理与版本控制
- 在可视化编辑器中编写提示词,支持变量、条件逻辑和函数调用
- 每次修改自动生成版本,可对比差异、回滚到历史版本
- 支持将提示词发布为 API,方便应用直接调用
多模型对比与测试
- 同一提示词可同时运行在多个模型上,对比输出质量、延迟和成本
- 支持创建测试集,批量评估不同提示词版本的表现
- 可接入自定义评估指标,如准确性、相关性、格式合规性
评估与监控
- 提供人工评分和自动评分两种方式
- 支持在生产环境中记录请求日志,追踪提示词实际表现
- 可设置告警,当效果下降时及时发现
工作流与集成
- 支持将提示词链组合成工作流
- 提供 Python、TypeScript SDK 和 REST API
- 可与常见开发工具集成,方便嵌入现有项目
价格方案
Vellum 采用订阅制,主要分为以下几档:
| 方案 | 价格 | 主要适用场景 |
|---|---|---|
| Free | 免费 | 个人试用,有限额度和功能 |
| Pro | 约 50 美元/月 | 小型团队,更多版本和测试额度 |
| Enterprise | 定制报价 | 大型团队,SSO、权限控制、专属支持 |
具体价格和额度可能调整,建议以官网最新信息为准。免费版适合验证需求,Pro 版适合正式开发,企业版适合对安全和协作有更高要求的团队。
快速上手指南
第一步:注册并创建项目
访问 Vellum 官网注册账号,创建一个新项目。项目是管理提示词、测试集和部署的基本单位。
第二步:编写第一个提示词
在编辑器中输入提示词内容,使用 {{variable}} 定义变量。例如:
你是一位客服助手,请根据用户问题给出回答。
用户问题:{{question}}
第三步:选择模型并测试
在右侧选择模型,填入变量值,点击运行查看输出。可以添加多个模型进行对比。
第四步:创建测试集并评估
将常见问题整理成测试集,批量运行提示词,记录每个输出的评分。通过对比不同版本,找到最优提示词。
第五步:发布为 API
确认效果后,将提示词发布为 API,获取调用凭证,在应用中通过 SDK 或 REST 接口调用。
使用建议
- 先从免费版开始,验证 Vellum 是否匹配你的工作流
- 提示词版本命名要清晰,便于团队协作
- 测试集要覆盖边界情况,不要只测正常输入
- 关注成本和延迟,不要只看输出质量
总结
Vellum 适合需要系统化管理提示词和评估效果的 AI 团队。它的优势在于把提示词开发流程标准化,让多模型对比和版本管理变得简单。如果你只是做简单实验,可能不需要它;但如果你要持续迭代 AI 产品,Vellum 值得尝试。建议先用免费版体验核心功能,再根据团队规模决定是否升级。