Confident AI DeepEval 使用介绍:功能、价格与上手指南
本文系统介绍 Confident AI DeepEval 的定位、核心功能、价格方案和快速上手流程。你将了解如何安装、编写测试用例、运行评估并解读指标,同时掌握免费版与付费版的差异,以及将 DeepEval 集成到 CI/CD 的实用建议。
在构建 LLM 应用时,"效果好不好"不能只靠感觉。Confident AI DeepEval 是一款面向大模型应用的评估框架,帮助团队用可复现的测试用例衡量回答质量、幻觉、相关性等指标。本文从功能、价格到上手步骤,带你快速掌握它。
什么是 Confident AI DeepEval
DeepEval 是 Confident AI 推出的开源 LLM 评估框架,类似"大模型时代的单元测试"。你可以为问答、RAG、Agent 等场景编写测试用例,运行后得到量化分数,并在 Confident AI 云平台上追踪历史结果。
它解决三个核心问题:
- 可量化:把主观质量转为 0~1 的指标分数
- 可复现:同一批用例反复运行,对比版本差异
- 可集成:无缝接入 pytest 与 CI/CD 流水线
核心功能一览
| 功能 | 说明 |
|---|---|
| 内置指标 | 答案相关性、忠实度、上下文召回、幻觉检测等 14+ 指标 |
| 自定义指标 | 用 G-Eval 或自定义 LLM 评分逻辑 |
| 数据集管理 | 在云端存储、版本化测试数据集 |
| 报告追踪 | 网页端查看每次运行的分数与趋势 |
| 合成数据 | 自动生成测试问题,快速扩充用例 |
| 红队测试 | 检测提示注入、越狱等安全风险 |
常用评估指标
- Answer Relevancy:回答是否切题
- Faithfulness:是否忠于检索到的上下文
- Hallucination:是否编造事实
- Contextual Recall / Precision:RAG 检索质量
- Bias / Toxicity:内容安全维度
价格方案
DeepEval 开源库本身免费,可本地运行。Confident AI 云平台提供托管与协作能力,价格分档如下(以官网为准,可能调整):
- Free:个人试用,有限评测次数与席位
- Starter:小团队起步,更高用量与数据集上限
- Pro:成长型团队,含更多席位与优先支持
- Enterprise:定制化、SSO、私有部署与合规支持
建议:先用开源版本地跑通流程,需要团队协作和长期追踪时再升级云平台。
快速上手指南
1. 安装
pip install -U deepeval
2. 配置 API Key
depeval login
或设置环境变量 OPENAI_API_KEY(评估器需要调用 LLM)。
3. 编写第一个测试
创建 test_qa.py:
from deepeval import evaluate
from deepeval.metrics import AnswerRelevancyMetric
from deepeval.test_case import LLMTestCase
case = LLMTestCase(
input="DeepEval 是什么?",
actual_output="DeepEval 是评估 LLM 应用的开源框架。",
retrieval_context=["DeepEval 是 Confident AI 推出的 LLM 评估框架。"]
)
metric = AnswerRelevancyMetric(threshold=0.7)
evaluate([case], [metric])
4. 运行评估
deepeval test run test_qa.py
终端会输出分数与通过情况,云端同步后可在面板查看趋势。
5. 接入 CI/CD
在 GitHub Actions 中加入 deepeval test run 步骤,即可在每次提交时自动回归评估,防止效果退化。
实践建议
- 从小数据集开始:先写 10~20 条高质量用例,比大量低质用例更有效
- 阈值按场景调整:客服场景可放宽相关性,医疗场景需严格
- 结合人工评估:指标是参考,关键结论仍需人工抽检
- 版本化数据集:每次模型或提示词变更都记录对应数据集版本
结论
Confident AI DeepEval 把 LLM 评估从"拍脑袋"变成工程化流程。它的开源库免费、上手快,配合云平台可实现团队协作与历史追踪。对于正在迭代 RAG、Agent 或聊天机器人的团队,DeepEval 是值得纳入技术栈的评估工具。建议先按本文步骤跑通一个最小示例,再逐步扩展到完整测试集。