Deepgram 使用介绍:功能、价格与上手指南
本文系统介绍 Deepgram 语音 AI 平台,涵盖核心功能、按量付费价格模型、免费额度,以及从注册、获取 API Key 到调用语音转文字接口的完整上手流程,帮助开发者和团队快速评估并集成 Deepgram。
什么是 Deepgram?
Deepgram 是一家专注于语音 AI 的平台,提供语音转文字(STT)、语音合成(TTS)和语音理解能力。它通过 API 优先的方式,让开发者可以快速把音频和视频中的语音转化为结构化文本,并进一步做摘要、情感分析、话题检测等处理。
与许多传统语音识别服务不同,Deepgram 强调低延迟和高准确率,并针对电话录音、会议、播客、客服对话等场景做了优化。它的核心优势在于:
- API 友好:REST 与 WebSocket 接口并存,适合批量和实时场景。
- 多语言支持:覆盖英语、中文、西班牙语、法语、德语等多种语言。
- 模型可选:提供通用模型、电话模型、医疗模型等,按场景选择。
- 按量付费:没有复杂的套餐绑定,用多少付多少。
Deepgram 核心功能
1. 语音转文字(Speech-to-Text)
这是 Deepgram 最常用的功能。你上传音频文件或传入实时音频流,API 返回带时间戳的文本。主要能力包括:
- 预录音频转写:支持 wav、mp3、m4a、flac 等常见格式。
- 实时流式转写:通过 WebSocket 持续接收音频并实时返回文字,适合直播、会议字幕。
- 说话人分离(Diarization):自动区分不同说话人,输出谁在什么时候说了什么。
- 标点与大小写:自动添加标点、数字格式化和大小写。
- 关键词增强:可传入自定义词汇表,提高专业术语识别率。
- 多语言识别:支持自动检测语言或指定语言代码。
2. 语音合成(Text-to-Speech)
Deepgram 也提供文本转语音能力,可将文字合成为自然语音。适合语音助手、有声内容、IVR 等场景。你可以选择不同音色、语速和输出格式。
3. 语音理解(Audio Intelligence)
在转写基础上,Deepgram 提供额外的理解能力:
- 摘要(Summarization):自动生成通话或会议摘要。
- 话题检测(Topic Detection):识别对话中讨论的主题。
- 情感分析(Sentiment Analysis):判断语句的正负面情绪。
- 意图识别(Intent Recognition):识别用户意图,适合客服质检。
- 实体检测(Entity Detection):提取人名、地点、邮箱、电话号码等。
4. 开发者工具与生态
- SDK:官方提供 Python、Node.js、Go、.NET 等 SDK。
- 控制台:可在网页中直接上传音频测试、查看用量和 API Key。
- 回调与 Webhook:异步任务完成后通知你的服务器。
Deepgram 价格
Deepgram 采用按量付费模式,主要按音频时长计费。以下为常见定价结构(实际价格以官网为准):
| 功能 | 计费方式 | 参考价格 |
|---|---|---|
| 预录音频转写 | 按分钟 | 约 $0.0043/分钟起 |
| 实时流式转写 | 按分钟 | 约 $0.0059/分钟起 |
| 语音合成 | 按字符 | 约 $0.015/千字符起 |
| 音频理解 | 按分钟 | 在转写基础上加收 |
免费额度:新用户通常可获得一定金额的免费额度(例如 $200),用于测试各项功能。具体额度会随活动变化,注册后可在控制台查看。
省钱建议:
- 先用免费额度验证准确率,再决定是否规模化。
- 预录场景比实时场景单价更低,非实时需求尽量走批量接口。
- 开启
smart_format等按需功能,避免不必要的附加计费。
Deepgram 上手指南
第一步:注册与获取 API Key
- 访问 Deepgram 官网,点击注册。
- 完成邮箱验证并登录控制台。
- 在控制台左侧找到 API Keys,点击创建新 Key。
- 复制并妥善保存 Key,它只会完整显示一次。
第二步:安装 SDK
以 Python 为例:
pip install deepgram-sdk
Node.js 用户可以使用:
npm install @deepgram/sdk
第三步:调用语音转文字 API
以下是一个 Python 示例,转写本地音频文件:
from deepgram import DeepgramClient, PrerecordedOptions
DEEPGRAM_API_KEY = "你的_API_Key"
client = DeepgramClient(DEEPGRAM_API_KEY)
with open("demo.mp3", "rb") as audio:
source = {"buffer": audio.read()}
options = PrerecordedOptions(
model="nova-2",
smart_format=True,
diarize=True,
language="zh",
)
response = client.listen.prerecorded.v("1").transcribe_file(source, options)
print(response)
关键参数说明:
model:选择模型,如nova-2为较新的通用模型。smart_format:自动标点、数字和日期格式化。diarize:开启说话人分离。language:指定语言,中文用zh。
第四步:实时转写(可选)
如果需要直播字幕或实时会议记录,使用 WebSocket 接口。SDK 中通常有 live 方法,传入麦克风或音频流即可持续获得转写结果。注意实时场景要控制音频分片大小,避免延迟过高。
第五步:在控制台验证结果
回到 Deepgram 控制台,在 Usage 中可以看到调用次数和消费情况。你也可以在 Playground 中直接上传文件测试不同模型和参数,快速对比效果。
常见问题
Deepgram 支持中文吗? 支持。可以在参数中指定 language=zh,或使用多语言模型自动检测。
免费额度用完后会自动扣费吗? 通常需要绑定支付方式后才会继续使用,建议设置用量提醒。
实时和预录该怎么选? 需要即时出文字选实时;只需要最终文稿选预录,价格更低且准确率通常更稳定。
如何提高专业术语识别率? 使用关键词增强功能,传入你的行业词汇表。
结论
Deepgram 是一个面向开发者的语音 AI 平台,核心价值在于低延迟、高准确率的语音转文字能力,以及灵活的按量付费模式。对于需要批量处理音频、构建实时字幕或做客服质检的团队,它提供了清晰的 API 和可扩展的理解功能。建议先用免费额度跑通一个最小示例,再根据实际音频时长和功能需求估算成本,最后决定是否集成到生产环境。