Deepgram 使用介绍:功能、价格与上手指南

本文系统介绍 Deepgram 语音 AI 平台,涵盖核心功能、按量付费价格模型、免费额度,以及从注册、获取 API Key 到调用语音转文字接口的完整上手流程,帮助开发者和团队快速评估并集成 Deepgram。

什么是 Deepgram?

Deepgram 是一家专注于语音 AI 的平台,提供语音转文字(STT)、语音合成(TTS)和语音理解能力。它通过 API 优先的方式,让开发者可以快速把音频和视频中的语音转化为结构化文本,并进一步做摘要、情感分析、话题检测等处理。

与许多传统语音识别服务不同,Deepgram 强调低延迟和高准确率,并针对电话录音、会议、播客、客服对话等场景做了优化。它的核心优势在于:

  • API 友好:REST 与 WebSocket 接口并存,适合批量和实时场景。
  • 多语言支持:覆盖英语、中文、西班牙语、法语、德语等多种语言。
  • 模型可选:提供通用模型、电话模型、医疗模型等,按场景选择。
  • 按量付费:没有复杂的套餐绑定,用多少付多少。

Deepgram 核心功能

1. 语音转文字(Speech-to-Text)

这是 Deepgram 最常用的功能。你上传音频文件或传入实时音频流,API 返回带时间戳的文本。主要能力包括:

  • 预录音频转写:支持 wav、mp3、m4a、flac 等常见格式。
  • 实时流式转写:通过 WebSocket 持续接收音频并实时返回文字,适合直播、会议字幕。
  • 说话人分离(Diarization):自动区分不同说话人,输出谁在什么时候说了什么。
  • 标点与大小写:自动添加标点、数字格式化和大小写。
  • 关键词增强:可传入自定义词汇表,提高专业术语识别率。
  • 多语言识别:支持自动检测语言或指定语言代码。

2. 语音合成(Text-to-Speech)

Deepgram 也提供文本转语音能力,可将文字合成为自然语音。适合语音助手、有声内容、IVR 等场景。你可以选择不同音色、语速和输出格式。

3. 语音理解(Audio Intelligence)

在转写基础上,Deepgram 提供额外的理解能力:

  • 摘要(Summarization):自动生成通话或会议摘要。
  • 话题检测(Topic Detection):识别对话中讨论的主题。
  • 情感分析(Sentiment Analysis):判断语句的正负面情绪。
  • 意图识别(Intent Recognition):识别用户意图,适合客服质检。
  • 实体检测(Entity Detection):提取人名、地点、邮箱、电话号码等。

4. 开发者工具与生态

  • SDK:官方提供 Python、Node.js、Go、.NET 等 SDK。
  • 控制台:可在网页中直接上传音频测试、查看用量和 API Key。
  • 回调与 Webhook:异步任务完成后通知你的服务器。

Deepgram 价格

Deepgram 采用按量付费模式,主要按音频时长计费。以下为常见定价结构(实际价格以官网为准):

功能计费方式参考价格
预录音频转写按分钟约 $0.0043/分钟起
实时流式转写按分钟约 $0.0059/分钟起
语音合成按字符约 $0.015/千字符起
音频理解按分钟在转写基础上加收

免费额度:新用户通常可获得一定金额的免费额度(例如 $200),用于测试各项功能。具体额度会随活动变化,注册后可在控制台查看。

省钱建议

  • 先用免费额度验证准确率,再决定是否规模化。
  • 预录场景比实时场景单价更低,非实时需求尽量走批量接口。
  • 开启 smart_format 等按需功能,避免不必要的附加计费。

Deepgram 上手指南

第一步:注册与获取 API Key

  1. 访问 Deepgram 官网,点击注册。
  2. 完成邮箱验证并登录控制台。
  3. 在控制台左侧找到 API Keys,点击创建新 Key。
  4. 复制并妥善保存 Key,它只会完整显示一次。

第二步:安装 SDK

以 Python 为例:

pip install deepgram-sdk

Node.js 用户可以使用:

npm install @deepgram/sdk

第三步:调用语音转文字 API

以下是一个 Python 示例,转写本地音频文件:

from deepgram import DeepgramClient, PrerecordedOptions

DEEPGRAM_API_KEY = "你的_API_Key"

client = DeepgramClient(DEEPGRAM_API_KEY)

with open("demo.mp3", "rb") as audio:
    source = {"buffer": audio.read()}

options = PrerecordedOptions(
    model="nova-2",
    smart_format=True,
    diarize=True,
    language="zh",
)

response = client.listen.prerecorded.v("1").transcribe_file(source, options)
print(response)

关键参数说明:

  • model:选择模型,如 nova-2 为较新的通用模型。
  • smart_format:自动标点、数字和日期格式化。
  • diarize:开启说话人分离。
  • language:指定语言,中文用 zh

第四步:实时转写(可选)

如果需要直播字幕或实时会议记录,使用 WebSocket 接口。SDK 中通常有 live 方法,传入麦克风或音频流即可持续获得转写结果。注意实时场景要控制音频分片大小,避免延迟过高。

第五步:在控制台验证结果

回到 Deepgram 控制台,在 Usage 中可以看到调用次数和消费情况。你也可以在 Playground 中直接上传文件测试不同模型和参数,快速对比效果。

常见问题

Deepgram 支持中文吗? 支持。可以在参数中指定 language=zh,或使用多语言模型自动检测。

免费额度用完后会自动扣费吗? 通常需要绑定支付方式后才会继续使用,建议设置用量提醒。

实时和预录该怎么选? 需要即时出文字选实时;只需要最终文稿选预录,价格更低且准确率通常更稳定。

如何提高专业术语识别率? 使用关键词增强功能,传入你的行业词汇表。

结论

Deepgram 是一个面向开发者的语音 AI 平台,核心价值在于低延迟、高准确率的语音转文字能力,以及灵活的按量付费模式。对于需要批量处理音频、构建实时字幕或做客服质检的团队,它提供了清晰的 API 和可扩展的理解功能。建议先用免费额度跑通一个最小示例,再根据实际音频时长和功能需求估算成本,最后决定是否集成到生产环境。

返回 AI 教程列表