Whisper 使用介绍:功能、价格与上手指南
Whisper 是 OpenAI 开源的自动语音识别(ASR)模型,支持 99 种语言、高准确率转写和翻译。本文详细介绍 Whisper 的核心功能、官方 API 与本地部署的价格差异、安装步骤、Python 代码示例以及常见使用场景,帮助你在 10 分钟内快速上手。
如果你正在寻找一款免费、准确且支持多语言的语音转文字工具,OpenAI 的 Whisper 几乎是最佳选择。无论你是开发者、内容创作者还是企业用户,本文将从功能、价格到实际动手操作,带你全面了解 Whisper 的使用方法。
Whisper 是什么?
Whisper 是 OpenAI 于 2022 年开源的自动语音识别(ASR)模型。它使用 68 万小时的多语言和 multitask 数据训练,能够将音频转写为文字,并支持语音翻译和语言识别。与传统的语音识别系统不同,Whisper 在嘈杂环境、口音和专有名词上表现出色,且完全免费用于本地推理。
Whisper 核心功能
- 多语言转写:支持 99 种语言,包括中文、英语、日语、西班牙语等。
- 语音翻译:可将非英语语音直接翻译成英文文本。
- 语言识别:自动检测音频中的语言。
- 时间戳:输出词级或段级时间戳,方便生成字幕。
- 多种模型尺寸:提供 tiny、base、small、medium、large 五种规格,平衡速度与准确率。
- 鲁棒性强:对背景噪音、专业术语和不同口音有较好适应性。
Whisper 的价格:免费与付费方式
Whisper 本身是开源免费的,但使用方式不同,成本也不同:
| 使用方式 | 费用 | 说明 |
|---|---|---|
| 本地部署 | 完全免费 | 需要自己的 GPU/CPU,消耗电力和硬件成本 |
| OpenAI API | 按量付费 | $0.006 / 分钟音频(约 ¥0.043/分钟) |
| 第三方托管 | 不等 | 如 Replicate、Hugging Face 推理端点,价格各异 |
建议:如果音频量大且拥有 NVIDIA GPU,本地部署最划算;如果只是偶尔使用或不想配置环境,OpenAI API 最方便。
如何上手 Whisper:三种主流方法
方法一:使用 OpenAI API(最快)
- 注册 OpenAI 账号并获取 API Key。
- 安装 OpenAI Python 库:
pip install openai - 调用转写接口:
from openai import OpenAI
client = OpenAI(api_key="你的API_KEY")
audio_file = open("test.mp3", "rb")
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
response_format="text"
)
print(transcript)
方法二:本地安装 OpenAI Whisper
适合有 GPU 的开发者,完全离线运行。
- 安装 Python 3.8+ 和 PyTorch。
- 安装 Whisper:
pip install openai-whisper - 安装 ffmpeg(必须):
- Windows:下载 ffmpeg 并加入 PATH。
- macOS:
brew install ffmpeg - Linux:
sudo apt install ffmpeg
- 命令行转写:
whisper audio.mp3 --model medium --language Chinese --output_format srt
常用参数:--model 选择模型大小,--language 指定语言,--task translate 翻译成英文。
方法三:使用 Hugging Face Transformers
适合需要更灵活控制的场景:
from transformers import pipeline
pipe = pipeline("automatic-speech-recognition", model="openai/whisper-small")
result = pipe("audio.mp3")
print(result["text"])
Whisper 模型选择建议
| 模型 | 参数量 | 相对速度 | 准确率 | 推荐场景 |
|---|---|---|---|---|
| tiny | 39M | 最快 | 较低 | 实时字幕、低资源设备 |
| base | 74M | 快 | 一般 | 简单录音转写 |
| small | 244M | 中等 | 较好 | 日常使用 |
| medium | 769M | 较慢 | 高 | 专业转写 |
| large | 1550M | 最慢 | 最高 | 高精度需求 |
对于中文内容,建议至少使用 medium 或 large 模型。
常见使用场景
- 视频字幕:自动生成 SRT 字幕,支持翻译。
- 会议记录:将会议录音转为文字纪要。
- 播客转写:快速生成播客文稿,便于 SEO 和检索。
- 语音助手:作为后端 ASR 引擎。
- 学术研究:访谈录音转写与分析。
注意事项与限制
- Whisper 不是实时流式模型,长音频需分段处理。
- 本地运行 large 模型需要约 10GB 显存。
- API 有文件大小限制(25MB),大文件需压缩或分割。
- 对音乐、极度嘈杂环境的识别率会下降。
结论
Whisper 是目前最易用、最强大的开源语音转文字方案之一。免费本地部署适合有技术能力和硬件的用户;OpenAI API 适合追求便捷的开发者;Hugging Face 则提供了灵活的替代方案。根据你的音频量、预算和技术水平选择合适的方式,即可快速将语音转化为高价值文本。
现在就可以用一段 1 分钟的录音尝试 whisper audio.mp3 --model small,体验它的准确率。