Whisper 使用介绍:功能、价格与上手指南

Whisper 是 OpenAI 开源的自动语音识别(ASR)模型,支持 99 种语言、高准确率转写和翻译。本文详细介绍 Whisper 的核心功能、官方 API 与本地部署的价格差异、安装步骤、Python 代码示例以及常见使用场景,帮助你在 10 分钟内快速上手。

如果你正在寻找一款免费、准确且支持多语言的语音转文字工具,OpenAI 的 Whisper 几乎是最佳选择。无论你是开发者、内容创作者还是企业用户,本文将从功能、价格到实际动手操作,带你全面了解 Whisper 的使用方法。

Whisper 是什么?

Whisper 是 OpenAI 于 2022 年开源的自动语音识别(ASR)模型。它使用 68 万小时的多语言和 multitask 数据训练,能够将音频转写为文字,并支持语音翻译语言识别。与传统的语音识别系统不同,Whisper 在嘈杂环境、口音和专有名词上表现出色,且完全免费用于本地推理。

Whisper 核心功能

  • 多语言转写:支持 99 种语言,包括中文、英语、日语、西班牙语等。
  • 语音翻译:可将非英语语音直接翻译成英文文本。
  • 语言识别:自动检测音频中的语言。
  • 时间戳:输出词级或段级时间戳,方便生成字幕。
  • 多种模型尺寸:提供 tiny、base、small、medium、large 五种规格,平衡速度与准确率。
  • 鲁棒性强:对背景噪音、专业术语和不同口音有较好适应性。

Whisper 的价格:免费与付费方式

Whisper 本身是开源免费的,但使用方式不同,成本也不同:

使用方式费用说明
本地部署完全免费需要自己的 GPU/CPU,消耗电力和硬件成本
OpenAI API按量付费$0.006 / 分钟音频(约 ¥0.043/分钟)
第三方托管不等如 Replicate、Hugging Face 推理端点,价格各异

建议:如果音频量大且拥有 NVIDIA GPU,本地部署最划算;如果只是偶尔使用或不想配置环境,OpenAI API 最方便。

如何上手 Whisper:三种主流方法

方法一:使用 OpenAI API(最快)

  1. 注册 OpenAI 账号并获取 API Key。
  2. 安装 OpenAI Python 库:pip install openai
  3. 调用转写接口:
from openai import OpenAI
client = OpenAI(api_key="你的API_KEY")

audio_file = open("test.mp3", "rb")
transcript = client.audio.transcriptions.create(
    model="whisper-1",
    file=audio_file,
    response_format="text"
)
print(transcript)

方法二:本地安装 OpenAI Whisper

适合有 GPU 的开发者,完全离线运行。

  1. 安装 Python 3.8+ 和 PyTorch。
  2. 安装 Whisper:pip install openai-whisper
  3. 安装 ffmpeg(必须):
  • Windows:下载 ffmpeg 并加入 PATH。
  • macOS:brew install ffmpeg
  • Linux:sudo apt install ffmpeg
  1. 命令行转写:
whisper audio.mp3 --model medium --language Chinese --output_format srt

常用参数:--model 选择模型大小,--language 指定语言,--task translate 翻译成英文。

方法三:使用 Hugging Face Transformers

适合需要更灵活控制的场景:

from transformers import pipeline
pipe = pipeline("automatic-speech-recognition", model="openai/whisper-small")
result = pipe("audio.mp3")
print(result["text"])

Whisper 模型选择建议

模型参数量相对速度准确率推荐场景
tiny39M最快较低实时字幕、低资源设备
base74M一般简单录音转写
small244M中等较好日常使用
medium769M较慢专业转写
large1550M最慢最高高精度需求

对于中文内容,建议至少使用 mediumlarge 模型。

常见使用场景

  • 视频字幕:自动生成 SRT 字幕,支持翻译。
  • 会议记录:将会议录音转为文字纪要。
  • 播客转写:快速生成播客文稿,便于 SEO 和检索。
  • 语音助手:作为后端 ASR 引擎。
  • 学术研究:访谈录音转写与分析。

注意事项与限制

  • Whisper 不是实时流式模型,长音频需分段处理。
  • 本地运行 large 模型需要约 10GB 显存。
  • API 有文件大小限制(25MB),大文件需压缩或分割。
  • 对音乐、极度嘈杂环境的识别率会下降。

结论

Whisper 是目前最易用、最强大的开源语音转文字方案之一。免费本地部署适合有技术能力和硬件的用户;OpenAI API 适合追求便捷的开发者;Hugging Face 则提供了灵活的替代方案。根据你的音频量、预算和技术水平选择合适的方式,即可快速将语音转化为高价值文本。

现在就可以用一段 1 分钟的录音尝试 whisper audio.mp3 --model small,体验它的准确率。

返回 AI 教程列表