Whisper 语音转文字完全教程:用 OpenAI 开源模型把会议录音、视频本地转成文字稿

适用人群:需要把会议录音、访谈、视频、网课转成文字的人(记者、学生、运营、开发者)。 读完你能做到:在本地用 Whisper 把音频/视频转写成带时间戳的文字,并批量处理长文件。

一、原理背景

Whisper 是什么? OpenAI 2022 开源的自动语音识别(ASR)模型,支持 99 种语言,包括中文,且能自动识别语言、加标点、做翻译。最大优点是可完全本地运行,隐私不上云。

模型尺寸(精度 vs 速度权衡):

  • tiny/base/small:快、轻,精度一般。
  • medium/large:准,但吃显存/内存、慢。 中文建议至少 smallmedium

工作流程:音频 → 切 30 秒片段 → 模型预测 token → 拼成文字 + 时间戳。

二、分步操作

步骤 1:装依赖

# 先装 ffmpeg(Whisper 依赖它读各种音视频格式)
# macOS: brew install ffmpeg   Ubuntu: sudo apt install ffmpeg
pip install openai-whisper

步骤 2:转写一段音频

whisper meeting.mp3 --model small --language Chinese --o

🔒 付费文档

支付 5 积分后即可解锁全部内容