← 返回文章列表
2026-08-10

本地语音转文字:Whisper 免费把会议录音变成文字稿(106,924★,已核验)

本地语音转文字:Whisper 免费把会议录音变成文字稿(106,924★,已核验)

直接答案: OpenAI 开源的 Whisper(106,924★,MIT,2026-08-09 GitHub API 核验)是目前最主流的本地语音转文字模型——装好之后,把录音文件丢给它,几分钟内拿到带时间戳的文字稿,支持 99 种语言(含中文),不用联网、不用付费、录音不出本机。本文讲安装、常用命令、模型怎么选,以及 faster-whisper 什么时候更划算。

Whisper 是什么

Whisper 是 OpenAI 开源的语音识别(ASR)模型,MIT 协议。截至 2026-08-09,官方仓库 openai/whisper 在 GitHub 有 106,924 星,是本地语音转文字的事实标准。Windows/macOS/Linux 都能跑,小模型 CPU 就能用,大模型推荐有显卡的机器。

它做三件事:把语音转成文字、把外语音频翻成英文、给每句话打时间戳。模型权重下载完之后,全程离线。说实话,第一次跑通的时候我有点被震到,效果比我预期好——一段一小时的产品会,十几分钟就出了带时间戳的全文。

安装(三分钟)

前提:Python 3.8-3.12 + ffmpeg。

  • Windows:装 Python 后 winget install ffmpeg(或去 ffmpeg.org 下载)
  • macOS:brew install ffmpeg
  • Linux:sudo apt install ffmpeg

然后装 Whisper 本体:

``` pip install -U openai-whisper ```

验证:whisper --help 能出帮助就装好了。

转你的第一个文件

把录音或视频丢进去:

``` whisper 会议录音.m4a --language zh --model small ```

同目录会生成 .txt.srt.vtt 三个文件——文字稿、字幕、带时间戳字幕,直接能用。不确定语言就省略 --language 让它自动识别。

模型怎么选

模型大小速度适合
tiny39 MB最快快速测试、纯 CPU
base74 MB短片段
small244 MB中等CPU 日常用,性价比最高
medium769 MB要更准,内存 8GB+
large1.5 GB最慢要最高精度,推荐显卡

五个尺寸都是 OpenAI 官方发布的权重。实测一段 10 分钟播客,现代 CPU 跑 small 模型大约 1-3 分钟。我自己先用了 base,后来换 small——多花 170MB 换来识别准确率明显提升,这笔账划算。老电脑也不慌,tiny 都能跑,就是挺糙的,错别字要自己改。

什么时候该用 faster-whisper

faster-whisper(24,817★,MIT)是同模型的加速重写,基于 CTranslate2,同样权重下快最多 4 倍、内存占用更低,精度一模一样。适合:

  • 每天转长篇(会议、课程、播客批量)
  • 纯 CPU 机器想要最快的速度
  • 需要逐词时间戳做对齐

安装:pip install faster-whisper,Python API 里模型名写 "small"、"medium"、"large-v3" 就行。超过 20 分钟的音频,我实际都在用这个,转完还能顺手把 .srt 丢进剪辑软件做字幕,挺省事的。

实际场景怎么用

  • 会议纪要:whisper 会议.wav --language zh --model medium,文字稿出来丢给本地大模型(Ollama)总结要点——全离线组合
  • 播客转文章:small 转稿,留时间戳方便引原文
  • 字幕:生成的 .srt 直接拖进剪辑软件
  • YouTube/B站下载:先用 yt-dlp(183,326★)抽音频 yt-dlp -x --audio-format mp3 <链接>,再转写

说实话的部分

Whisper 对清晰语音很准,但背景噪音大、多人抢话、口音重的时候会翻车——嘈杂录音要预留校对时间。large 模型明显更准,但需要约 10GB 内存,没显卡会转得很慢。还有一点:别只看星数选模型,如果音频短且干净,small 的性价比比 medium 高得多。

FAQ

必须要有显卡吗? 不用。tiny/base/small 纯 CPU 就能跑;显卡(6GB+ 显存)主要是让 medium/large 快好几倍。

支持中文吗? 支持,99 种语言都支持,中文用 --language zh;口音重的话建议上 medium,别只盯着 small 的省事。

真免费吗? 真免费,我实测下来没有隐藏收费。MIT 协议,不用 API key,没有调用次数限制,只花你自己的电费。

星数怎么核验的? 2026-08-09 我用 GitHub API 实时查过,stars 数据与仓库页一致:openai/whisper 106,924★(MIT)、faster-whisper 24,817★、yt-dlp 183,326★、Ollama 178,084★。

总结

Whisper(106,924★,MIT,2026-08-09 核验):pip install -U openai-whisper + ffmpeg → whisper 文件.m4a → 文字稿/字幕。日常选 small,批量转写换 faster-whisper,配 Ollama 就是全离线的"录音→纪要"流水线。全部工具目录见 tool-market.cn/tools。你用它在跑什么场景,评论区聊聊?