Buzz离线转录教程:不联网也能把音频变文字

【免费下载链接】buzz Buzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper. 【免费下载链接】buzz 项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款用于离线转录的桌面应用,基于 OpenAI 的 Whisper 模型,所有转录过程都在你自己的电脑上完成,音频不会上传到任何服务器。它适合手上有会议录音、访谈素材或需要给视频加字幕、又不希望数据离开设备的用户。最直接的卖点是:全程不需要联网就能完成转写和字幕导出,结果自带每一句的时间戳。

一、它替你省掉的是什么

如果你经常要把会议录音或采访音频整理成文字稿,原来的做法大概是这样的:播放录音,听一句、敲一句,暂停,再听下一句,一小时的录音可能要敲两三个小时,而且手写的稿子没有时间标记,之后很难再对应回原文。用 Buzz 之后,把音频文件拖进任务列表,选一个模型,点 Run,几分钟后就得到一份带时间戳的文字初稿,你只需要对照着把错漏的几处改过来。

给视频做字幕也是类似的过程。老办法是打开字幕软件,一边回放视频一边逐行补字、手填起止时间。现在在 Buzz 里选中一个 MP4 或 MKV 文件,勾选“Word-Level Timings”,任务完成后在结果页点导出选 SRT,就会得到一份带时间码的字幕文件,可以直接拖进剪辑软件。

还有一种更即时的用法:实时转录。讲座或会议上,你过去只能边听边记速记,散场后再补录一遍。在 Buzz 里选中麦克风点 Record,语音会边听边变成文字;打开演示窗口,还可以把实时文稿投到屏幕上给现场的人看。

二、功能速览

功能适合谁怎么用
文件转录有音视频文件要整理的人把文件拖进列表,选模型和语言,点 Run
实时录音会议、讲座、采访场景选中麦克风点 Record,文字实时出现
字幕导出做视频字幕的人在结果页点导出,选 SRT 或 VTT
翻译成英文有外语素材的人新建任务时把 Task 选为 Translate to English
文件夹监视录音量大、要批量处理的人在偏好里设监视文件夹,新文件自动转录

三、三步上手

拿到软件

Windows 从发布页下载安装包运行,如果看到未签名应用的提示,选“更多信息”再点“仍要运行”。macOS 下载 .dmg 后拖进应用程序文件夹。Linux 有两个包格式可选:

flatpak install flathub io.github.chidiwilliams.Buzz
sudo snap install buzz

如果习惯自己搭环境,也可以用 pip 从 PyPI 安装 buzz-captions,再用 python -m buzz 启动(需要 Python 3.12)。

跑通第一次

打开主界面,点工具栏的 + 图标(或按 Ctrl/Cmd + O),选择一个音频或视频文件,在弹出的设置里选任务(转写或翻译成英文)、语言、模型。首次选择模型会下载模型文件,这一步需要联网一次。下载完成后点 Run,列表里该任务的状态会在处理结束后变为完成。

Buzz离线转录主界面任务列表

导出结果

状态显示完成后,双击该行打开结果页。点上方的导出按钮,可以把全文存成 TXT、SRT、VTT 等格式,文件名会按偏好里设置的导出模板生成。

四、界面带你看

偏好设置页

偏好设置页负责定义默认行为,按 Ctrl/Cmd + , 打开。你可以在这里做三件事:设置默认导出文件名模板、选择实时转录的模式(追加在下方、追加在上方、追加并纠错)、以及配置之后要用到的翻译接口地址和密钥。

Buzz离线转录偏好设置页

模型管理

偏好里的 Models 标签页用来下载和删除模型。先在列表里查看已有哪些模型,选一个版本点下载,再点“Show file location”可以打开模型目录。想把 Buzz 用到一台完全离线的电脑上时,把这个目录复制到那台机器的相同位置即可。

Buzz离线转录模型管理界面

结果页

结果页用来核对和修改文稿。双击任务进入后,可以直接在表格里改任意一段的文字,点某个时间戳能让音频跳到对应位置,按 Ctrl+F 还能在全文里搜索关键词。底部播放区支持 0.5 倍到 2 倍变速,方便逐句核对细节;觉得某条字幕太长或太短时,点 Resize 按钮可以按最长长度重新合并分句。

Buzz离线转录结果页

五、进阶技巧

  1. 手动指定语言:知道音频语言时直接选它,而不是用自动检测,识别准确率通常会更高。
  2. 按场景选模型:tiny、base 快,适合粗听和低配机器;medium 更准;large 准确率最高但耗时,留给重要素材。有 6GB 以上显存的 Nvidia 显卡可以选 Faster Whisper 引擎,否则 Whisper.cpp 最稳,集显笔记本也能跑实时转录。
  3. 加初始提示:在任务高级设置里填入容易写错的专有名词或术语,能减少人名、术语被听错的情况。
  4. 挂上文件夹监视:偏好里设好监视文件夹后,新丢进去的文件会自动转录,再配合“跳过已转录”插件可以避免重复处理。
  5. 启用插件:Help → Plugins 里打开 AI 摘要、DOCX 导出等插件,转录完成后可自动出摘要或存成 Word 文档。
  6. 录系统声音:要转录电脑里播放的视频或音频,先装一个虚拟音频设备(macOS 用 BlackHole,Windows 用 VB-CABLE),再把它选为 Buzz 的麦克风输入。

六、给开发者的路标

  • buzz/transcriber/:各转录引擎的实现代码,覆盖 Whisper、Whisper.cpp、Faster Whisper 与 OpenAI API。
  • buzz/widgets/:主窗口、偏好对话框、转录查看器等界面代码。
  • buzz/db/:基于 SQLite 的任务与结果存储,含表结构和迁移逻辑。
  • buzz/plugins/:插件基类与内置插件,写自定义插件可以从这里参考。
  • docs/:官方文档源码,包含安装、使用与常见问题。

七、常见问题

问:Buzz 不联网能用吗? 答:可以。模型只需在有网时下载一次,之后全程离线转录。若目标是完全离线的电脑,在偏好 Models 页点“Show file location”,把模型缓存目录复制到那台机器相同位置即可。

问:我该选哪个模型? 答:日常先用 base,准确率不够再上 medium 或 large。嫌慢就降一档,或换 Whisper.cpp 引擎。没有放之四海的答案,拿自己的一段素材实测最可靠。

问:支持哪些格式? 答:MP3、WAV、FLAC、M4A、OGG 等常见音频,以及 MP4、MKV、AVI、MOV 等视频都可以导入,视频会自动提取音轨,也支持粘贴 YouTube 链接直接转录。

问:转录结果怎么导出成字幕? 答:双击任务进入结果页,点导出选 SRT 或 VTT。想调整单条字幕长度的话,转录前勾选 Word-Level Timings,完成后再用 Resize 对话框按最长长度重新合并。

问:转录太慢怎么办? 答:换小一号的模型,或把引擎换成 Whisper.cpp、Faster Whisper。也可以参考 docs/docs/preferences.md 里的环境变量说明,调整线程数或强制指定 CPU/GPU。

Buzz 的价值在于把转录留在你自己的电脑上,配合字幕导出和文件夹监视,一套离线工作流就能搭起来。下一步:打开应用,把你的第一个音频文件丢进去,看看结果如何。

【免费下载链接】buzz Buzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper. 【免费下载链接】buzz 项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐