ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Buzz 离线语音转文字完整指南:Whisper 本地转录的免费上手方案

Buzz 离线语音转文字完整指南:Whisper 本地转录的免费上手方案 Buzz 离线语音转文字完整指南Whisper 本地转录的免费上手方案【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的桌面工具它把 OpenAI Whisper 跑在你的电脑上音频文件不进云端转写、翻译都在本地完成。适合做会议记录、视频字幕、或者处理不方便上传的敏感录音的普通用户也适合想用脚本批量转写的开发者。它解决什么问题音频留在本机很多转写服务要你把文件传到服务器Buzz 的思路相反模型下载一次之后每次转写都走本地算力。 这带来两个直接好处——隐私数据不出机器以及没有按量计费跑多少条录音都不花钱。底层技术是 Python 3.12 加 PyQt6转录历史和设置都存在本地 SQLite 里首次上手不需要配置任何服务端。三种方式把工具跑起来按你对安装的要求选一种即可三种方式功能基本一致。️Windows / macOS去项目发行版页面下载对应安装包。Windows 包没有做代码签名安装时会弹安全警告点更多信息再选仍要运行就行属于正常现象。注意 Intel 芯片的 Mac 最高只支持到 1.4.5 版本新版本需要 Apple Silicon。Linuxflatpak install flathub io.github.chidiwilliams.Buzz从 PyPI 装适合开发者前提是系统里有 ffmpeg并且用 Python 3.12 环境。pip install buzz-captions python -m buzz文件转录三步拿到字幕文本导入音频或视频文件Ctrl/CmdO后Buzz 会自动抽音轨不用你先转格式。然后给任务选三样东西任务类型转写或翻译、语言也可以留空让它自动检测、模型大小tiny 到 large 五档机器差就选 tiny 或 base。点运行等进度条走完。产物是带时间戳的转写文本可导出 TXT、SRT、VTT 三种格式。SRT 和 VTT 能直接拖进剪辑软件做字幕这一步对视频创作者最实用。 打开转录查看器还能边播放边核对每个片段支持搜索和调速。实时录音边说边出字主界面切到实时录音模式选好麦克风就能开始。底部面板会实时滚动出文字默认有 20 秒左右的延迟来保证文字和语音同步。讲讲座、开访谈时可以单独弹出一个演示窗口把实时内容投到大屏上。多人对话的录音还有一步值得做开启说话人识别Buzz 会把同一条录音里不同发言人的内容分开标注。嘈杂环境可以先做语音分离再转写准确率会明显提升。️模型怎么选影响速度和准确率的那一格模型是速度、内存和准确率之间的权衡点。tiny 和 base 在普通笔记本上很流畅适合先跑通流程medium 和 large 更准但更吃资源有独显的机器再考虑。在偏好设置的模型页里还能选后端Whisper / Faster Whisper标准路线Nvidia 显卡可走 CUDA 加速Whisper.cpp对硬件最友好大多数 GPU包括核显都能走 Vulkan 加速Hugging Face可以用 HF 上的各种 Transformer 模型OpenAI API如果就是想用云端接口也能接命令行一条命令批量转写GUI 之外Buzz 有完整的 CLI适合写进脚本或 CI。所有参数在 CLI 文档 里都有列。最常见的用法是指定后端、模型和输出格式buzz add -m whispercpp -s medium -l zh --srt meeting.mp3加--vtt、--txt可以换输出格式--hide-gui能隐藏主窗口纯后台跑。另外主界面有个监视文件夹功能指定目录后新放进来的文件会自动建任务并转录批量流水线场景两个功能可以配合用。卡住了怎么办四个高频问题按出现频率排一下基本都是参数问题不用怀疑机器。⚡转得太慢多半是模型选大了或者后端没吃到 GPU。换 tiny/base或者改用 Whisper.cpp 后端并确认 CUDA / Vulkan 加速已启用。专有名词总认错模型缺领域上下文。在高级设置里填一段初始提示initial prompt把术语和背景写进去语言明确时手动指定别依赖自动检测。Windows 安装弹警告包没签名导致的更多信息→仍要运行正常现象。PyPI 版本 GPU 不生效默认装的是 CPU 版 torch。Windows 上按 README 改装 CUDA 版 torch 和对应运行库GPU 才会真正参与计算。想深入后端和插件的源码入口所有转写后端都抽象在 buzz/transcriber/ 目录下Whisper、Whisper.cpp、Faster Whisper 等每个后端各占一个文件想接一个新后端从这里看最清楚。插件机制在 buzz/plugins/内置了 AI 摘要、DOCX 导出、自动调整字幕时长这几个插件加新插件照着现有目录结构抄就行。文档入口在 docs/docs/使用手册和偏好设置说明都在里面。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进