ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Buzz 离线音频转录指南:本地语音转文字,敏感录音不出你的电脑

Buzz 离线音频转录指南:本地语音转文字,敏感录音不出你的电脑 Buzz 离线音频转录指南本地语音转文字敏感录音不出你的电脑【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议纪要、播客素材、客户采访录音这些文件你敢直接传到云端处理吗多数人的答案是不敢。Buzz 就是为这种顾虑而生的离线音频转录工具——它把 OpenAI 的 Whisper 语音模型搬到你自己的电脑上本地语音转文字全程不联网转完还能顺手翻译。Buzz 实时转录界面模型选择和语言设置一目了然Buzz 是什么把 Whisper 装进你的电脑 ️Buzz 是一个跨平台的桌面应用基于 OpenAI Whisper 技术在你本机的 CPU 或 GPU 上完成音频、视频的转录和翻译。打个比方它就像一台家用文字冲洗店录音往里一放文字往出一吐原料和成品始终都在你手里不用托人代洗。完全本地处理数据不出设备支持 TXT / SRT / VTT 导出批量任务队列 命令行调用麦克风实时转录也支持从零跑起来3 步启动 Buzz 第 1 步获取代码git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz拿到项目源码后面安装和调试都以它为基础。第 2 步建虚拟环境并安装python -m venv .venv source .venv/bin/activate # Windows 用 .venv\Scripts\activate pip install buzz-captionsBuzz 要求 Python 3.12官方依赖里钉死了这个版本所以建好虚拟环境再装能避免污染系统环境。buzz-captions就是 Buzz 的包名一条命令把所有依赖装齐。第 3 步启动验证buzz等主窗口弹出任务列表空空的摆着就说明跑起来了。主界面任务列表和工具栏跑成功长这样如果卡住了大概率是这几种情况Python 版本不对→ 确认是 3.12python --version查一下ffmpeg 没装→ 音频解码靠它去 ffmpeg.org 装一个并加入 PATH首次转录特别慢→ 模型在后台自动下载等它跑完就好核心用法单文件转录与批量队列 场景一转一个文件点击工具栏的新建转录任务按钮快捷键CtrlShiftT或直接CtrlO选择音频、视频文件导入在任务行里选择模型比如 Whisper.cpp 的 small和语言留空则自动检测点开始转录等状态变成 Completed双击结果打开转录查看器逐句校对文字和时间轴从查看器导出 TXT、SRT 或 VTT小技巧CtrlM开始、CtrlShiftM停止转录和翻译是两个任务类型转中文再翻英文就选 Translate。场景二批量队列按住 Ctrl或 Cmd多选文件一次性导入多个每个任务独立设置模型和参数互不干扰逐个开始或暂停、取消不想跑的任务转录查看器带时间戳的逐句文本支持直接编辑进阶玩法命令行一条命令直接入队还能省掉开界面的步骤buzz add --model-type whispercpp --model-size small --language zh --srt --vtt meeting.mp3在偏好里启用Watch folder后放进监控目录的新文件会自动开始转录。调优与个性化模型怎么选、字幕怎么排 ⚙️离线 Whisper 模型怎么选模型文件体积从model_loader.py里可以查到确切数字模型文件体积大致适用场景tiny~73 MB快速草稿、实时转录base~139 MB日常平衡之选small~462 MB精度与速度的折中medium~1.5 GB专业级转录large-v3~2.9 GB最高精度要求硬件在偏好 → Models里勾选下载模型统一存在本机缓存目录可用BUZZ_MODEL_ROOT环境变量改位置。质量与速度的平衡原则很简单先快后精。用 base 跑一遍全文拿到草稿再挑出拿不准的片段单独用 medium 或 large 重转。Whisper.cpp 后端还支持量化版本比如 q5同样是大模型体积和内存占用都能降下来。输出格式与文件名定制Buzz 支持 TXT、SRT、VTT 三种导出。做字幕首选 SRT。偏好 → General里可以设置默认导出文件名模板比如{{ input_file_name }} ({{ task }}d on {{ date_time }})批量导出时文件不会撞名。模型偏好选择后端和模型版本点下载即可字幕行太长、断句太碎怎么办双击结果打开查看器里的Resize对话框设置每行最大字数勾选按停顿合并一键把时间轴重排整齐。Resize 工具控制每行字幕长度和合并规则踩坑速查 启动就报版本错误→ 大概率是 Python 版本不对Buzz 只认 3.12转出来的文件打不开或格式怪→ 检查 ffmpeg 是否装好重装后重启 Buzz第一个任务慢得像卡死→ 模型在自动下载第二次转同样的模型就快了有 N 卡但速度没提升→ 换 Whisper.cppVulkan或 Faster Whisper 后端确认显卡驱动就绪语言设置后没生效→ 语言代码要填zh这种两字母代码不是chinese磁盘空间告急→ large 系模型一个就 2.9 GB装几个大模型前先看看剩余空间一个完整工作流从录音到成品字幕把会议录音 MP3 导入任务列表选择模型日常内容 base 就够重要内容上 small 或 medium开始转录等待状态变为 Completed打开查看器播放对照音频修正个别错字用 Resize 整理字幕断行导出 SRT批量场景可以写成脚本省掉逐个拖文件的麻烦# 批量转录一个目录全部输出 SRT for f in ~/recordings/*.mp3; do buzz add --model-type whispercpp --model-size small --language zh --srt $f done这个脚本能帮你省掉的是开界面、挑文件、设参数、点开始四步手动操作。写在最后回到开头那个问题敏感录音还怕上传吗现在你已经在本地完成了离线音频转录——单文件、批量、命令行都行还能顺手导出字幕。想再往前一步可以试试 Buzz 的麦克风实时转录和文件夹监控或者看看它的插件系统比如 AI 摘要生成文档里有完整说明。工具在手剩下的交给你的耳朵和审美。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进