Buzz 是一款免费的开源桌面应用程序,用于将音频和视频转换为文字记录、字幕和实时字幕。它在适用于 macOS、Windows 和 Linux 的图形工作流程中封装了多个语音识别后端(Whisper、Whisper.cpp、Faster Whisper、兼容的 Hugging Face 模型和托管的 OpenAI 兼容 API)。该存储库已获得 MIT 许可。
当用户需要本地处理和可编辑导出而不组装 Python、FFmpeg 和模型工具时,Buzz 最有价值。 “离线”是一种配置选择,而不是绝对的产品属性:本地后端可以将媒体保存在计算机上,而 API 转录、AI 翻译、URL 导入、模型下载和可选的实时上传功能会产生网络流量。验证所选的工作流程而不是依赖标签。


选择模型之前选择执行路径
| 后端 | 最适合 | 实力 | 主要权衡 |
|---|---|---|---|
| 耳语 | 一般局部基线 | 参考生态系统和广泛的语言支持 | 可能是资源密集型的 |
| Whisper.cpp | CPU、Apple Silicon 或 Vulkan 功能的设备 | 可移植的本机运行时和量化模型 | 构建/加速行为因平台而异 |
| Faster Whisper | NVIDIA GPU 或优化的本地批处理工作 | 高效的 CTranslate2 实施和量化 | 驱动程序、VRAM 和封装兼容性很重要 |
| Hugging Face | 专业语言或微调模型 | 大型模型目录; Buzz 文档彩信支持 | 质量和许可因型号而异 |
| OpenAI 兼容 API | 本地硬件薄弱或服务集中 | 没有本地推理设置,周转速度可能更快 | 上传隐私、使用成本和提供商依赖性 |
对同一剪辑上的两个或三个现实选择进行基准测试。仅模型尺寸并不能预测最佳生产结果。当干净的音频、已知的语言和快速的人工审核很重要时,较小的模型可以获胜;如果较大的模型运行速度太慢以至于用户跳过质量检查,则可能会失败。
由证据绘制的转录管道
音频/视频
|
+--> 可选的语音分离
|
v
解码 + 重新采样 --> 模型/后端 --> 定时段
|
.------------------------+-------------------------。
维维维
文本审查说话人标签翻译
| | |
'-----------------------+------------------------'
v
TXT / SRT / VTT / CSV
“导出已完成”与“字幕已准备好发布”不同
每个阶段都会引入不同的错误。言语分离可能会消除安静的话语;语言检测可以从简短的介绍中选择错误的语言;模型在安静时会产生幻觉;分类可以交换扬声器;翻译可以改变意思;字幕分割可以准确但难以阅读。
构建代表性准确度集
不要用一段干净的独白来评价。创建 20-40 个经过同意的简短剪辑,涵盖重要条件:不同的说话者、口音、麦克风、房间回声、音乐、重叠、领域术语、数字和代码转换。生成人类参考转录本并将其与模型输出分开。
| 测试片 | 测量什么 | 常见故障 |
|---|---|---|
| 干净的单扬声器 | 文字错误和标点符号基线 | 名称、缩写词和罕见术语 |
| 喧闹的采访 | 沉默中的删除率和虚假文本 | 音乐被解读为言语 |
| 重叠扬声器 | 演讲者归属和丢失内容 | 合并或交换回合 |
| 数字/日期 | 语义准确性,而不是拼写相似性 | 金额、单位或预约时间错误 |
| 多语言/语码转换 | 语言选择和未翻译术语 | 语音替换 |
| 长录音 | 漂移、内存使用和吞吐量 | 时间戳漂移或后期运行速度减慢 |
字错误率很有用,但还不够。跟踪关键术语准确性、时间戳错误、说话者归因、每小时幻觉和人工纠正分钟数。对于无障碍字幕,可读性和同步性比 WER 的小改进更重要。
语言选择和提示
现场录音文档建议选择已知的语言,因为检测通常依赖于音频的开头。音乐介绍、另一种语言的问候语或短片可能会误导它。使用名称、技术词汇和预期拼写的初始提示,而不是添加录音不包含的内容。
保留项目术语表并测试每个后端是否一致地使用提示。根据音频检查数字。对于法律、医学、学术或新闻工作,保留录音并用时间戳标记不确定的段落,而不是默默猜测。
翻译是一个单独的质量问题
Whisper 的标准翻译任务将支持的语音转换为英语; Buzz 的文档指出 Large-v3-turbo 与该标准转换路径不兼容。 Buzz 还支持通过 OpenAI 兼容的语言模型端点(包括本地托管端点)进行翻译。第二条路径将识别的文本(不一定是原始音频)发送到配置的服务,但它仍然需要隐私和质量审查。
| 工作流程 | 使用时 | 验证 |
|---|---|---|
| 耳语语音转英语 | 从支持的源语音快速英语渲染 | 比较省略的名称、数字和文化术语 |
| 成绩单然后 LLM 翻译 | 目标语言不是英语或风格控制很重要 | 先检查源成绩单,然后进行双语审阅 |
| 本地 OpenAI 兼容翻译器 | 媒体/文本必须保留在受控硬件上 | 确认端点、日志、模型许可证和网络隔离 |
| 专业翻译 | 出版、法律或高风险意义 | 人类根据音频和上下文签名 |
不要让语言模型向字幕行添加注释、摘要或虚构的上下文。官方文档推荐明确的翻译说明;还验证行数、时序关联、命名实体以及重复术语的一致性。
说话人识别和语音分离
Buzz 可以识别已完成转录的说话者,并可以在识别之前提取/分离语音。这些功能是辅助功能,而不是身份验证。标签输出“Speaker 1”,直到有人将声音映射到一个人。切勿仅根据日记来推断身份、角色、性别或意图。
比较打开和关闭的分离。它可以改善背景音乐的录音,但激进的处理可能会损害呼吸、安静的语音或重叠。存储未触及的源、已处理的轨道和设置。如果证据或档案完整性很重要,请对原始文件进行哈希处理并对副本进行编辑。
字幕质量检查:文字只是工作的一半
| 检查 | 实用规则 | 原因 |
|---|---|---|
| 时机 | 字幕与语音一起出现,并留出足够的阅读时间 | 迟到的字幕会降低理解力 |
| 换行符 | 在自然短语处中断,而不是在紧密相连的单词之间中断 | 改进扫描 |
| 阅读速度 | 使用平台/受众可访问性标准 | 无法阅读密集的字幕 |
| 声音提示 | 根据需要添加有意义的非语音音频 | 无障碍不仅仅包括对话 |
| 发言人变更 | 做出明确的改变而不混乱 | 在访谈和小组讨论中很重要 |
| 姓名/号码 | 根据权威上下文手动验证 | 微小的转录错误可能会改变含义 |
Buzz 导出 TXT、SRT 和 VTT,该项目还描述了当前产品材料中的 CSV 导出。针对目标编辑器或平台测试确切的格式。保留 UTF-8 字符并检查第一、中间和最后部分是否有偏差。
实时转录具有更严格的延迟预算
官方文档警告说,本地麦克风转录是资源密集型的,并且可能不是实时的。测量整个事件持续时间内的捕获到显示延迟、丢失的音频、校正稳定性和热调节。使用有线麦克风并禁用睡眠。为重要的辅助功能事件提供人工字幕或后备显示。
Buzz 提供演示窗口和可选的实时转录导出,可以为 OBS 等软件提供数据。首选项还记录了可以将转录或翻译文本发布到服务器的上传 URL。启用将本地工作流程转变为网络披露;验证接收者的身份、加密传输并避免公开暴露端点。
隐私和本地处理验证
- 在进入隔离环境之前下载模型,然后在测试期间监视出站连接。
- 当禁止云处理时,选择本地后端并将 API 键留空。
- 除非明确批准,否则禁用实时上传和外部翻译。
- 检查临时文件、导出文件夹、最近文件列表、崩溃日志和操作系统备份。
- 加密设备和录音存储;根据保留策略删除工作副本。
- 获得适合管辖范围和环境的录音和转录同意。
开源代码提高了可检查性,但并不能证明二进制文件是安全的。通过官方发布渠道下载,验证提供的签名或校验和,保持依赖项最新并根据组织策略扫描安装工件。
硬件和吞吐量决策
测量实时系数:处理秒数除以音频秒数。值为 0.5 表示一小时的音频大约需要 30 分钟; 2.0 表示大约两个小时。记录模型、后端、量化、设备、加速度、文件格式、批量大小和峰值内存。笔记本电脑电池、热量和同时编辑可能会严重改变结果。
量化可以减少内存并提高速度,有时会牺牲准确性。 Vulkan 支持可以在更广泛的 GPU 上加速 Whisper.cpp,而 CUDA 和 Apple Silicon 路径有自己的兼容性条件。实际机器上的干净基准比通用硬件声明更值得信赖。
CLI 和批量自动化
Buzz CLI 可以添加文件或 URL、选择转录或翻译、选择后端/模型/语言、提供初始提示并导出 SRT、VTT 或 TXT。它可以隐藏 GUI,这对于监视文件夹或媒体管道非常有用。自动化仍然需要防碰撞文件名、退出代码检查、日志和故障隔离。
嗡嗡声添加-任务转录-语言en-模型类型whispercpp-模型尺寸小-提示“姓名:艾达·洛夫莱斯,巴贝奇”--srt--vtt Interview.mp4
根据已安装的版本确认 CLI 选项。将版本固定在生产中并在升级后运行已知的固定装置;即使命令成功,字幕分段或后端更改也可能会改变下游差异。
替代方案
| 选项 | 最适合 | 与 Buzz 的权衡 |
|---|---|---|
| Buzz | 跨平台本地 GUI 加上多个 Whisper 后端 | 仍然需要桌面资源和手动 QA |
| Whisper.cpp CLI | 精益本地或嵌入式自动化 | 集成度较低的编辑工作流程 |
| Faster Whisper 脚本 | 自定义 GPU 批处理管道 | 更多工程和依赖管理 |
| OpenAI 语音转文本 API | 托管规模和最小化本地计算 | 上传、定价和提供商条款 |
| Descript / Premiere 文本工具 | 编辑套件内的转录 | 商业生态系统和较少的本地控制 |
| 人工转录/字幕 | 高风险的可访问性或发布 | 直接成本较高,但负责任的背景审查 |
常见问题
Buzz 免费吗?
官方存储库已获得 MIT 许可,桌面软件无需订阅即可使用。托管 APIs、硬件和第三方模型可能会产生单独的成本。
Buzz 是否可以完全离线工作?
对于在所需资产可用后配置的本地模型工作流程,是的。 API 转录、外部翻译、URL 导入和实时上传使用网络。
支持哪些操作系统?
该项目记录了 macOS、Windows 和 Linux,以及特定于平台的分发和加速选项。
可以制作字幕吗?
是的。它导出定时格式,包括 SRT 和 VTT。人工计时、可读性和术语审查仍然是必要的。
可以识别说话者吗?
它支持转录媒体上的说话人识别,但标签需要人工验证,并且不能作为生物识别身份证明。
可以翻译成英语以外的语言吗?
Buzz 记录了通过可配置的 OpenAI 兼容 AI 服务(包括本地端点)进行的额外翻译。分别验证隐私和翻译质量。
为什么转录速度慢?
模型大小、后端、量化、加速度、音频长度和硬件都很重要。在购买硬件之前对较小的模型和优化的后端进行基准测试。
主要来源
上次审核日期为 2026 年 7 月 25 日。在代表性音频上测试确切的 Buzz 版本和后端;模型支持、加速和分发包随着时间的推移而变化。


