Buzz
Buzz

Buzz

Buzz 是一款获得 MIT 许可的免费桌面应用程序,用于在 macOS、Windows 和 Linux 上进行本地 Whisper 转录、字幕、实时字幕、翻译和说话人标签。本指南比较了后端、硬件、隐私、准确性测试、字幕 QA、CLI 自动化和云替代方案。

186

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

BuzzBuzz Captions离线转录Whisper转录开源字幕工具语音转文字SRT字幕VTT字幕音频翻译

Product Preview

A quick visual look at Buzz before you visit the official site.

Published 1/21/2026
Buzz screenshot

Editorial Review

About Buzz

Buzz 是一款免费的开源桌面应用程序,用于将音频和视频转换为文字记录、字幕和实时字幕。它在适用于 macOS、Windows 和 Linux 的图形工作流程中封装了多个语音识别后端(Whisper、Whisper.cpp、Faster Whisper、兼容的 Hugging Face 模型和托管的 OpenAI 兼容 API)。该存储库已获得 MIT 许可。

当用户需要本地处理和可编辑导出而不组装 Python、FFmpeg 和模型工具时,Buzz 最有价值。 “离线”是一种配置选择,而不是绝对的产品属性:本地后端可以将媒体保存在计算机上,而 API 转录、AI 翻译、URL 导入、模型下载和可选的实时上传功能会产生网络流量。验证所选的工作流程而不是依赖标签。

Official Buzz offline transcription banner
Buzz 将基于 Whisper 的转录打包到跨平台桌面应用程序中。型号选择、硬件和音频质量决定速度和准确性。
Official Buzz file import and transcription interface
导入工作流程公开任务、语言、后端和模型设置。将这些选择与输出一起保存,以便以后的更正可以重现。

选择模型之前选择执行路径

后端最适合实力主要权衡
耳语一般局部基线参考生态系统和广泛的语言支持可能是资源密集型的
Whisper.cppCPU、Apple Silicon 或 Vulkan 功能的设备可移植的本机运行时和量化模型构建/加速行为因平台而异
Faster WhisperNVIDIA GPU 或优化的本地批处理工作高效的 CTranslate2 实施和量化驱动程序、VRAM 和封装兼容性很重要
Hugging Face专业语言或微调模型大型模型目录; Buzz 文档彩信支持质量和许可因型号而异
OpenAI 兼容 API本地硬件薄弱或服务集中没有本地推理设置,周转速度可能更快上传隐私、使用成本和提供商依赖性

对同一剪辑上的两个或三个现实选择进行基准测试。仅模型尺寸并不能预测最佳生产结果。当干净的音频、已知的语言和快速的人工审核很重要时,较小的模型可以获胜;如果较大的模型运行速度太慢以至于用户跳过质量检查,则可能会失败。

由证据绘制的转录管道

 音频/视频
    |
    +--> 可选的语音分离
    |
    v
 解码 + 重新采样 --> 模型/后端 --> 定时段
                                          |
                  .------------------------+-------------------------。
                  维维维
             文本审查说话人标签翻译
                  |                       |                      |
                  '-----------------------+------------------------'
                                          v
                                  TXT / SRT / VTT / CSV

 “导出已完成”与“字幕已准备好发布”不同

每个阶段都会引入不同的错误。言语分离可能会消除安静的话语;语言检测可以从简短的介绍中选择错误的语言;模型在安静时会产生幻觉;分类可以交换扬声器;翻译可以改变意思;字幕分割可以准确但难以阅读。

构建代表性准确度集

不要用一段干净的独白来评价。创建 20-40 个经过同意的简短剪辑,涵盖重要条件:不同的说话者、口音、麦克风、房间回声、音乐、重叠、领域术语、数字和代码转换。生成人类参考转录本并将其与模型输出分开。

测试片测量什么常见故障
干净的单扬声器文字错误和标点符号基线名称、缩写词和罕见术语
喧闹的采访沉默中的删除率和虚假文本音乐被解读为言语
重叠扬声器演讲者归属和丢失内容合并或交换回合
数字/日期语义准确性,而不是拼写相似性金额、单位或预约时间错误
多语言/语码转换语言选择和未翻译术语语音替换
长录音漂移、内存使用和吞吐量时间戳漂移或后期运行速度减慢

字错误率很有用,但还不够。跟踪关键术语准确性、时间戳错误、说话者归因、每小时幻觉和人工纠正分钟数。对于无障碍字幕,可读性和同步性比 WER 的小改进更重要。

语言选择和提示

现场录音文档建议选择已知的语言,因为检测通常依赖于音频的开头。音乐介绍、另一种语言的问候语或短片可能会误导它。使用名称、技术词汇和预期拼写的初始提示,而不是添加录音不包含的内容。

保留项目术语表并测试每个后端是否一致地使用提示。根据音频检查数字。对于法律、医学、学术或新闻工作,保留录音并用时间戳标记不确定的段落,而不是默默猜测。

翻译是一个单独的质量问题

Whisper 的标准翻译任务将支持的语音转换为英语; Buzz 的文档指出 Large-v3-turbo 与该标准转换路径不兼容。 Buzz 还支持通过 OpenAI 兼容的语言模型端点(包括本地托管端点)进行翻译。第二条路径将识别的文本(不一定是原始音频)发送到配置的服务,但它仍然需要隐私和质量审查。

工作流程使用时验证
耳语语音转英语从支持的源语音快速英语渲染比较省略的名称、数字和文化术语
成绩单然后 LLM 翻译目标语言不是英语或风格控制很重要先检查源成绩单,然后进行双语审阅
本地 OpenAI 兼容翻译器媒体/文本必须保留在受控硬件上确认端点、日志、模型许可证和网络隔离
专业翻译出版、法律或高风险意义人类根据音频和上下文签名

不要让语言模型向字幕行添加注释、摘要或虚构的上下文。官方文档推荐明确的翻译说明;还验证行数、时序关联、命名实体以及重复术语的一致性。

说话人识别和语音分离

Buzz 可以识别已完成转录的说话者,并可以在识别之前提取/分离语音。这些功能是辅助功能,而不是身份验证。标签输出“Speaker 1”,直到有人将声音映射到一个人。切勿仅根据日记来推断身份、角色、性别或意图。

比较打开和关闭的分离。它可以改善背景音乐的录音,但激进的处理可能会损害呼吸、安静的语音或重叠。存储未触及的源、已处理的轨道和设置。如果证据或档案完整性很重要,请对原始文件进行哈希处理并对副本进行编辑。

字幕质量检查:文字只是工作的一半

检查实用规则原因
时机字幕与语音一起出现,并留出足够的阅读时间迟到的字幕会降低理解力
换行符在自然短语处中断,而不是在紧密相连的单词之间中断改进扫描
阅读速度使用平台/受众可访问性标准无法阅读密集的字幕
声音提示根据需要添加有意义的非语音音频无障碍不仅仅包括对话
发言人变更做出明确的改变而不混乱在访谈和小组讨论中很重要
姓名/号码根据权威上下文手动验证微小的转录错误可能会改变含义

Buzz 导出 TXT、SRT 和 VTT,该项目还描述了当前产品材料中的 CSV 导出。针对目标编辑器或平台测试确切的格式。保留 UTF-8 字符并检查第一、中间和最后部分是否有偏差。

实时转录具有更严格的延迟预算

官方文档警告说,本地麦克风转录是资源密集型的,并且可能不是实时的。测量整个事件持续时间内的捕获到显示延迟、丢失的音频、校正稳定性和热调节。使用有线麦克风并禁用睡眠。为重要的辅助功​​能事件提供人工字幕或后备显示。

Buzz 提供演示窗口和可选的实时转录导出,可以为 OBS 等软件提供数据。首选项还记录了可​​以将转录或翻译文本发布到服务器的上传 URL。启用将本地工作流程转变为网络披露;验证接收者的身份、加密传输并避免公开暴露端点。

隐私和本地处理验证

  • 在进入隔离环境之前下载模型,然后在测试期间监视出站连接。
  • 当禁止云处理时,选择本地后端并将 API 键留空。
  • 除非明确批准,否则禁用实时上传和外部翻译。
  • 检查临时文件、导出文件夹、最近文件列表、崩溃日志和操作系统备份。
  • 加密设备和录音存储;根据保留策略删除工作副本。
  • 获得适合管辖范围和环境的录音和转录同意。

开源代码提高了可检查性,但并不能证明二进制文件是安全的。通过官方发布渠道下载,验证提供的签名或校验和,保持依赖项最新并根据组织策略扫描安装工件。

硬件和吞吐量决策

测量实时系数:处理秒数除以音频秒数。值为 0.5 表示一小时的音频大约需要 30 分钟; 2.0 表示大约两个小时。记录模型、后端、量化、设备、加速度、文件格式、批量大小和峰值内存。笔记本电脑电池、热量和同时编辑可能会严重改变结果。

量化可以减少内存并提高速度,有时会牺牲准确性。 Vulkan 支持可以在更广泛的 GPU 上加速 Whisper.cpp,而 CUDA 和 Apple Silicon 路径有自己的兼容性条件。实际机器上的干净基准比通用硬件声明更值得信赖。

CLI 和批量自动化

Buzz CLI 可以添加文件或 URL、选择转录或翻译、选择后端/模型/语言、提供初始提示并导出 SRT、VTT 或 TXT。它可以隐藏 GUI,这对于监视文件夹或媒体管道非常有用。自动化仍然需要防碰撞文件名、退出代码检查、日志和故障隔离。

嗡嗡声添加-任务转录-语言en-模型类型whispercpp-模型尺寸小-提示“姓名:艾达·洛夫莱斯,巴贝奇”--srt--vtt Interview.mp4

根据已安装的版本确认 CLI 选项。将版本固定在生产中并在升级后运行已知的固定装置;即使命令成功,字幕分段或后端更改也可能会改变下游差异。

替代方案

选项最适合与 Buzz 的权衡
Buzz跨平台本地 GUI 加上多个 Whisper 后端仍然需要桌面资源和手动 QA
Whisper.cpp CLI精益本地或嵌入式自动化集成度较低的编辑工作流程
Faster Whisper 脚本自定义 GPU 批处理管道更多工程和依赖管理
OpenAI 语音转文本 API托管规模和最小化本地计算上传、定价和提供商条款
Descript / Premiere 文本工具编辑套件内的转录商业生态系统和较少的本地控制
人工转录/字幕高风险的可访问性或发布直接成本较高,但负责任的背景审查

常见问题

Buzz 免费吗?

官方存储库已获得 MIT 许可,桌面软件无需订阅即可使用。托管 APIs、硬件和第三方模型可能会产生单独的成本。

Buzz 是否可以完全离线工作?

对于在所需资产可用后配置的本地模型工作流程,是的。 API 转录、外部翻译、URL 导入和实时上传使用网络。

支持哪些操作系统?

该项目记录了 macOS、Windows 和 Linux,以及特定于平台的分发和加速选项。

可以制作字幕吗?

是的。它导出定时格式,包括 SRT 和 VTT。人工计时、可读性和术语审查仍然是必要的。

可以识别说话者吗?

它支持转录媒体上的说话人识别,但标签需要人工验证,并且不能作为生物识别身份证明。

可以翻译成英语以外的语言吗?

Buzz 记录了通过可配置的 OpenAI 兼容 AI 服务(包括本地端点)进行的额外翻译。分别验证隐私和翻译质量。

为什么转录速度慢?

模型大小、后端、量化、加速度、音频长度和硬件都很重要。在购买硬件之前对较小的模型和优化的后端进行基准测试。

主要来源

上次审核日期为 2026 年 7 月 25 日。在代表性音频上测试确切的 Buzz 版本和后端;模型支持、加速和分发包随着时间的推移而变化。

Ready to try Buzz?

Visit the official website to get started

Visit Buzz

Quick Info

Category
语音识别
Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper 是 OpenAI 以 MIT 许可证发布的多语言语音识别模型与 Python 参考实现,可在本地完成转写、语言识别和语音到英语的翻译。

Whisper语音识别本地转写
1730
Whisper.cpp

Whisper.cpp

Whisper.cpp 是 OpenAI Whisper 的轻依赖 C/C++ 实现,用于本地转录、翻译、流媒体、服务器和嵌入式应用程序。本指南涵盖模型、量化、后端、准确性、隐私和部署。

speech-recognitionfree
1770
WhisperDesktop

WhisperDesktop

WhisperDesktop 是一个 Windows 桌面应用程序和 DirectCompute 实现,用于在音频、视频和麦克风输入上本地运行 OpenAI Whisper。本指南涵盖设置、模型、GPU、字幕、隐私和替代方案。

WhisperDesktopOpenAI Whisperspeech recognition
2000
WhisperX

WhisperX

WhisperX 是面向长音频的开源语音管线,在 faster-whisper 批量转写之上增加语言专属词级强制对齐和可选 pyannote 说话人分离。

WhisperX词级对齐说话人分离
1490