
Stable Audio
Stable Audio 是 Stability AI 的生成式音频平台,可用文字提示生成音乐、循环、分轨、氛围声和音效。Stable Audio 3.0 系列面向艺术实验,也提供适合研究和本地创作流程的 open-weight 选项。

Stable Audio 是 Stability AI 的生成式音频平台,可用文字提示生成音乐、循环、分轨、氛围声和音效。Stable Audio 3.0 系列面向艺术实验,也提供适合研究和本地创作流程的 open-weight 选项。
Open source library for audio/music generation by Meta, which mainly includes two models, MusicGen: text-to-music model, AudioGen: text-generated sound model. - 智能 AI 工具,助力您的工作效率。
Bark is a transformer-based text-to-audio model created by Suno. Bark can generate highly realistic, multilingual speech as well as other audio - including music, background noise and simple sound effects. - 智能 AI 工具,助力您的工作效率。

ElevenLabs Sound Effects 是文生音效工具,可用提示词生成自定义 SFX、环境声、循环音效和电影感音频。它支持时长控制、prompt influence、循环音效、多版本生成、下载和 API 工作流,适合视频、游戏、播客和应用。
Mureka 是一体化 AI 音乐创作平台,可从提示词或歌词生成歌曲,使用参考音频和 Vocal ID,并进行局部编辑、延长、Remix、分轨与导出。

Create music from simple text prompts by specifying topics, genres, and other descriptors which are then transformed into professional quality tracks. - 智能 AI 工具,助力您的工作效率。

Create stunning original music for free in seconds using AI. Make your own masterpieces, share with friends, and discover music from artists worldwide. - 智能 AI 工具,助力您的工作效率。

Split vocal and instrumental tracks quickly and accurately with LALAL.AI. Upload any audio file and receive high-quality extracted tracks in a few seconds. - 智能 AI 工具,助力您的工作效率。

Separate voice from music out of a song free with powerful AI algorithms - 智能 AI 工具,助力您的工作效率。

So-VITS-SVC 4.1 是一个存档的开源研究框架,用于歌声转换,而不是文本到语音的转换。该独立指南涵盖同意、许可、干净数据集、F0 和编码器、培训、推理、评估、披露、安全和替代方案。

Shazam 是 Apple 的音乐识别应用,可识别身边或其他 App 中正在播放的歌曲。它适合听众、DJ、创作者和营销人员快速找到歌名、歌词、视频、演出信息和后续播放入口。

ChatTTS is a text-to-speech model designed specifically for dialogue scenario such as LLM assistant. It supports both English and Chinese languages. - 智能 AI 工具,助力您的工作效率。

Tetos 是一个开源 Python/CLI 包装层,为多个文本转语音服务提供统一接口。它适合希望比较或切换 Edge TTS、OpenAI、Azure、Google、火山引擎、百度、Minimax、讯飞、Fish Audio 等引擎的开发者。

EmotiVoice 是网易有道开源的多音色、提示词可控 TTS 引擎,支持中英文语音合成、2000+ 音色、情绪与风格提示控制,适合研究、开发、内容原型、角色配音和语音应用实验。

ElevenLabs 是 AI 语音平台,覆盖文本转语音、声音克隆、配音、语音识别、voice agents 和生成式音频 API。

A deep learning toolkit for Text-to-Speech, battle-tested in research and production - 智能 AI 工具,助力您的工作效率。

Hailuo AI TTS 与 MiniMax Audio 相关,是面向多语种 AI 语音、声音克隆和音频内容工作流的文本转语音产品。

The best and most realistic voice tools currently available - 智能 AI 工具,助力您的工作效率。

IndexTTS 是 Bilibili 开源的工业级、可控、高效零样本文本转语音系统。它更适合语音研究者和开发者做可控 TTS 实验,而不是普通用户寻找成品网页配音工具。

Whisper Web 是基于 Transformers.js 的 MIT 开源浏览器语音识别 Demo,支持本地转录、时间戳以及 TXT/JSON 导出。
WhisperX 是面向长音频的开源语音管线,在 faster-whisper 批量转写之上增加语言专属词级强制对齐和可选 pyannote 说话人分离。

WhisperDesktop 是一个 Windows 桌面应用程序和 DirectCompute 实现,用于在音频、视频和麦克风输入上本地运行 OpenAI Whisper。本指南涵盖设置、模型、GPU、字幕、隐私和替代方案。

Buzz 是一款获得 MIT 许可的免费桌面应用程序,用于在 macOS、Windows 和 Linux 上进行本地 Whisper 转录、字幕、实时字幕、翻译和说话人标签。本指南比较了后端、硬件、隐私、准确性测试、字幕 QA、CLI 自动化和云替代方案。

Whisper.cpp 是 OpenAI Whisper 的轻依赖 C/C++ 实现,用于本地转录、翻译、流媒体、服务器和嵌入式应用程序。本指南涵盖模型、量化、后端、准确性、隐私和部署。