AI Tools

307 tools available

Stable Audio

Stable Audio

Stable Audio 是 Stability AI 的生成式音频平台,可用文字提示生成音乐、循环、分轨、氛围声和音效。Stable Audio 3.0 系列面向艺术实验,也提供适合研究和本地创作流程的 open-weight 选项。

Stable AudioStability AI音频AI音乐生成
1690
AudioCraft

AudioCraft

Open source library for audio/music generation by Meta, which mainly includes two models, MusicGen: text-to-music model, AudioGen: text-generated sound model. - 智能 AI 工具,助力您的工作效率。

ai-musicfree
2260
Bark

Bark

Bark is a transformer-based text-to-audio model created by Suno. Bark can generate highly realistic, multilingual speech as well as other audio - including music, background noise and simple sound effects. - 智能 AI 工具,助力您的工作效率。

ai-musicfree
1400
ElevenLabs Sound Effects

ElevenLabs Sound Effects

ElevenLabs Sound Effects 是文生音效工具,可用提示词生成自定义 SFX、环境声、循环音效和电影感音频。它支持时长控制、prompt influence、循环音效、多版本生成、下载和 API 工作流,适合视频、游戏、播客和应用。

ElevenLabs Sound EffectsAI音效文生音效
3690
Mureka

Mureka

Mureka 是一体化 AI 音乐创作平台,可从提示词或歌词生成歌曲,使用参考音频和 Vocal ID,并进行局部编辑、延长、Remix、分轨与导出。

MurekaAI 音乐生成歌词生成歌曲
1780
Udio

Udio

Create music from simple text prompts by specifying topics, genres, and other descriptors which are then transformed into professional quality tracks. - 智能 AI 工具,助力您的工作效率。

ai-musicfree
1500
Suno AI

Suno AI

Create stunning original music for free in seconds using AI. Make your own masterpieces, share with friends, and discover music from artists worldwide. - 智能 AI 工具,助力您的工作效率。

ai-musicfree
1350
Lalal.ai

Lalal.ai

Split vocal and instrumental tracks quickly and accurately with LALAL.AI. Upload any audio file and receive high-quality extracted tracks in a few seconds. - 智能 AI 工具,助力您的工作效率。

voice-processingfree
1090
Vocal Remover

Vocal Remover

Separate voice from music out of a song free with powerful AI algorithms - 智能 AI 工具,助力您的工作效率。

voice-processingfree
1010
So-VITS-SVC

So-VITS-SVC

So-VITS-SVC 4.1 是一个存档的开源研究框架,用于歌声转换,而不是文本到语音的转换。该独立指南涵盖同意、许可、干净数据集、F0 和编码器、培训、推理、评估、披露、安全和替代方案。

so-vits-svc歌声转换声音转换
1330
Shazam

Shazam

Shazam 是 Apple 的音乐识别应用,可识别身边或其他 App 中正在播放的歌曲。它适合听众、DJ、创作者和营销人员快速找到歌名、歌词、视频、演出信息和后续播放入口。

Shazam音乐识别识别歌曲
1460
ChatTTS

ChatTTS

ChatTTS is a text-to-speech model designed specifically for dialogue scenario such as LLM assistant. It supports both English and Chinese languages. - 智能 AI 工具,助力您的工作效率。

text-to-speechfree
1450
Tetos

Tetos

Tetos 是一个开源 Python/CLI 包装层,为多个文本转语音服务提供统一接口。它适合希望比较或切换 Edge TTS、OpenAI、Azure、Google、火山引擎、百度、Minimax、讯飞、Fish Audio 等引擎的开发者。

Tetostext to speechTTS API
1380
EmotiVoice

EmotiVoice

EmotiVoice 是网易有道开源的多音色、提示词可控 TTS 引擎,支持中英文语音合成、2000+ 音色、情绪与风格提示控制,适合研究、开发、内容原型、角色配音和语音应用实验。

EmotiVoice情绪TTS开源文字转语音
1440
ElevenLabs

ElevenLabs

ElevenLabs 是 AI 语音平台,覆盖文本转语音、声音克隆、配音、语音识别、voice agents 和生成式音频 API。

ElevenLabsAI voice generatortext to speech
1610
Coqui TTS

Coqui TTS

A deep learning toolkit for Text-to-Speech, battle-tested in research and production - 智能 AI 工具,助力您的工作效率。

text-to-speechfree
1690
Hailuo AI TTS

Hailuo AI TTS

Hailuo AI TTS 与 MiniMax Audio 相关,是面向多语种 AI 语音、声音克隆和音频内容工作流的文本转语音产品。

Hailuo AI TTSMiniMax Audiotext to speech
2770
Azure Text to Speech

Azure Text to Speech

The best and most realistic voice tools currently available - 智能 AI 工具,助力您的工作效率。

text-to-speech
1420
Index TTS

Index TTS

IndexTTS 是 Bilibili 开源的工业级、可控、高效零样本文本转语音系统。它更适合语音研究者和开发者做可控 TTS 实验,而不是普通用户寻找成品网页配音工具。

Index TTStext to speechzero-shot TTS
5130
Whisper Web

Whisper Web

Whisper Web 是基于 Transformers.js 的 MIT 开源浏览器语音识别 Demo,支持本地转录、时间戳以及 TXT/JSON 导出。

Whisper Web浏览器语音转文字Transformers.js
1390
WhisperX

WhisperX

WhisperX 是面向长音频的开源语音管线,在 faster-whisper 批量转写之上增加语言专属词级强制对齐和可选 pyannote 说话人分离。

WhisperX词级对齐说话人分离
1530
WhisperDesktop

WhisperDesktop

WhisperDesktop 是一个 Windows 桌面应用程序和 DirectCompute 实现,用于在音频、视频和麦克风输入上本地运行 OpenAI Whisper。本指南涵盖设置、模型、GPU、字幕、隐私和替代方案。

WhisperDesktopOpenAI Whisperspeech recognition
2060
Buzz

Buzz

Buzz 是一款获得 MIT 许可的免费桌面应用程序,用于在 macOS、Windows 和 Linux 上进行本地 Whisper 转录、字幕、实时字幕、翻译和说话人标签。本指南比较了后端、硬件、隐私、准确性测试、字幕 QA、CLI 自动化和云替代方案。

BuzzBuzz Captions离线转录
1910
Whisper.cpp

Whisper.cpp

Whisper.cpp 是 OpenAI Whisper 的轻依赖 C/C++ 实现,用于本地转录、翻译、流媒体、服务器和嵌入式应用程序。本指南涵盖模型、量化、后端、准确性、隐私和部署。

speech-recognitionfree
1810
1...678910...13