2025-03-02 22:57:28 +08:00
2025-02-21 05:16:26 +08:00
2025-02-25 20:50:13 +08:00
2025-02-21 05:16:26 +08:00
2025-03-02 22:57:28 +08:00
2025-02-21 05:16:26 +08:00
2025-02-21 04:25:01 +08:00
2025-02-21 04:25:01 +08:00
2025-03-02 22:57:28 +08:00
2025-03-02 22:57:28 +08:00
2025-03-02 22:57:28 +08:00
2025-03-01 02:26:32 +08:00
2025-02-21 05:16:26 +08:00
2025-03-02 22:57:28 +08:00
2025-02-21 23:10:18 +08:00

中文 | English

Step-Audio-TTS 的 ComfyUI 节点, 文本转语音, 可说话, 唱歌, RAP, 或者克隆声音.

更新

[2025-03-02]⚒️: 增加实验性的 custom_mark, 用 "()" 包围例如 (温柔)(东北话), 它可能会有效.

[2025-02-25]⚒️: 支持自定义说话者 custom_speaker. 但注意下图三个地方必须保持一致的说话者名称. 自定义时 speaker 将自动无效.

为了不影响更新, 不得不将 Step-Audio-speakers 文件夹移动到 ComfyUI\models\TTS 文件夹中, 请自行移动. 结构如下:

ComfyUI\models\TTS
├── Step-Audio-Tokenizer
├── Step-Audio-speakers
├── Step-Audio-TTS-3B

模型下载

下载到 ComfyUI\models\TTS 文件夹中.

Huggingface

模型 链接
Step-Audio-Tokenizer 🤗huggingface
Step-Audio-TTS-3B 🤗huggingface

Modelscope

模型 链接
Step-Audio-Tokenizer modelscope
Step-Audio-TTS-3B modelscope

应包含以下结构:

ComfyUI\models\TTS
├── Step-Audio-Tokenizer
├── Step-Audio-TTS-3B

欢迎贡献更多声音

音频文件命名为 {说话者}_prompt.WAV, 例如 明文_prompt.WAV 我将添加它们到代码中. 从而无需克隆.

当前支持的声音在 Step-Audio-speakers 文件夹中, 欢迎提交更多声音.

支持 中文, 英文, 韩语, 日语, 四川话, 粤语等

致谢

本项目的部分代码来自:

感谢以上所有开源项目对本项目开源做出的贡献!

S
Description
No description provided
Readme Apache-2.0
7.9 MiB
Languages
Python 99.5%
Cuda 0.4%
C++ 0.1%