ComfyUI-MiMo-TTS
ComfyUI nodes for MiMo-V2.5-TTS preset voices, voice design, and voice cloning.
ComfyUI MiMo TTS
为小米 MiMo-V2.5-TTS 系列 API 提供三个 ComfyUI 节点:
- MiMo 预置音色合成:使用官方预置音色生成语音。
- MiMo 文本音色设计:根据文字描述设计音色并生成语音。
- MiMo 音色克隆:使用参考音频复刻音色并生成语音。
节点位于 audio/MiMo TTS 分类,输出为标准 ComfyUI AUDIO,可连接试听、剪辑或 Save Audio 节点。
安装
在 ComfyUI 的 custom_nodes 目录执行:
git clone https://github.com/TimekeeperXY/ComfyUI-MiMo-TTS.git
然后重启 ComfyUI。本插件只使用 ComfyUI 已包含的 Python 依赖,不需要额外安装软件包。
API Key
可以直接填写节点的 api_key。更推荐设置 MIMO_API_KEY 环境变量,然后将节点输入留空:
$env:MIMO_API_KEY = "你的 API Key"
节点中填写的 Key 可能保存在工作流 JSON 中。分享工作流前请务必清除。
如需调试代理或兼容服务,可通过 MIMO_API_URL 环境变量覆盖完整接口地址;默认地址为:
https://api.xiaomimimo.com/v1/chat/completions
预置音色
| Voice ID | 语言 | 性别 |
| --- | --- | --- |
| mimo_default | 随部署集群而异 | 随部署集群而异 |
| 冰糖 | 中文 | 女性 |
| 茉莉 | 中文 | 女性 |
| 苏打 | 中文 | 男性 |
| 白桦 | 中文 | 男性 |
| Mia | 英文 | 女性 |
| Chloe | 英文 | 女性 |
| Milo | 英文 | 男性 |
| Dean | 英文 | 男性 |
mimo_default 在中国集群默认为冰糖,在其他集群默认为 Mia。
使用说明
预置音色合成
选择 voice,在 text 中输入需要朗读的内容。style_instruction 可留空,也可以填写语速、情绪、方言和角色等自然语言指令。
音频标签可以直接写在 text 中,例如 (温柔)、(粤语)、[深呼吸]、[停顿]。
文本音色设计
在 voice_description 中用 1 至 4 句话描述角色、年龄、音质和说话风格,在 text 中填写需要朗读的内容。开启 optimize_text_preview 后,服务端可能润色目标文本。
音色克隆
将 ComfyUI 原生 Load Audio 或 Record Audio 节点连接到 reference_audio。节点会在内存中转为单声道 PCM16 WAV;转换后的 Base64 数据不得超过 10 MB。
只应克隆你本人或已获得明确授权的声音。不得将该功能用于冒充、诈骗或未经同意的声音复制。
其他参数
timeout:单次请求超时秒数。max_retries:遇到连接问题、HTTP 429 或临时服务端错误时的最大重试次数。
MiMo API 会产生费用。相同输入通常会命中 ComfyUI 执行缓存;如需重新合成,可修改任一有效输入后再次运行。
许可证
本项目采用 MIT License。