ComfyUI-AuK_Doc
AuK speech generation and editing for ComfyUI with low-VRAM options and local/API prompt enhancement.
Nodes (4)
ComfyUI-AuK_Doc
原项目
基于腾讯混元 Tencent-Hunyuan/AuK 的 ComfyUI 节点改版。AuK 支持语音生成、参考音色生成、内容编辑、音色与情绪转换、语速和音高调整、降噪及人声分离。本项目保留原项目 MIT 许可。
本版改进
- 独立节点包,在节点目录安装 requirements.txt 即可,无需保留额外的 AuK 源码目录。
- 从 ComfyUI models 目录下拉选择 Base / Flash 权重及 Qwen 模型。
- 增加 CPU 卸载、low_vram 模式和顺序 CFG,减少显存占用。
- 生成时长改为数字输入框,支持小数秒。
- 增加 OpenAI 兼容服务设置节点,以及 llama.cpp 本地模型适配节点,用于提示词增强。
- 音频读写改用 SoundFile,修复新版 TorchAudio 要求 TorchCodec 的问题。
- 提供 Base / Flash 和提示词增强工作流,内置官方功能提示词 Markdown Note。
- 节点名称统一带
_Doc后缀,便于与官方节点区分。
安装
在 ComfyUI/custom_nodes 目录执行:
git clone https://github.com/DocWorkBox/ComfyUI-AuK_Doc.git
cd ComfyUI-AuK_Doc
python -m pip install -r requirements.txt
请使用运行 ComfyUI 的 Python 环境。安装完成后重启 ComfyUI。也可以下载 Release 节点包,将其中的 ComfyUI-AuK_Doc 文件夹放入 custom_nodes 后安装依赖。
更新时替换旧 _Doc 节点目录,模型目录保留即可。
模型下载与目录
| 模型 | 魔搭下载 | 需要的文件 | |---|---|---| | AuK-Base | Tencent-Hunyuan/AuK | auk_base.safetensors、vae.safetensors、config.yaml | | AuK-Flash | Tencent-Hunyuan/AuK-Flash | auk_flash.safetensors、vae.safetensors、config.yaml | | Qwen 编码器 | Qwen/Qwen2.5-Omni-3B | 完整模型目录,包含全部权重分片、索引、tokenizer 和 processor 配置 |
Base 和 Flash 可以只下载一个,也可以都下载用于对比。二者共用 Qwen2.5-Omni-3B。
ComfyUI/
├─ custom_nodes/
│ └─ ComfyUI-AuK_Doc/
└─ models/
├─ auk/
│ ├─ AuK/
│ │ ├─ auk_base.safetensors
│ │ ├─ vae.safetensors
│ │ └─ config.yaml
│ └─ AuK-Flash/
│ ├─ auk_flash.safetensors
│ ├─ vae.safetensors
│ └─ config.yaml
└─ text_encoders/
└─ Qwen2.5-Omni-3B/
├─ config.json
├─ model.safetensors.index.json
├─ model-00001-of-00003.safetensors
├─ model-00002-of-00003.safetensors
├─ model-00003-of-00003.safetensors
└─ 其余 tokenizer、processor 等文件
Qwen 编码器需要原始完整模型,不能用 GGUF 替代。GGUF 只用于可选的 llama.cpp 提示词增强。
使用
将 workflows 中的 JSON 拖入 ComfyUI:
| 工作流 | 用途 | |---|---| | auk_flash_low_vram.json | Flash 生成与编辑,关闭提示词增强 | | auk_base_low_vram_Doc.json | Base 生成与编辑,32 步、CFG 2 | | auk_flash_llm_Doc.json | 通过 OpenAI 兼容服务增强提示词 | | auk_flash_llamacpp_Doc.json | 通过本地 llama.cpp 模型增强提示词 |
生成与编辑
- 在 AuK Models Loader (Low VRAM)_Doc 中选择 AuK 和 Qwen 模型;显存较小时使用
low_vram。 - 在 AuK Generate / Edit_Doc 的
instruction中填写指令。工作流里的 Markdown Note 提供官方功能模板,可直接复制并修改。 - 纯描述语音生成不连接音频;参考音色生成、编辑和分离任务将音频连接到
input_audio。歌词编辑需使用无伴奏纯人声。 - 设置生成时长并运行:关闭提示词增强时必须大于 0;开启增强时填 0 可自动估计。输入音频与生成音频时长合计不能超过 30 秒。
Base 默认使用 32 步 / CFG 2 / sway -1;Flash 使用固定四步、CFG 0。对比效果时保持提示词、输入音频、时长和种子一致。
OpenAI 提示词增强
在 AuK OpenAI Settings_Doc 中填写 base_url、api_key 和 model,将输出连接到 Generate 的 llm_config,打开 Enable Prompt Enhancer。分享工作流前清空 API Key。
llama.cpp 提示词增强
需要安装能提供 Llama-cpp Model Loader、输出类型为 LLAMACPPMODEL 的 llama-cpp_vllm 插件,并将该加载器使用的 GGUF 模型放入 ComfyUI/models/LLM。
Llama-cpp Model Loader → AuK Llama.cpp Adapter_Doc → Generate.llm_config
选择 GGUF 指令模型,开启 Generate 的 Enable Prompt Enhancer,无需填写 API 地址和 Key。默认增强完成后卸载共享 llama.cpp 模型,下次运行时按需重载。本地 LLM 只负责提示词增强,AuK 使用的 Qwen 编码器仍需单独下载。