ComfyUI Node
AceStep 1.5 SFT Model Loader
Loads the AceStep 1.5 SFT diffusion model, dual CLIP text encoders, and audio VAE. Connect MODEL to Generate (or Lora Loader first), CLIP to TextEncode, and VAE to Generate.
AceStep 1.5 SFT Model Loader
- model
- clip
- vae
◄diffusion_model▾►
◄text_encoder_1▾►
◄text_encoder_2▾►
◄vae_name▾►
Categoryaudio/AceStep SFT
Inputs (4)
| Name | Type | Default | Description |
|---|---|---|---|
| diffusion_model | COMBO | AceStep 1.5 diffusion model (DiT). e.g. Audio/acestep_v1.5_sft.safetensors | |
| text_encoder_1 | COMBO | Qwen3-0.6B encoder for captions/lyrics. e.g. Audio/qwen_0.6b_ace15.safetensors | |
| text_encoder_2 | COMBO | Qwen3 LLM for audio codes (1.7B or 4B). e.g. Audio/qwen_1.7b_ace15.safetensors | |
| vae_name | COMBO | AceStep 1.5 audio VAE. e.g. Audio/ace_1.5_vae.safetensors |
Outputs (3)
| Name | Type | Description |
|---|---|---|
| model | MODEL | — |
| clip | CLIP | — |
| vae | VAE | — |