Nodes/ComfyUI-AceStep_SFT/AceStep 1.5 SFT Generate
ComfyUI Node

AceStep 1.5 SFT Generate

AceStep 1.5 SFT sampler + decoder. Requires MODEL and conditioning inputs. Audio output requires VAE connected.

By jeankassio·Created 5 months ago·Updated 3 months ago· 53
AceStep 1.5 SFT Generate
  • model
  • positive
  • negative
  • vae
  • latent_or_audio
  • model
  • vae
  • positive
  • negative
  • latent
  • audio
seed0
steps50
cfg7.0
sampler_nameeuler
schedulernormal
denoise1.00
duration60.0
infer_methodode
guidance_modeapg
batch_size1
latent_shift0.00
latent_rescale1.00
fade_in_duration0.0
fade_out_duration0.0
use_tiled_vaetrue
unload_models_after_generatefalse
voice_boost0.0
apg_eta0.00
apg_momentum-0.75
apg_norm_threshold2.5
guidance_interval0.50
guidance_interval_decay0.00
min_guidance_scale3.0
guidance_scale_text-1.0
guidance_scale_lyric-1.0
omega_scale0.00
erg_scale0.00
cfg_interval_start0.00
cfg_interval_end1.00
shift3.0
Categoryaudio/AceStep SFT

Inputs (35)

NameTypeDefaultDescription
modelMODELAceStep 1.5 diffusion model (from Load Diffusion Model or with LoRA applied).
positiveCONDITIONINGPositive conditioning from AceStep 1.5 SFT TextEncode.
negativeCONDITIONINGNegative conditioning from AceStep 1.5 SFT TextEncode.
seedINT00–18446744073709550000
stepsINT501–200Diffusion inference steps.
cfgFLOAT7.01–20Classifier-free guidance scale.
sampler_nameCOMBOeuler44 options: euler, euler_cfg_pp, euler_ancestral, euler_ancestral_cfg_pp, heun, heunpp2, +38
schedulerCOMBOnormal9 options: simple, sgm_uniform, karras, exponential, ddim_uniform, beta, +3
denoiseFLOAT1.000–1Denoise strength. 1.0 = full generation. < 1.0 requires latent_or_audio.
durationFLOAT60.00–600Duration in seconds. Set to 0 for auto from latent_or_audio.
infer_methodCOMBOodeode = deterministic diffusion. sde = stochastic (remaps sampler).
guidance_modeCOMBOapgAPG = Adaptive Projected Guidance. ADG = Angle-based Dynamic Guidance. standard_cfg = normal CFG.
vaeoptVAEVAE for decoding latents to audio. Audio output requires this.
latent_or_audiooptAUDIO,LATENTBase input for refinement (img2img). Use denoise < 1.0.
batch_sizeoptINT11–16Number of audios to generate in parallel.
latent_shiftoptFLOAT0.00-0.2–0.2Additive shift on latents before VAE decode.
latent_rescaleoptFLOAT1.000.5–1.5Multiplicative scale on latents before VAE decode.
fade_in_durationoptFLOAT0.00–10
fade_out_durationoptFLOAT0.00–10
use_tiled_vaeoptBOOLEANtrueUse tiled VAE for long audio / low VRAM.
unload_models_after_generateoptBOOLEANfalseUnload models from memory after generation.
voice_boostoptFLOAT0.0-12–12Voice boost in dB.
apg_etaoptFLOAT0.00-10–10APG eta: parallel component retention.
apg_momentumoptFLOAT-0.75-1–1APG momentum buffer coefficient.
apg_norm_thresholdoptFLOAT2.50–15APG norm threshold for gradient clipping.
guidance_intervaloptFLOAT0.50-1–1Guidance interval width. -1 = use legacy cfg_interval_start/end.
guidance_interval_decayoptFLOAT0.000–1
min_guidance_scaleoptFLOAT3.00–30
guidance_scale_textoptFLOAT-1.0-1–30Split text guidance. Active when both text and lyric > 1.0.
guidance_scale_lyricoptFLOAT-1.0-1–30Split lyric guidance. Active when both text and lyric > 1.0.
omega_scaleoptFLOAT0.00-8–8
erg_scaleoptFLOAT0.00-0.9–2
cfg_interval_startoptFLOAT0.000–1
cfg_interval_endoptFLOAT1.000–1
shiftoptFLOAT3.00–5Timestep schedule shift. ACEStep15 default is 3.0.

Outputs (6)

NameTypeDescription
modelMODEL
vaeVAE
positiveCONDITIONING
negativeCONDITIONING
latentLATENT
audioAUDIO