Nodes/AudioSR/AudioSR
ComfyUI Node

AudioSR

Upscale audio to 48kHz using Versatile Audio Super Resolution (AudioSR)

By Saganaki22·Created 7 months ago·Updated 6 months ago· 93
AudioSR
  • audio
  • audio
  • spectrogram
ddim_steps50
guidance_scale3.5
seed0
modelbasic (download required)
chunk_size15.00
overlap0.0
unload_modelfalse
show_spectrogramtrue
attention_backendsdpa
dtypefp32
use_torch_compilefalse
Categoryaudio

Inputs (12)

NameTypeDefaultDescription
audioAUDIO
ddim_stepsINT5010–500Number of denoising steps (higher = better quality, slower)
guidance_scaleFLOAT3.51–20Classifier-free guidance scale (higher = more faithful to input)
seedINT00–4294967295Random seed (0 = random)
modeloptCOMBObasic (download required)Model checkpoint file (place in ComfyUI/models/AudioSR/)
chunk_sizeoptFLOAT15.002.56–30Chunk duration in seconds for processing long audio (default: 15s from main repo)
overlapoptFLOAT0.00–5Overlap duration in seconds between chunks. Helps smooth transitions between audio chunks. Higher values = smoother but slower processing. (0.0 = no overlap, 2.0-3.0 recommended for long audio)
unload_modeloptBOOLEANfalseUnload model from memory after generation (frees VRAM, but slower next run)
show_spectrogramoptBOOLEANtrueGenerate before/after spectrogram comparison image
attention_backendoptCOMBOsdpaAttention backend: sdpa (PyTorch native), sageattn (fastest, requires fp16/bf16 dtype), eager (most compatible)
dtypeoptCOMBOfp32Compute dtype: fp32 (default, most compatible), fp16 (faster, less VRAM), bf16 (best on RTX 30/40 series). SageAttention requires fp16/bf16.
use_torch_compileoptBOOLEANfalseUse torch.compile() to optimize model for faster inference (FP32 only - experimental)

Outputs (2)

NameTypeDescription
audioAUDIO
spectrogramIMAGE