ComfyUI Node
AudioSR
Upscale audio to 48kHz using Versatile Audio Super Resolution (AudioSR)
AudioSR
- audio
- audio
- spectrogram
◄ddim_steps50►
◄guidance_scale3.5►
◄seed0►
◄modelbasic (download required)►
◄chunk_size15.00►
◄overlap0.0►
◄unload_modelfalse►
◄show_spectrogramtrue►
◄attention_backendsdpa►
◄dtypefp32►
◄use_torch_compilefalse►
Categoryaudio
Inputs (12)
| Name | Type | Default | Description |
|---|---|---|---|
| audio | AUDIO | — | |
| ddim_steps | INT | 5010–500 | Number of denoising steps (higher = better quality, slower) |
| guidance_scale | FLOAT | 3.51–20 | Classifier-free guidance scale (higher = more faithful to input) |
| seed | INT | 00–4294967295 | Random seed (0 = random) |
| modelopt | COMBO | basic (download required) | Model checkpoint file (place in ComfyUI/models/AudioSR/) |
| chunk_sizeopt | FLOAT | 15.002.56–30 | Chunk duration in seconds for processing long audio (default: 15s from main repo) |
| overlapopt | FLOAT | 0.00–5 | Overlap duration in seconds between chunks. Helps smooth transitions between audio chunks. Higher values = smoother but slower processing. (0.0 = no overlap, 2.0-3.0 recommended for long audio) |
| unload_modelopt | BOOLEAN | false | Unload model from memory after generation (frees VRAM, but slower next run) |
| show_spectrogramopt | BOOLEAN | true | Generate before/after spectrogram comparison image |
| attention_backendopt | COMBO | sdpa | Attention backend: sdpa (PyTorch native), sageattn (fastest, requires fp16/bf16 dtype), eager (most compatible) |
| dtypeopt | COMBO | fp32 | Compute dtype: fp32 (default, most compatible), fp16 (faster, less VRAM), bf16 (best on RTX 30/40 series). SageAttention requires fp16/bf16. |
| use_torch_compileopt | BOOLEAN | false | Use torch.compile() to optimize model for faster inference (FP32 only - experimental) |
Outputs (2)
| Name | Type | Description |
|---|---|---|
| audio | AUDIO | — |
| spectrogram | IMAGE | — |