ComfyUI Node
TS CosyVoice Voice To Voice
Convert source audio to sound like the target voice (voice-to-voice).
TS CosyVoice Voice To Voice
- model
- source_audio
- target_audio
- audio
◄speed1.00►
◄pitch_shift_semitones0►
◄seed42►
◄diffusion_steps10►
◄guidance_strength0.70►
◄normalize_outputfalse►
◄target_rms_dbfs-20.0►
CategoryTS CosyVoice3/Synthesis
Inputs (10)
| Name | Type | Default | Description |
|---|---|---|---|
| model | COSYVOICE_MODEL | Загруженная модель CosyVoice из ноды загрузчика. | |
| source_audio | AUDIO | Исходное аудио, которое нужно преобразовать в другой тембр. | |
| target_audio | AUDIO | Референс целевого голоса; будет обрезан до 30 секунд и приведен к оптимальному формату. | |
| speed | FLOAT | 1.000.5–2 | Множитель скорости итоговой речи. |
| pitch_shift_semitones | INT | 0-12–12 | Сдвиг высоты тона исходного аудио в полутонах перед voice conversion. |
| seedopt | INT | 42-1–2147483647 | Зерно случайности; значение -1 использует случайный seed. |
| diffusion_stepsopt | INT | 104–60 | Число шагов флоу-декодера. 10 — значение модели по умолчанию (быстро); 25–40 даёт больше деталей и пропорционально дольше считает. |
| guidance_strengthopt | FLOAT | 0.700–1.5 | Сила classifier-free guidance. 0.7 — значение из конфигурации модели; выше — ближе к референсу, но растёт риск артефактов. |
| normalize_outputopt | BOOLEAN | false | Приводит громкость результата к целевому уровню RMS, чтобы разные референсы давали сопоставимую громкость. |
| target_rms_dbfsopt | FLOAT | -20.0-40–-6 | Целевой уровень RMS в dBFS при включённой нормализации. Это RMS, а не LUFS: пики ограничиваются -1 dBFS. |
Outputs (1)
| Name | Type | Description |
|---|---|---|
| audio | AUDIO | — |