Nodes/LongCat AudioDiT TTS/LongCat AudioDiT Multi-Speaker TTS
ComfyUI Node

LongCat AudioDiT Multi-Speaker TTS

LongCat-AudioDiT Multi-Speaker TTS. Synthesizes a conversation between multiple cloned voices. Connect reference audio clips and use [speaker_N]: tags in text.

By Saganaki22·Created 4 months ago·Updated 4 months ago· 131
LongCat AudioDiT Multi-Speaker TTS
    • audio
    model_path
    text[speaker_1]: Hello, I'm speaker one. [speaker_2]: And I'm speaker two!
    steps16
    guidance_strength4.0
    guidance_methodapg
    deviceauto
    dtypeauto
    attentionauto
    seed0
    keep_model_loadedtrue
    pause_after_speaker0.4
    num_speakers
    CategoryLongCat-AudioDiT

    Inputs (12)

    NameTypeDefaultDescription
    model_pathCOMBOLongCat-AudioDiT model. Models are stored in ComfyUI/models/audiodit/
    textSTRING[speaker_1]: Hello, I'm speaker one. [speaker_2]: And I'm speaker two!Multi-speaker text. Use [speaker_1]:, [speaker_2]:, ... to assign lines to each speaker.
    stepsINT164–64Number of ODE Euler steps. More = better quality but slower.
    guidance_strengthFLOAT4.00–10CFG/APG guidance strength.
    guidance_methodCOMBOapgGuidance method. 'apg' recommended for voice cloning.
    deviceCOMBOautoCompute device. 'auto' picks CUDA > MPS > CPU.
    dtypeCOMBOautoModel dtype. 'auto' picks bf16 for CUDA.
    attentionCOMBOautoAttention implementation.
    seedINT00–2147483647Random seed. 0 = random.
    keep_model_loadedBOOLEANtrueKeep model loaded between runs. Model is automatically offloaded to CPU after generation.
    pause_after_speakerFLOAT0.40–2Seconds of silence to add after each speaker turn.
    num_speakersCOMBOHow many speakers (2-10). Changing this shows/hides speaker audio inputs.

    Outputs (1)

    NameTypeDescription
    audioAUDIO