Nodes/ComfyUI Kaola MOSS-TTS/Run MOSS-TTSD Generation
ComfyUI Node

Run MOSS-TTSD Generation

Generates speech using MOSS-TTSD. Modes: - 'generation': Text-to-speech without reference (uses internal voice). - 'voice_clone': Clones voice from reference audio. - 'continuation': Continues speech from reference audio (good for emotion). - 'voice_clone_and_continuation': Combines cloning and continuation (best for mimicking). Parameters: - [S1]-[S5]: Speaker tags for multi-speaker generation. - audio_temperature: Higher = more dynamic/emotional, Lower = more stable. - audio_top_p/top_k: Controls decoding randomness. - text_normalize: Cleans text (removes special chars, merges tags). - sample_rate_normalize: Resamples all inputs to match.

By kana112233·Created 6 months ago·Updated 6 months ago· 3
Run MOSS-TTSD Generation
  • moss_model
  • moss_codec
  • reference_audio_s1
  • reference_audio_s2
  • reference_audio_s3
  • reference_audio_s4
  • reference_audio_s5
  • audio
text[S1] Hello world.
modevoice_clone
audio_temperature1.1
audio_top_p0.90
audio_top_k50
audio_repetition_penalty1.1
text_temperature1.1
max_new_tokens2000
text_normalizetrue
sample_rate_normalizetrue
reference_text_s1
reference_text_s2
reference_text_s3
reference_text_s4
reference_text_s5
CategoryKaola/MOSS-TTSD

Inputs (22)

NameTypeDefaultDescription
moss_modelMOSS_TTSD_MODELLoaded MOSS-TTSD model.
moss_codecMOSS_AUDIO_CODECLoaded MOSS Audio Tokenizer/Codec.
textSTRING[S1] Hello world.Text to generate speech from. Use [S1]-[S5] tags for specific speakers.
modeCOMBOvoice_cloneGeneration mode. 'voice_clone' is recommended for reference audio.
audio_temperatureFLOAT1.10.1–2Audio sampling temperature. Higher = more random/emotional.
audio_top_pFLOAT0.900.1–1Nucleus sampling probability for audio.
audio_top_kINT501–200Top-K sampling for audio.
audio_repetition_penaltyFLOAT1.11–2Penalty for repeating audio tokens.
text_temperatureFLOAT1.10.1–2Temperature for text generation (if applicable).
max_new_tokensINT2000100–10000Maximum number of tokens to generate.
text_normalizeBOOLEANtrueNormalize text (clean punctuation, merge tags) before generation.
sample_rate_normalizeBOOLEANtrueResample all reference audios to the same sample rate.
reference_audio_s1optAUDIO
reference_text_s1optSTRING
reference_audio_s2optAUDIO
reference_text_s2optSTRING
reference_audio_s3optAUDIO
reference_text_s3optSTRING
reference_audio_s4optAUDIO
reference_text_s4optSTRING
reference_audio_s5optAUDIO
reference_text_s5optSTRING

Outputs (1)

NameTypeDescription
audioAUDIO