Nodes/MisoTTS-ComfyUI/Miso TTS - Generate
ComfyUI Node

Miso TTS - Generate

Generate ComfyUI AUDIO from text, with optional prompt audio/reference context.

By Saganaki22·Created 3 months ago·Updated 3 months ago· 7
Miso TTS - Generate
  • miso_model
  • reference_audio
  • audio
textHello! This is Miso TTS running inside ComfyUI.
reference_text
speaker0
max_audio_length_seconds10.0
longform_chunkingfalse
words_per_chunk80
temperature0.90
top_k50
seed0
CategoryMiso TTS

Inputs (11)

NameTypeDefaultDescription
miso_modelMISO_MODELOutput from Miso TTS - Load Model.
textSTRINGHello! This is Miso TTS running inside ComfyUI.Text to synthesize.
reference_textSTRINGTranscript for reference_audio. Connect Miso TTS - Whisper Transcribe here.
speakerINT00–99Speaker tag used in the prompt, e.g. [0]. Leave 0 for normal single-speaker use; change only for multi-speaker context.
max_audio_length_secondsFLOAT10.00.08–120Maximum generated audio per chunk in seconds.
longform_chunkingBOOLEANfalseSplit long text at sentence boundaries. Each chunk reuses the original reference audio if connected.
words_per_chunkINT800–500Target words per longform chunk. Longform may lower this to fit max_audio_length_seconds. 0 disables text splitting.
temperatureFLOAT0.900–2Sampling temperature. 0 is greedy.
top_kINT501–2051Top-k sampling over the 2051 audio vocabulary.
seedINT00–2147483647Random seed. 0 picks a random seed.
reference_audiooptAUDIOOptional prompt audio for voice/reference context. This is not guaranteed speaker matching.

Outputs (1)

NameTypeDescription
audioAUDIO