ComfyUI Node
Audio SRT Aligner (文稿校对字幕)
Align reference text to audio and generate SRT subtitles
Audio SRT Aligner (文稿校对字幕)
- audio
- srt_string
- detected_language
- srt_entries
- coverage
- audio_out
◄reference_text►
◄model_sizesmall►
◄languagezh►
◄engine_modestable-ts►
◄beam_size5►
◄max_chars12►
◄compute_typefloat16►
◄uvr5_moderoformer►
Categoryaudio/srt
Inputs (9)
| Name | Type | Default | Description |
|---|---|---|---|
| audio | AUDIO | — | |
| reference_text | STRING | — | |
| model_size | COMBO | small | 5 options: tiny, base, small, medium, large-v3 |
| language | STRING | zh | — |
| engine_mode | COMBO | stable-ts | 4 options: Whisper+LIS, stable-ts, Qwen3 ASR+ForcedAligner, Qwen3 ASR+LIS |
| beam_sizeopt | INT | 51–10 | — |
| max_charsopt | INT | 121–100 | — |
| compute_typeopt | COMBO | float16 | 4 options: int8, int8_float16, float16, float32 |
| uvr5_modeopt | COMBO | roformer | 3 options: roformer, mdxnet, none |
Outputs (5)
| Name | Type | Description |
|---|---|---|
| srt_string | STRING | — |
| detected_language | STRING | — |
| srt_entries | INT | — |
| coverage | FLOAT | — |
| audio_out | AUDIO | — |