ComfyUI Node
Audio Transcription (Real-time)
A ComfyUI node in audio_utils with 7 inputs and 1 output.
Audio Transcription (Real-time)
- audio
- STRING
◄transcription_interval2.0►
◄accumulation_duration3.0►
◄whisper_modelbase►
◄languageauto►
◄enable_vadtrue►
◄output_formatjson_segments►
Categoryaudio_utils
Inputs (7)
| Name | Type | Default | Description |
|---|---|---|---|
| audio | AUDIO | — | |
| transcription_interval | FLOAT | 2.01–10 | Minimum seconds between transcription outputs (optimized for real-time) |
| accumulation_duration | FLOAT | 3.02–10 | Audio accumulation duration for optimal Whisper transcription (reduced for real-time: shorter = faster output, longer = better quality) |
| whisper_model | COMBO | base | Whisper model size (larger = more accurate but slower) |
| language | COMBO | auto | Language for transcription (auto = auto-detect) |
| enable_vad | BOOLEAN | true | Enable Voice Activity Detection to filter silence |
| output_formatopt | COMBO | json_segments | Output format: text (simple), json_segments (with timing), json_words (word-level timing) |
Outputs (1)
| Name | Type | Description |
|---|---|---|
| STRING | STRING | — |