Nodes/ComfyUI-Stream-Pack/Audio Transcription (Real-time)
ComfyUI Node

Audio Transcription (Real-time)

A ComfyUI node in audio_utils with 7 inputs and 1 output.

By livepeer·Created about a year ago·Updated 11 months ago· 21
Audio Transcription (Real-time)
  • audio
  • STRING
transcription_interval2.0
accumulation_duration3.0
whisper_modelbase
languageauto
enable_vadtrue
output_formatjson_segments
Categoryaudio_utils

Inputs (7)

NameTypeDefaultDescription
audioAUDIO
transcription_intervalFLOAT2.01–10Minimum seconds between transcription outputs (optimized for real-time)
accumulation_durationFLOAT3.02–10Audio accumulation duration for optimal Whisper transcription (reduced for real-time: shorter = faster output, longer = better quality)
whisper_modelCOMBObaseWhisper model size (larger = more accurate but slower)
languageCOMBOautoLanguage for transcription (auto = auto-detect)
enable_vadBOOLEANtrueEnable Voice Activity Detection to filter silence
output_formatoptCOMBOjson_segmentsOutput format: text (simple), json_segments (with timing), json_words (word-level timing)

Outputs (1)

NameTypeDescription
STRINGSTRING