Nodes/ComfyUI-VisionPromptAssistant/Local Whisper Transcribe
ComfyUI Node

Local Whisper Transcribe

Transcribes ComfyUI AUDIO locally with faster-whisper and releases the model before MiniMax H3 loads.

By elgalardi·Created 21 days ago·Updated a day ago· 1
Local Whisper Transcribe
  • audio
  • transcript
  • segments_json
  • detected_language
  • status
modellarge-v3
languageauto
deviceauto
compute_typeauto
beam_size5
vad_filtertrue
initial_prompt
CategoryVision Prompt Assistant/Audio

Inputs (8)

NameTypeDefaultDescription
audioAUDIO
modelCOMBOlarge-v32 options: large-v3, large-v3-turbo
languageCOMBOauto15 options: auto, en, es, ja, zh, hi, +9
deviceCOMBOauto3 options: auto, cuda, cpu
compute_typeCOMBOautoauto uses float16 on CUDA and int8 on CPU. int8_float16 uses less VRAM with a small possible accuracy tradeoff.
beam_sizeINT51–10
vad_filterBOOLEANtrue
initial_promptoptSTRINGOptional vocabulary or context hint; it is not added to the result.

Outputs (4)

NameTypeDescription
transcriptSTRING
segments_jsonSTRING
detected_languageSTRING
statusSTRING