ComfyUI Node
DIGIT ElevenLabs Speech to Text
A ComfyUI node in DIGIT/ElevenLabs with 11 inputs and 3 outputs.
DIGIT ElevenLabs Speech to Text
- audio
- text
- language_code
- words_json
◄modelscribe_v2►
◄seed1►
◄api_key►
◄language_code►
◄tag_audio_eventsfalse►
◄diarizefalse►
◄diarization_threshold0.22►
◄temperature0.00►
◄timestamps_granularityword►
◄num_speakers0►
CategoryDIGIT/ElevenLabs
Inputs (11)
| Name | Type | Default | Description |
|---|---|---|---|
| audio | AUDIO | — | |
| model | COMBO | scribe_v2 | 1 options: scribe_v2 |
| seed | INT | 10–2147483647 | — |
| api_keyopt | STRING | ElevenLabs API key. Auto-detected from ELEVENLABS_API_KEY env var. | |
| language_codeopt | STRING | ISO-639-1/3 language code. Leave empty for auto-detect. | |
| tag_audio_eventsopt | BOOLEAN | false | Annotate sounds like (laughter) in transcript. |
| diarizeopt | BOOLEAN | false | Annotate which speaker is talking. |
| diarization_thresholdopt | FLOAT | 0.220.1–0.4 | — |
| temperatureopt | FLOAT | 0.000–2 | — |
| timestamps_granularityopt | COMBO | word | 3 options: word, character, none |
| num_speakersopt | INT | 00–32 | — |
Outputs (3)
| Name | Type | Description |
|---|---|---|
| text | STRING | — |
| language_code | STRING | — |
| words_json | STRING | — |