GigaAM Speech to Text
Узел для транскрипции аудио с использованием моделей GigaAM и диаризации Pyannote. Настройки: - для скачивания моделей зарегистрируйтесь на huggingface и создайте hf token для чтения. - model_name: Выбор модели GigaAM. Рекомендуется v3_e2e_rnnt. - longform: Включите для аудио более 20 сек или всегда держите включенным. - hf_token: Токен Hugging Face (нужен только при скачивании модели). - word_timestamps: Вывод временных меток. - sentences_per_interval: Вывод по N предложений в строку. Приоритетнее чем words_per_interval. - words_per_interval: Вывод по N слов в строку. Если sentences_per_interval=0 и words_per_interval=0 то разбивается по предложениям (по умолчанию). - chunk_tokens: Разбить весь итоговый текст на блоки по количеству токенов (полезно для LLM). Разбиение происходит только в конце предложений. Результат выводится в text_batch. - highlight_words: Вывод субтитров в формате SRT с подсветкой текущего слова <u> (караоке). - speaker_diarization: Включает определение спикеров. - min_speakers / max_speakers: лимиты спикеров. - speaker_format: формат обозначения спикеров.
- audio
- text
- text_batch
Inputs (13)
| Name | Type | Default | Description |
|---|---|---|---|
| audio | AUDIO | — | |
| model_name | COMBO | v3_e2e_rnnt | 8 options: v3_e2e_rnnt, v3_e2e_ctc, v3_rnnt, v3_ctc, v2_rnnt, v2_ctc, +2 |
| longform | BOOLEAN | true | — |
| hf_token | STRING | — | |
| word_timestamps | BOOLEAN | false | — |
| sentences_per_interval | INT | 00–100 | — |
| words_per_interval | INT | 00–1000 | — |
| chunk_tokens | INT | 30720–100000 | — |
| highlight_words | BOOLEAN | false | — |
| speaker_diarization | BOOLEAN | false | — |
| min_speakers | INT | 11–20 | — |
| max_speakers | INT | 21–20 | — |
| speaker_format | COMBO | 2 options: SPEAKER A: SPEAKER B: SPEAKER C:, [Speaker_1]: [Speaker_2]: [Speaker_3]: |
Outputs (2)
| Name | Type | Description |
|---|---|---|
| text | STRING | — |
| text_batch | STRING | — |