Голосовые сообщения в чате поддержки, записи звонков, планёрка на час, кружочек от клиента вместо заявки — всё это данные, которые никто не читает. Послушать запись быстрее нельзя: она играет ровно столько, сколько играет. Поэтому звонки слушают выборочно, а голосовые в поддержке накапливаются.
В Staqflow появился узел «Распознавание речи». На входе аудиофайл, на выходе текст — а дальше процесс делает с ним то же, что с любым другим текстом: ищет, классифицирует, отвечает, кладёт в CRM.
Распознавание речи в workflow — это шаг процесса, который превращает аудиозапись в текст: на вход приходит файл из чата, почты или хранилища, на выход — расшифровка, при необходимости с таймкодами и метками говорящих.
Что умеет узел «Распознавание речи»
- Берёт файл откуда угодно. Из бинарного поля элемента — вложение из почты, голосовое из Telegram, запись из хранилища — или по прямой ссылке.
- Отдаёт текст в нужном виде. Сплошной текст, фразы с таймкодами, субтитры SRT или VTT.
- Различает говорящих. Метки говорящих показывают, кто произнёс фразу, — это и есть расшифровка звонка, а не поток слов.
- Знает ваши слова. Термины, названия и фамилии можно подсказать заранее, чтобы они писались правильно.
- Работает на подключении соседних узлов. Тот же ключ, что у синтеза речи и языковой модели.
Девять провайдеров: две группы
Первая группа — те, у кого распознавание идёт вместе с языковой моделью: OpenAI, Groq, Google Gemini, Mistral и свой сервер на протоколе OpenAI. Отдельное подключение заводить не нужно, ключ уже есть.
Вторая группа — специальные речевые сервисы, у каждого своё подключение:
| Провайдер | Чем интересен |
|---|---|
| Deepgram | метки говорящих, длинные записи, быстро и недорого |
| ElevenLabs Scribe | метки говорящих и тайминги вплоть до отдельных слов |
| Yandex SpeechKit | российское облако; длинное аудио распознаётся заданием, а не ответом на запрос |
| SaluteSpeech (Сбер) | российское облако; модели под задачу — общая, колл-центр, медиа, IVR |
У облачных моделей первой группы есть ограничение на размер файла: у OpenAI и Groq — 25 МБ, у Gemini — 20. Для часовой планёрки это мало, и тут выручают речевые сервисы: у них длинная запись обрабатывается заданием.
Асинхронные провайдеры
Yandex SpeechKit и SaluteSpeech длинное аудио не распознают одним ответом: они принимают файл, ставят задание и отдают результат, когда закончат. Узел делает это сам — ставит задание, дожидается и возвращает текст, — но прогон будет идти дольше, и таймаут стоит закладывать с запасом.
Ещё одна честная деталь: проверка подключения есть не у всех речевых провайдеров. У части из них любой запрос к API — это уже распознавание, то есть работа и деньги, поэтому «проверить ключ» бесплатно там нельзя.
Как настроить
- Добавьте подключение к сервису в учётных данных пространства.
- Поставьте узел «Распознавание речи», выберите провайдера и модель.
- Укажите, откуда брать аудио: бинарное поле элемента или ссылка на файл.
- Задайте язык — или оставьте определение языка сервису, если записи разноязычные.
- Выберите формат ответа: текст, текст с таймкодами, SRT или VTT.
Параметры
- Термины и имена — список слов, которые надо писать правильно: названия продуктов, фамилии, аббревиатуры. Принимают Deepgram, SaluteSpeech и модели OpenAI; у ElevenLabs своего поля для этого нет.
- Метки говорящих — кто произнёс фразу. Есть у всех четырёх речевых сервисов.
- Перевести на английский — расшифровка сразу переводом.
- Температура — насколько вольно модель трактует неразборчивое. Для расшифровок её лучше держать низкой.
- Сырой ответ — весь ответ провайдера целиком, когда нужны детали, которых нет в обычных полях.
Форматы записи у каждого свои: Yandex принимает MP3, WAV и OGG, SaluteSpeech — их же плюс FLAC. Узел проверяет формат до отправки и говорит, какие годятся.
Какой провайдер выбрать
- Голосовые по десять секунд из бота — тот, чей ключ уже есть: OpenAI, Groq или Gemini. Заводить отдельное подключение ради коротких файлов незачем.
- Звонки и планёрки — Deepgram или ElevenLabs Scribe: метки говорящих, длинные записи, разумная цена за минуту.
- Когда данные должны остаться в России — Yandex SpeechKit или SaluteSpeech.
- Колл-центр — SaluteSpeech с моделью под колл-центр: она обучена на телефонном звуке, а он заметно хуже студийного.
- Когда нужны тайминги по словам — ElevenLabs Scribe: он размечает не фразы, а отдельные слова, и это удобно для субтитров.
Менять решение не дорого: провайдер и модель — это два поля в узле, а всё остальное в процессе остаётся как было.
Что делать с текстом дальше
Сама по себе расшифровка — это ещё не польза. Польза появляется, когда текст идёт следующим шагом:
Речь → языковая модель. Из расшифровки звонка модель достаёт суть: что просил клиент, о чём договорились, что пообещали. В CRM ложится краткое содержание, а не сорок минут текста.
Речь → поля. Голосовая заявка превращается в структуру: адрес, время, услуга. Дальше — карточка в CRM или строка в таблице.
Речь → эмбеддинги. Расшифровки складываются в векторную базу, и по разговорам за год можно искать по смыслу: «жалобы на доставку», «просили счёт на юрлицо».
Речь → субтитры. SRT или VTT сразу прикладываются к видео — своему или сгенерированному соседним узлом.
Сценарии автоматизации
Голосовые в поддержке
Клиент присылает голосовое в Telegram-бот → узел расшифровывает → языковая модель определяет тему и срочность → заявка создаётся в хелпдеске, а клиент получает ответ текстом.
Расшифровка звонков
Запись из телефонии попадает в хранилище → распознавание с метками говорящих → модель выделяет договорённости и следующий шаг → всё уходит в карточку сделки. Менеджеру не нужно писать отчёт по звонку.
Планёрки и интервью
Часовая запись уходит в асинхронный сервис → возвращается текст с таймкодами → модель делает конспект с решениями и ответственными → конспект летит в чат команды.
Контроль качества
Все звонки за день расшифровываются и проверяются по чек-листу: поздоровался, назвал условия, предложил следующий шаг. Выборка на ручное прослушивание сокращается до спорных случаев.
Субтитры к роликам
Видео из папки → дорожка распознаётся в SRT → файл субтитров ложится рядом с роликом и уходит на площадку.
Что мешает распознаванию
Качество расшифровки решает не столько модель, сколько запись. Что стоит помнить:
- Телефонный звук хуже студийного — у него узкая полоса частот, и универсальные модели на нём ошибаются чаще специальных.
- Двое говорят одновременно — метки говорящих в этом месте поплывут у любого сервиса.
- Фоновая музыка и шум цеха съедают окончания слов; если запись делаете вы, микрофон ближе ко рту стоит дешевле любой модели.
- Имена, названия и аббревиатуры без подсказки пишутся на слух — отсюда поле с терминами.
Поэтому для ответственных сценариев расшифровку стоит считать черновиком: решение принимает следующий шаг процесса, а спорное уходит человеку.
Сколько это стоит
Речевые сервисы считают по минутам записи, модели первой группы — по токенам. Разница чувствуется на длинных файлах: часовая планёрка через речевой сервис обычно дешевле, чем через универсальную модель, и не упирается в лимит размера.
В Staqflow оплачивается только работа процесса — токены за CPU-секунды. Ожидание ответа процессор почти не грузит, в том числе когда узел ждёт асинхронное задание. Тарифы — на странице цен.
Частые вопросы
Какие сервисы распознают речь в Staqflow?
Девять: OpenAI, Groq, Google Gemini, Mistral и свой сервер на протоколе OpenAI — на том же подключении, что языковая модель; плюс Deepgram, ElevenLabs Scribe, Yandex SpeechKit и SaluteSpeech со своими ключами.
Есть ли русское распознавание?
Да. Yandex SpeechKit и SaluteSpeech — российские облака, данные остаются в их контуре. У SaluteSpeech есть отдельные модели под колл-центр, медиа и IVR.
Как расшифровать часовую запись?
Берите речевой сервис: у моделей первой группы файл ограничен 20–25 МБ. Yandex и SaluteSpeech обрабатывают длинное аудио заданием, узел дожидается результата сам — увеличьте таймаут.
Можно ли понять, кто что сказал?
Да, включите метки говорящих. Их поддерживают все четыре речевых сервиса, и в расшифровке звонка будет видно реплики менеджера и клиента отдельно.
Модель путает названия и фамилии
Для этого есть поле с терминами и именами: перечислите слова, которые надо писать правильно. Deepgram, SaluteSpeech и модели OpenAI это принимают.
Данные уходят во внешний сервис?
Да, файл отправляется провайдеру — как при любом вызове чужого API. Если запись нельзя выпускать наружу, в своём контуре к узлу подключается локальная модель на протоколе OpenAI.
Попробуйте
- Создайте аккаунт — карта не нужна.
- Соберите процесс из трёх узлов: Telegram-бот, «Распознавание речи» и запись в таблицу.
- Или опишите задачу ИИ-клиенту через MCP: «Расшифровывай голосовые из бота и складывай текст в заявки».
Куда отправить расшифровку — смотрите в каталоге интеграций.
