§ БЛОГ

Распознавание речи в workflow: новая нода Staqflow — голосовые, звонки и планёрки текстом

В Staqflow появился узел «Распознавание речи»: аудио на входе, текст на выходе. Девять сервисов — от OpenAI, Groq и Gemini до Deepgram, ElevenLabs Scribe, Yandex SpeechKit и SaluteSpeech, — метки говорящих, таймкоды, субтитры SRT и VTT. Голосовые из бота, записи звонков и часовые планёрки превращаются в текст, с которым процесс уже умеет работать.

Распознавание речи в workflow: новая нода Staqflow — голосовые, звонки и планёрки текстом

Голосовые сообщения в чате поддержки, записи звонков, планёрка на час, кружочек от клиента вместо заявки — всё это данные, которые никто не читает. Послушать запись быстрее нельзя: она играет ровно столько, сколько играет. Поэтому звонки слушают выборочно, а голосовые в поддержке накапливаются.

В Staqflow появился узел «Распознавание речи». На входе аудиофайл, на выходе текст — а дальше процесс делает с ним то же, что с любым другим текстом: ищет, классифицирует, отвечает, кладёт в CRM.

Распознавание речи в workflow — это шаг процесса, который превращает аудиозапись в текст: на вход приходит файл из чата, почты или хранилища, на выход — расшифровка, при необходимости с таймкодами и метками говорящих.

Что умеет узел «Распознавание речи»

  • Берёт файл откуда угодно. Из бинарного поля элемента — вложение из почты, голосовое из Telegram, запись из хранилища — или по прямой ссылке.
  • Отдаёт текст в нужном виде. Сплошной текст, фразы с таймкодами, субтитры SRT или VTT.
  • Различает говорящих. Метки говорящих показывают, кто произнёс фразу, — это и есть расшифровка звонка, а не поток слов.
  • Знает ваши слова. Термины, названия и фамилии можно подсказать заранее, чтобы они писались правильно.
  • Работает на подключении соседних узлов. Тот же ключ, что у синтеза речи и языковой модели.

Девять провайдеров: две группы

Первая группа — те, у кого распознавание идёт вместе с языковой моделью: OpenAI, Groq, Google Gemini, Mistral и свой сервер на протоколе OpenAI. Отдельное подключение заводить не нужно, ключ уже есть.

Вторая группа — специальные речевые сервисы, у каждого своё подключение:

ПровайдерЧем интересен
Deepgramметки говорящих, длинные записи, быстро и недорого
ElevenLabs Scribeметки говорящих и тайминги вплоть до отдельных слов
Yandex SpeechKitроссийское облако; длинное аудио распознаётся заданием, а не ответом на запрос
SaluteSpeech (Сбер)российское облако; модели под задачу — общая, колл-центр, медиа, IVR

У облачных моделей первой группы есть ограничение на размер файла: у OpenAI и Groq — 25 МБ, у Gemini — 20. Для часовой планёрки это мало, и тут выручают речевые сервисы: у них длинная запись обрабатывается заданием.

Асинхронные провайдеры

Yandex SpeechKit и SaluteSpeech длинное аудио не распознают одним ответом: они принимают файл, ставят задание и отдают результат, когда закончат. Узел делает это сам — ставит задание, дожидается и возвращает текст, — но прогон будет идти дольше, и таймаут стоит закладывать с запасом.

Ещё одна честная деталь: проверка подключения есть не у всех речевых провайдеров. У части из них любой запрос к API — это уже распознавание, то есть работа и деньги, поэтому «проверить ключ» бесплатно там нельзя.

Как настроить

  1. Добавьте подключение к сервису в учётных данных пространства.
  2. Поставьте узел «Распознавание речи», выберите провайдера и модель.
  3. Укажите, откуда брать аудио: бинарное поле элемента или ссылка на файл.
  4. Задайте язык — или оставьте определение языка сервису, если записи разноязычные.
  5. Выберите формат ответа: текст, текст с таймкодами, SRT или VTT.

Параметры

  • Термины и имена — список слов, которые надо писать правильно: названия продуктов, фамилии, аббревиатуры. Принимают Deepgram, SaluteSpeech и модели OpenAI; у ElevenLabs своего поля для этого нет.
  • Метки говорящих — кто произнёс фразу. Есть у всех четырёх речевых сервисов.
  • Перевести на английский — расшифровка сразу переводом.
  • Температура — насколько вольно модель трактует неразборчивое. Для расшифровок её лучше держать низкой.
  • Сырой ответ — весь ответ провайдера целиком, когда нужны детали, которых нет в обычных полях.

Форматы записи у каждого свои: Yandex принимает MP3, WAV и OGG, SaluteSpeech — их же плюс FLAC. Узел проверяет формат до отправки и говорит, какие годятся.

Какой провайдер выбрать

  • Голосовые по десять секунд из бота — тот, чей ключ уже есть: OpenAI, Groq или Gemini. Заводить отдельное подключение ради коротких файлов незачем.
  • Звонки и планёрки — Deepgram или ElevenLabs Scribe: метки говорящих, длинные записи, разумная цена за минуту.
  • Когда данные должны остаться в России — Yandex SpeechKit или SaluteSpeech.
  • Колл-центр — SaluteSpeech с моделью под колл-центр: она обучена на телефонном звуке, а он заметно хуже студийного.
  • Когда нужны тайминги по словам — ElevenLabs Scribe: он размечает не фразы, а отдельные слова, и это удобно для субтитров.

Менять решение не дорого: провайдер и модель — это два поля в узле, а всё остальное в процессе остаётся как было.

Что делать с текстом дальше

Сама по себе расшифровка — это ещё не польза. Польза появляется, когда текст идёт следующим шагом:

Речь → языковая модель. Из расшифровки звонка модель достаёт суть: что просил клиент, о чём договорились, что пообещали. В CRM ложится краткое содержание, а не сорок минут текста.

Речь → поля. Голосовая заявка превращается в структуру: адрес, время, услуга. Дальше — карточка в CRM или строка в таблице.

Речь → эмбеддинги. Расшифровки складываются в векторную базу, и по разговорам за год можно искать по смыслу: «жалобы на доставку», «просили счёт на юрлицо».

Речь → субтитры. SRT или VTT сразу прикладываются к видео — своему или сгенерированному соседним узлом.

Сценарии автоматизации

Голосовые в поддержке

Клиент присылает голосовое в Telegram-бот → узел расшифровывает → языковая модель определяет тему и срочность → заявка создаётся в хелпдеске, а клиент получает ответ текстом.

Расшифровка звонков

Запись из телефонии попадает в хранилище → распознавание с метками говорящих → модель выделяет договорённости и следующий шаг → всё уходит в карточку сделки. Менеджеру не нужно писать отчёт по звонку.

Планёрки и интервью

Часовая запись уходит в асинхронный сервис → возвращается текст с таймкодами → модель делает конспект с решениями и ответственными → конспект летит в чат команды.

Контроль качества

Все звонки за день расшифровываются и проверяются по чек-листу: поздоровался, назвал условия, предложил следующий шаг. Выборка на ручное прослушивание сокращается до спорных случаев.

Субтитры к роликам

Видео из папки → дорожка распознаётся в SRT → файл субтитров ложится рядом с роликом и уходит на площадку.

Что мешает распознаванию

Качество расшифровки решает не столько модель, сколько запись. Что стоит помнить:

  • Телефонный звук хуже студийного — у него узкая полоса частот, и универсальные модели на нём ошибаются чаще специальных.
  • Двое говорят одновременно — метки говорящих в этом месте поплывут у любого сервиса.
  • Фоновая музыка и шум цеха съедают окончания слов; если запись делаете вы, микрофон ближе ко рту стоит дешевле любой модели.
  • Имена, названия и аббревиатуры без подсказки пишутся на слух — отсюда поле с терминами.

Поэтому для ответственных сценариев расшифровку стоит считать черновиком: решение принимает следующий шаг процесса, а спорное уходит человеку.

Сколько это стоит

Речевые сервисы считают по минутам записи, модели первой группы — по токенам. Разница чувствуется на длинных файлах: часовая планёрка через речевой сервис обычно дешевле, чем через универсальную модель, и не упирается в лимит размера.

В Staqflow оплачивается только работа процесса — токены за CPU-секунды. Ожидание ответа процессор почти не грузит, в том числе когда узел ждёт асинхронное задание. Тарифы — на странице цен.

Частые вопросы

Какие сервисы распознают речь в Staqflow?

Девять: OpenAI, Groq, Google Gemini, Mistral и свой сервер на протоколе OpenAI — на том же подключении, что языковая модель; плюс Deepgram, ElevenLabs Scribe, Yandex SpeechKit и SaluteSpeech со своими ключами.

Есть ли русское распознавание?

Да. Yandex SpeechKit и SaluteSpeech — российские облака, данные остаются в их контуре. У SaluteSpeech есть отдельные модели под колл-центр, медиа и IVR.

Как расшифровать часовую запись?

Берите речевой сервис: у моделей первой группы файл ограничен 20–25 МБ. Yandex и SaluteSpeech обрабатывают длинное аудио заданием, узел дожидается результата сам — увеличьте таймаут.

Можно ли понять, кто что сказал?

Да, включите метки говорящих. Их поддерживают все четыре речевых сервиса, и в расшифровке звонка будет видно реплики менеджера и клиента отдельно.

Модель путает названия и фамилии

Для этого есть поле с терминами и именами: перечислите слова, которые надо писать правильно. Deepgram, SaluteSpeech и модели OpenAI это принимают.

Данные уходят во внешний сервис?

Да, файл отправляется провайдеру — как при любом вызове чужого API. Если запись нельзя выпускать наружу, в своём контуре к узлу подключается локальная модель на протоколе OpenAI.

Попробуйте

  1. Создайте аккаунт — карта не нужна.
  2. Соберите процесс из трёх узлов: Telegram-бот, «Распознавание речи» и запись в таблицу.
  3. Или опишите задачу ИИ-клиенту через MCP: «Расшифровывай голосовые из бота и складывай текст в заявки».

Куда отправить расшифровку — смотрите в каталоге интеграций.