Yandex SpeechKit — сервис Яндекса для распознавания и синтеза речи: расшифровка звонков и встреч, голосовой бот в телефонии, озвучка текста, субтитры к видео. На практике важнее другое — как связать речь с языковой моделью и что проверить перед тем, как выпускать голосового помощника на реальных клиентов.

Распознавание и синтез

TL;DR

Yandex SpeechKit решает две противоположные задачи одного сервиса — превращает голос в текст и текст обратно в голос, с единым api и оплатой по объёму обработанной речи; точные тарифы — на странице сервиса.

Распознавание речи переводит запись звонка, встречи или голосового сообщения в текстовую расшифровку, которую получится искать, сохранять в CRM или передавать дальше на обработку языковой моделью. Синтез речи — обратный процесс: текст, который написала модель или сотрудник, превращается в голосовое сообщение, ответ бота по телефону или озвучку видео.

  • ASR, распознавание речи — голос становится текстом для поиска, анализа и хранения
  • TTS, синтез речи — текст становится голосом для звонка, ролика или подсказки в приложении
  • Оба процесса подключаются через единый api сервиса, без отдельного контракта на каждую функцию

Два процесса используют разные модели внутри одного сервиса — распознавание обучено на звуковых дорожках, синтез обучен на текстах с разметкой произношения. Для бизнеса это значит одно — включать функции можно по отдельности: только расшифровку звонков или только озвучку ответов, без обязательной покупки обеих сразу. Функции тарифицируются раздельно, поэтому включать лучше только то, что реально нужно процессу.

Где применяют

Пять сценариев встречаются в проектах внедрения чаще остальных.

  • Расшифровка звонков и встреч — запись переговорщика или продавца превращается в текст для контроля качества и обучения новых сотрудников
  • Голосовой бот в телефонии — клиент говорит, SpeechKit переводит фразу в текст, языковая модель формирует ответ, синтез озвучивает его обратно
  • Озвучка ответов и уведомлений — синтезированный голос читает статус заказа, напоминание или короткую инструкцию без записи диктора
  • Субтитры к обучающим видео — расшифровка ложится в основу субтитров и конспекта курса для сотрудников
  • Голосовой ввод для полевых сотрудников — отчёт или заявка надиктовывается голосом там, где печатать на телефоне неудобно

Общий принцип один — голос переводится в текст там, где дальше с ним работает человек или языковая модель, а текст переводится обратно в голос там, где удобнее слушать, чем читать.

Комбинация сценариев усиливает эффект: расшифровка звонков параллельно кормит базу знаний компании, а синтез озвучивает выжимку для руководителя, которому удобнее слушать сводку по дороге, чем читать текст с телефона.

Связка с моделью

ШагЧто происходитИнструмент
1. ЗаписьГолос клиента или сотрудника попадает в системуТелефония, диктофон, видеозвонок
2. РаспознаваниеГолос превращается в текстYandex SpeechKit, ASR
3. ОтветЯзыковая модель формирует ответ или сводку по текстуYandexGPT или GigaChat
4. СинтезОтвет превращается обратно в голосYandex SpeechKit, TTS

Связка речь-текст-модель-речь собирается вокруг одного api-ключа Yandex Cloud — регистрация проекта, включение сервиса SpeechKit, получение ключа для распознавания и отдельного для синтеза. Дальше выбор языковой модели зависит от задачи: подробный разбор возможностей и сценариев — в статье YandexGPT для бизнеса.

GigaChat в этой связке заменяет YandexGPT на шаге ответа без переделки остальной цепочки — распознавание и синтез речи остаются теми же, меняется только модель, которая формирует текст ответа.

Задержка в связке имеет значение для голосового бота — от момента, когда клиент замолчал, до начала ответа синтеза проходит распознавание речи, работа языковой модели и генерация голоса. Три шага подряд ощущаются собеседником как одна пауза, и тестировать связку лучше на реальном диалоге целиком, вместо проверки каждого шага по отдельности.

Ключ для распознавания и ключ для синтеза лучше хранить раздельно в секретах проекта — ротация одного ключа спокойно проходит без остановки второго сервиса.

Качество и проверка

Качество распознавания зависит от записи — фоновый шум, акцент, быстрая речь или профессиональный жаргон снижают точность расшифровки. Отраслевые термины — названия препаратов, юридические формулировки, модели оборудования — распознаются увереннее, если заранее добавить словарь терминов в настройки сервиса.

  • Расшифровка реального звонка компании вместо демо-записи из документации сервиса
  • Голос синтеза на слух — интонация и скорость подходят под задачу: уведомление, продажа, служба поддержки
  • Обработка перебивания и пауз в разговоре, если сценарий подразумевает живой диалог вместо заранее заданного сценария бота
  • Работа с несколькими языками или смешанной речью в одной записи — отдельный тест, если у компании международные звонки или сотрудники говорят на разных языках попеременно

Результат проверки стоит фиксировать письменно — какие фразы сервис распознаёт неверно, какой словарь терминов добавили и как часто голос синтеза перепутывают с записью живого человека: это упрощает разговор с вендором при обновлении сервиса.

Дальше решение зависит от того, где цена ошибки выше — в коротком уведомлении клиенту или в расшифровке встречи для протокола, и как встроить проверку в процесс.

● Discovery · 1 час · бесплатно

Хотите протестировать SpeechKit на своих звонках?

Прийти на Discovery →

Подключение и альтернативы

Подключение в общем виде — проект в Yandex Cloud, включённый сервис SpeechKit, api-ключ для распознавания и синтеза, вызов из своего кода или готового сценария в n8n. Данные обрабатываются в облаке Яндекса — для компаний, которым важно держать голос и текст в российском контуре, это отдельный аргумент в пользу сервиса.

Альтернатив у SpeechKit несколько. SaluteSpeech Сбера — сопоставимый сервис распознавания и синтеза речи в облаке, с собственными тарифами и условиями подключения. Открытый Whisper — модель распознавания речи, которую получится запустить на своём сервере без передачи записей во внешнее облако; про этот вариант — в статье бот для расшифровки голосовых сообщений.

Плюс к выбору вендора — совместимость с телефонией компании: часть провайдеров связи предлагает готовую интеграцию с облачными сервисами распознавания речи, и это лучше проверить до подписания договора с оператором.

Расшифровка звонков и голосовой бот редко запускаются одновременно с первого дня — разумный порядок обычно такой: сначала расшифровка для контроля качества и накопления данных, затем голосовой бот поверх уже проверенной связки речь-модель-речь.

Собрать связку речь-текст-модель-речь под конкретный процесс — приём звонков, отчёты полевых сотрудников, озвучку ответов — помогает автоматизация бизнес-процессов: от выбора сервиса распознавания до регламента проверки качества расшифровки.

Частые вопросы

Сколько стоит Yandex SpeechKit?
Тарифы зависят от объёма обработанной речи и рассчитываются по прайсу на странице сервиса Yandex Cloud — актуальные цифры лучше смотреть там, они меняются чаще, чем обновляется статья.
Как SpeechKit распознаёт речь онлайн?
Запись отправляется через api сервиса в облако Яндекса, распознавание происходит там и текст возвращается обратно — отдельная установка программы на компьютер здесь без надобности.
Чем SpeechKit озвучивает текст?
Синтезом речи — сервис превращает написанный текст в голосовое аудио с выбором голоса и скорости, годится для уведомлений, роликов и голосовых подсказок.
SpeechKit работает с русским языком?
Да, сервис Яндекса ориентирован на русский язык в первую очередь, включая отраслевую терминологию при подключении словаря.
Чем SpeechKit отличается от SaluteSpeech?
Оба сервиса решают одну задачу — распознавание и синтез речи в облаке, только у разных вендоров, с собственными тарифами и условиями подключения; выбор обычно зависит от того, какая экосистема облака уже используется в компании.
Можно ли использовать Whisper вместо SpeechKit?
Да, Whisper — открытая модель распознавания речи для запуска на своём сервере, без отправки записей во внешнее облако; синтез речи отдельно решается другим инструментом.