Фирменный голос компании в SpeechKit Brand Voice бывает трёх видов: Premium, Lite и Call Center. Все они опираются на записи живой речи, поэтому проект начинается с письменного согласия владельца голоса и договора о правах, а заканчивается приёмкой озвучки по проверочным текстам. Без согласия диктора запускать такой проект нельзя.

Три варианта голоса

TL;DR

По документации Yandex AI Studio, Brand Voice бывает Premium, Lite и Call Center: первые два строятся на записях диктора, третий собирает фразы из заготовленных шаблонов для телефонии.

Выбор зависит от задачи. Если нужна озвучка видео, обучающих курсов и ассистента с любым текстом, смотрят в сторону Premium или Lite. Если речь о телефонных оповещениях с повторяющимися фразами и подставляемыми переменными, подходит Call Center. Ниже сведены ключевые отличия по обзору документации.

ВариантДля чегоИсходные данныеКак получить
PremiumГолосовые помощники, боты колл-центров, синтез текстовПодготовка данных вместе со специалистами Yandex Cloud, включая подбор студии и диктораЗаявка через форму на сайте
LiteПолнотекстовый синтез по записям диктора, работа по шаблонам исключенаРазмеченное аудио диктора от 30 минут, рекомендуется большеСамостоятельное обучение, результат доступен через API
Call CenterТелефонные сценарии: обзвон, поддержка, опросыШаблоны фраз без обучения отдельной модели диктораУсловия уточняйте в документации сервиса

Общие возможности SpeechKit разбирает статья про распознавание и синтез речи для бизнеса, а технику подключения к сервису описывает материал про SpeechKit API. Эта статья посвящена другому: как оформить голос компании так, чтобы им можно было пользоваться без споров о правах.

Прежде всего проверьте, нужен ли отдельный голос. Для внутренних уведомлений и черновых роликов хватает готовых голосов сервиса, и проект с диктором только добавит договоров. Фирменный голос оправдан там, где компанию узнают по звучанию: линия поддержки, обучающие курсы, рекламные ролики, голосовой ассистент в приложении. Решение принимает владелец бренда вместе с юристом, а расчёт затрат проводят после согласования сценариев.

Согласие диктора

Документация Lite требует подтвердить письменное согласие человека, чей голос использован в записях, на создание и применение синтезированной речи. Это условие сервиса, и оно же здравый смысл: голос принадлежит конкретному человеку, а клон способен произносить слова, чуждые владельцу голоса. Клонировать голос без согласия владельца нельзя, независимо от того, кто это — сотрудник, актёр озвучки или руководитель.

Договор с диктором составляют вместе с юристом. В договоре опишите следующее.

  • Что именно разрешено: создание модели голоса, озвучка рекламы, обучающих материалов, телефонных сообщений, ответов ассистента.
  • Где и как долго: каналы, территория, срок действия разрешения.
  • Что запрещено: политические и сомнительные сообщения, тексты от имени диктора как личного мнения, передача модели третьим лицам.
  • Как диктор отзывает согласие и что тогда происходит с моделью и уже выпущенными записями.
  • Вознаграждение, порядок согласования новых сценариев и хранение подписанного документа.

Отдельный вопрос — персональные данные. Голос и записи могут оказаться персональными данными, а в некоторых ситуациях к ним применяют повышенные требования; квалификацию и порядок обработки определяет юрист по актуальной редакции закона, универсальной формулы тут нет. Материал о клонировании голоса для бизнеса содержит расширенный перечень вопросов к договору.

Запись и обучение

Качество синтеза зависит от качества записей, и документация Lite прямо возлагает подготовку данных на пользователя. Чем аккуратнее запись, тем меньше сюрпризов после обучения. Технические требования для Lite собраны в разделе про создание голоса: от тридцати минут речи, лучше больше; формат WAV, моно, 16 бит, 48 кГц; файлы до пятнадцати секунд с короткой тишиной в начале и конце; тихое помещение без эха; треть материала и больше занимают вопросительные фразы.

  1. Подготовьте сценарий записи: тексты в стиле будущих сообщений компании, с цифрами, названиями продуктов, вопросами и паузами.
  2. Проведите запись в тихой комнате, придерживаясь одной манеры подачи. Диктор читает так, как будет звучать бренд, без случайных экспериментов.
  3. Нарежьте материал на короткие файлы нужного формата и сверьте текст каждого файла с записью.
  4. Загрузите набор, создайте голос и дождитесь окончания обучения. Статусы голоса в документации таковы: создание, пробный период, архив, если голос остался без активации, и активный голос с платным хранением.
  5. Пока идёт пробный период, прогоните проверочные тексты, а решение об активации принимайте только после приёмки.

Условия пробного периода, его срок и тарификацию хранения уточняйте на странице сервиса перед запуском: правила могут измениться. Пробный период позволяет слушать голос в Playground, а работа с ним идёт по адресу модели через API.

Смысл пробного периода в том, чтобы сравнить фирменный голос с обычным на одинаковых текстах. Если разница слышна только диктору, а клиенты её игнорируют, вернитесь к вопросу о цели проекта. Сравнивайте вслепую: дайте слушателям пары записей без подписей и спросите, какая звучит ближе к бренду.

● Discovery · 1 час · бесплатно

Для каких сообщений вашей компании нужен фирменный голос?

Прийти на Discovery →

Приёмка озвучки

Приёмка голоса — это проверка набора фраз по списку. Составьте проверочный набор из реальных текстов компании и держите его неизменным между запусками. Каждый вариант настройки сравнивайте на тех же фразах.

  • Числа, даты, телефоны, суммы и адреса: чтение по цифрам и по смыслу, правильные падежи.
  • Названия продуктов, фамилии, аббревиатуры и латиница: ударения и произношение, как записано в словаре компании.
  • Вопросительные и восклицательные фразы: интонация совпадает с ожидаемой.
  • Длинные тексты: ровность темпа, отсутствие срывов и странных пауз на втором-третьем абзаце.
  • Фразы с юридическим смыслом: прослушивание ответственным сотрудником перед выпуском.

Слушают как минимум трое: владелец контента, представитель юристов или комплаенса и человек, близкий к клиентам. Диктора тоже приглашают оценить результат: он вправе заметить, что клон звучит в несвойственной ему манере. Протокол приёмки хранится вместе с версией голоса и версией проверочного набора. Приёмы работы с ударениями и словарём подробно описаны в материале про приёмку озвучки.

Закрепите правило выпуска: сообщение с юридическими обязательствами, ценами и условиями выходит голосом бренда после прослушивания человеком. Полностью автоматическая озвучка допустима для типовых справок, у которых шаблон утверждён заранее.

Жизнь голоса

После запуска у голоса есть владелец внутри компании: он решает, какие сообщения озвучиваются, ведёт журнал заказов на озвучку и отслеживает договор с диктором. Журнал хранит, кто и когда запросил озвучку, какой текст использовался и кто его утвердил. Если диктор отзывает согласие или условия договора меняются, владелец знает, какие записи затронуты.

Телефонный вариант Call Center подчиняется собственным ограничениям: по обзору документации длительность одного синтезированного высказывания ограничена, объём текста с переменными тоже, а доля подставляемой части ограничена четвертью текста или аудио. Звук для телефона формируется с пониженной частотой. Поэтому длинные сообщения разбивают на короткие фразы и проверяют на реальной линии, помимо прослушивания в наушниках.

Защитите модель от посторонних: доступ к ключам API только у сервера и узкого круга сотрудников, журнал запросов включён, резервные копии записей хранятся в закрытом месте.

// с чего начать

Начните с договора и перечня сценариев, а запись голоса отложите на следующий шаг. Когда согласие подписано, а десять проверочных текстов утверждены, переходите к подготовке материала. Если нужна помощь с постановкой проекта, загляните на страницу про внедрение ИИ в компании.

Частые вопросы

Что такое SpeechKit Brand Voice?
Сервис Яндекса для создания фирменного синтезированного голоса компании. В документации описаны три варианта: Premium и Lite на записях диктора и Call Center для телефонных сценариев на основе шаблонов фраз.
Нужно ли согласие диктора для Brand Voice?
Да. Для Lite документация требует подтвердить письменное согласие человека, чей голос использован в записях. Договор с диктором составляйте вместе с юристом: в нём фиксируют сценарии, срок, каналы и порядок отзыва согласия.
Сколько записей нужно для Brand Voice Lite?
По документации, от тридцати минут речи, рекомендуется больше. Формат WAV, моно, файлы до пятнадцати секунд, треть вопросительных фраз и больше. Актуальные требования смотрите на странице сервиса.
Чем Brand Voice Call Center отличается от Lite?
Call Center создан для телефонной автоматизации и собирает речь из шаблонов с подставляемыми переменными, без отдельной модели диктора. У него есть ограничения на длину высказывания и долю переменной части. Lite даёт полнотекстовый синтез.
Как принять озвучку фирменного голоса?
Составьте неизменный набор реальных текстов с числами, именами, вопросами и длинными абзацами. Прослушайте его вместе с владельцем контента и юристом, зафиксируйте результат в протоколе вместе с версией голоса и только затем активируйте голос.