Фирменный голос компании в SpeechKit Brand Voice бывает трёх видов: Premium, Lite и Call Center. Все они опираются на записи живой речи, поэтому проект начинается с письменного согласия владельца голоса и договора о правах, а заканчивается приёмкой озвучки по проверочным текстам. Без согласия диктора запускать такой проект нельзя.
Три варианта голоса
По документации Yandex AI Studio, Brand Voice бывает Premium, Lite и Call Center: первые два строятся на записях диктора, третий собирает фразы из заготовленных шаблонов для телефонии.
Выбор зависит от задачи. Если нужна озвучка видео, обучающих курсов и ассистента с любым текстом, смотрят в сторону Premium или Lite. Если речь о телефонных оповещениях с повторяющимися фразами и подставляемыми переменными, подходит Call Center. Ниже сведены ключевые отличия по обзору документации.
| Вариант | Для чего | Исходные данные | Как получить |
|---|---|---|---|
| Premium | Голосовые помощники, боты колл-центров, синтез текстов | Подготовка данных вместе со специалистами Yandex Cloud, включая подбор студии и диктора | Заявка через форму на сайте |
| Lite | Полнотекстовый синтез по записям диктора, работа по шаблонам исключена | Размеченное аудио диктора от 30 минут, рекомендуется больше | Самостоятельное обучение, результат доступен через API |
| Call Center | Телефонные сценарии: обзвон, поддержка, опросы | Шаблоны фраз без обучения отдельной модели диктора | Условия уточняйте в документации сервиса |
Общие возможности SpeechKit разбирает статья про распознавание и синтез речи для бизнеса, а технику подключения к сервису описывает материал про SpeechKit API. Эта статья посвящена другому: как оформить голос компании так, чтобы им можно было пользоваться без споров о правах.
Прежде всего проверьте, нужен ли отдельный голос. Для внутренних уведомлений и черновых роликов хватает готовых голосов сервиса, и проект с диктором только добавит договоров. Фирменный голос оправдан там, где компанию узнают по звучанию: линия поддержки, обучающие курсы, рекламные ролики, голосовой ассистент в приложении. Решение принимает владелец бренда вместе с юристом, а расчёт затрат проводят после согласования сценариев.
Согласие диктора
Документация Lite требует подтвердить письменное согласие человека, чей голос использован в записях, на создание и применение синтезированной речи. Это условие сервиса, и оно же здравый смысл: голос принадлежит конкретному человеку, а клон способен произносить слова, чуждые владельцу голоса. Клонировать голос без согласия владельца нельзя, независимо от того, кто это — сотрудник, актёр озвучки или руководитель.
Договор с диктором составляют вместе с юристом. В договоре опишите следующее.
- Что именно разрешено: создание модели голоса, озвучка рекламы, обучающих материалов, телефонных сообщений, ответов ассистента.
- Где и как долго: каналы, территория, срок действия разрешения.
- Что запрещено: политические и сомнительные сообщения, тексты от имени диктора как личного мнения, передача модели третьим лицам.
- Как диктор отзывает согласие и что тогда происходит с моделью и уже выпущенными записями.
- Вознаграждение, порядок согласования новых сценариев и хранение подписанного документа.
Отдельный вопрос — персональные данные. Голос и записи могут оказаться персональными данными, а в некоторых ситуациях к ним применяют повышенные требования; квалификацию и порядок обработки определяет юрист по актуальной редакции закона, универсальной формулы тут нет. Материал о клонировании голоса для бизнеса содержит расширенный перечень вопросов к договору.
Запись и обучение
Качество синтеза зависит от качества записей, и документация Lite прямо возлагает подготовку данных на пользователя. Чем аккуратнее запись, тем меньше сюрпризов после обучения. Технические требования для Lite собраны в разделе про создание голоса: от тридцати минут речи, лучше больше; формат WAV, моно, 16 бит, 48 кГц; файлы до пятнадцати секунд с короткой тишиной в начале и конце; тихое помещение без эха; треть материала и больше занимают вопросительные фразы.
- Подготовьте сценарий записи: тексты в стиле будущих сообщений компании, с цифрами, названиями продуктов, вопросами и паузами.
- Проведите запись в тихой комнате, придерживаясь одной манеры подачи. Диктор читает так, как будет звучать бренд, без случайных экспериментов.
- Нарежьте материал на короткие файлы нужного формата и сверьте текст каждого файла с записью.
- Загрузите набор, создайте голос и дождитесь окончания обучения. Статусы голоса в документации таковы: создание, пробный период, архив, если голос остался без активации, и активный голос с платным хранением.
- Пока идёт пробный период, прогоните проверочные тексты, а решение об активации принимайте только после приёмки.
Условия пробного периода, его срок и тарификацию хранения уточняйте на странице сервиса перед запуском: правила могут измениться. Пробный период позволяет слушать голос в Playground, а работа с ним идёт по адресу модели через API.
Смысл пробного периода в том, чтобы сравнить фирменный голос с обычным на одинаковых текстах. Если разница слышна только диктору, а клиенты её игнорируют, вернитесь к вопросу о цели проекта. Сравнивайте вслепую: дайте слушателям пары записей без подписей и спросите, какая звучит ближе к бренду.
Для каких сообщений вашей компании нужен фирменный голос?
Приёмка озвучки
Приёмка голоса — это проверка набора фраз по списку. Составьте проверочный набор из реальных текстов компании и держите его неизменным между запусками. Каждый вариант настройки сравнивайте на тех же фразах.
- Числа, даты, телефоны, суммы и адреса: чтение по цифрам и по смыслу, правильные падежи.
- Названия продуктов, фамилии, аббревиатуры и латиница: ударения и произношение, как записано в словаре компании.
- Вопросительные и восклицательные фразы: интонация совпадает с ожидаемой.
- Длинные тексты: ровность темпа, отсутствие срывов и странных пауз на втором-третьем абзаце.
- Фразы с юридическим смыслом: прослушивание ответственным сотрудником перед выпуском.
Слушают как минимум трое: владелец контента, представитель юристов или комплаенса и человек, близкий к клиентам. Диктора тоже приглашают оценить результат: он вправе заметить, что клон звучит в несвойственной ему манере. Протокол приёмки хранится вместе с версией голоса и версией проверочного набора. Приёмы работы с ударениями и словарём подробно описаны в материале про приёмку озвучки.
Закрепите правило выпуска: сообщение с юридическими обязательствами, ценами и условиями выходит голосом бренда после прослушивания человеком. Полностью автоматическая озвучка допустима для типовых справок, у которых шаблон утверждён заранее.
Жизнь голоса
После запуска у голоса есть владелец внутри компании: он решает, какие сообщения озвучиваются, ведёт журнал заказов на озвучку и отслеживает договор с диктором. Журнал хранит, кто и когда запросил озвучку, какой текст использовался и кто его утвердил. Если диктор отзывает согласие или условия договора меняются, владелец знает, какие записи затронуты.
Телефонный вариант Call Center подчиняется собственным ограничениям: по обзору документации длительность одного синтезированного высказывания ограничена, объём текста с переменными тоже, а доля подставляемой части ограничена четвертью текста или аудио. Звук для телефона формируется с пониженной частотой. Поэтому длинные сообщения разбивают на короткие фразы и проверяют на реальной линии, помимо прослушивания в наушниках.
Защитите модель от посторонних: доступ к ключам API только у сервера и узкого круга сотрудников, журнал запросов включён, резервные копии записей хранятся в закрытом месте.
Начните с договора и перечня сценариев, а запись голоса отложите на следующий шаг. Когда согласие подписано, а десять проверочных текстов утверждены, переходите к подготовке материала. Если нужна помощь с постановкой проекта, загляните на страницу про внедрение ИИ в компании.