ElevenLabs ударения в русской озвучке удобнее всего держать под контролем через словарь произношения: вы один раз записываете, как должны звучать проблемные слова, фамилии и названия брендов, а сервис применяет запись ко всем текстам. Но словарь — лишь половина дела. Вторая половина состоит из короткого теста на проблемных фрагментах и ручной приёмки готового аудио человеком, который знает правильное звучание каждого слова.
Откуда берутся ошибки
Синтез ошибается в ударениях там, где слово редкое, заимствованное, написано без пояснений или омографично. Для таких мест нужен словарь произношения и ручная проверка, а полагаться на среднюю точность модели рискованно.
Модель угадывает ударение по контексту и по тому, что видела при обучении. На обычных словах она справляется, а ошибается на предсказуемых местах: фамилии и имена, названия компаний и продуктов, термины отрасли, сокращения, слова с двумя ударениями в зависимости от смысла. Для бизнеса особенно болезненны ошибки в имени клиента и в названии собственного бренда.
Цена ошибки зависит от назначения ролика. В рекламе неверное ударение в названии продукта создаёт ощущение небрежности, в обучающем курсе мешает усвоению, а в приветствии клиента по имени звучит почти оскорбительно. Поэтому порядок работы с произношением закладывают до первой публикации, пока жалоб нет.
- Имена и фамилии, особенно редкие и иностранные.
- Названия брендов, продуктов и улиц.
- Отраслевые термины и профессиональный жаргон.
- Аббревиатуры, которые читаются то по буквам, то как слово.
- Слова-омографы, где ударение зависит от смысла.
- Числа и единицы измерения в нестандартной записи.
Общий обзор сервиса для озвучки в бизнесе есть в статье ElevenLabs: озвучка для бизнеса, а о подключении через API и автоматическом контроле читайте в материале ElevenLabs API: автоматическая озвучка и контроль.
Способы задать звучание
Справка ElevenLabs описывает несколько способов управлять произношением, и применимость зависит от выбранной модели. Числа, даты и сокращения сервис по умолчанию приводит к произносимому виду сам, но для важных мест справка советует расписывать их словами ещё при подготовке текста. Прежде чем строить процесс, проверьте в актуальной документации, что нужный способ работает с вашей моделью.
Выбирать способ удобнее по масштабу задачи. Для единичного слова в одном ролике хватит пометки прямо в тексте. Для имён и брендов, которые встречаются постоянно, нужен словарь, потому что он действует на все тексты и сохраняет договорённости. Для регулярного производства озвучки словарь становится частью инфраструктуры и хранится рядом с шаблонами и сценариями.
| Способ | Что это | Для каких моделей |
|---|---|---|
| Запись в фонетическом алфавите | Слово оборачивается в разметку транскрипции | В справке описана для модели Eleven v4: символы записывают между косыми чертами, а ударение отмечают значками |
| Теги фонем | Разметка с указанием алфавита и транскрипции прямо в тексте | Только одна модель предыдущего поколения, eleven_flash_v2; надёжнее алфавит CMU, но он англоязычный |
| Замена-псевдоним | Слово заменяется другим написанием, которое читается нужным образом | Подходит моделям без поддержки фонем и словарям |
| Словарь произношения | Файл с парами «слово и замена», применяется ко всем текстам | Работает в студии создания озвучки и в студии дубляжа; файл в формате TXT или PLS |
Справка отмечает, что для русского языка отдельных указаний на странице нет, поэтому общие приёмы применяют по аналогии и проверяют на слух. Замена-псевдоним проще всего для начала: вы пишете слово так, как оно прочитается нужным образом, и сохраняете пару в словаре.
Словарь произношения
Словарь — это файл, который загружается в сервис и применяется к текстам при озвучке. Справка называет два формата: простой текстовый и стандартный формат PLS. Записи содержат пары «исходное слово и замена» с фонетической разметкой или псевдонимом.
Начинайте с короткого списка слов, которые чаще всего звучат ошибочно в ваших материалах. Полный словарь на всю отрасль строить бессмысленно, он быстро становится тяжёлым и трудно проверяется. Список растёт по мере работы: каждая найденная при приёмке ошибка превращается в запись, и через пару месяцев словарь закрывает основные проблемы.
- Выпишите из своих текстов проблемные слова: имена, бренды, термины, сокращения.
- Для каждого запишите правильное звучание и ударение, согласовав с носителем знаний: диктором, редактором или самим клиентом.
- Подберите способ записи: для русского чаще всего псевдоним, проверенный на слух.
- Соберите файл словаря и загрузите его в сервис.
- Озвучьте короткий тестовый текст со всеми словами из словаря и послушайте результат.
- Исправьте записи, которые прозвучали неверно, и повторите тест.
- Сохраните версию словаря с датой и перечнем изменений.
Справка уточняет, что словари чувствительны к регистру и обрабатываются последовательно, срабатывает первое совпадение. Поэтому следите за порядком записей и за вариантами написания: слово в начале предложения и в середине может требовать отдельной строки. Вынесите словарь в общий репозиторий, а правки проводите через ревью, как любой рабочий файл.
Какие имена и названия в ваших текстах озвучка произносит неверно?
Тест фрагментов
Полную озвучку нельзя запускать вслепую: ошибка в имени на пятой минуте обойдётся дороже короткого теста. Заведите набор тестовых фрагментов и прогоняйте его после каждого изменения словаря и каждой смены модели.
- Коротким фрагментам достаточно одного предложения с проблемным словом в середине.
- Включите каждое слово словаря в двух положениях: в начале и в середине предложения.
- Добавьте омографы в обоих смыслах, чтобы проверить, различает ли модель контекст.
- Добавьте предложения с числами, датами и единицами измерения.
- Сохраняйте результат прогона с датой, версией словаря и названием модели.
- После смены модели повторяйте весь набор: поведение ударений между версиями меняется.
Полезно хранить эталонные записи: короткое аудио с правильным звучанием каждого проблемного слова, произнесённое человеком. Эталон позволяет сравнить синтез с живой речью и объясняет разработчику словаря, чего вы добиваетесь. Для имён клиентов эталон лучше получить у самого клиента, это дешевле, чем исправлять записанную рассылку.
Для публикуемых материалов лучше завести две проверки: быструю по набору и итоговую по полному аудио. Автоматически проверить ударения нельзя, поэтому финальную приёмку выполняет человек. Для озвучки в другом сервисе Google есть материал Google AI Studio: озвучка текста и приёмка аудио.
Ручная приёмка
Последний рубеж — человек с хорошим слухом и знанием предмета. Он слушает готовое аудио целиком, с текстом перед глазами, и отмечает каждое расхождение.
Озвучка допускается к публикации только после прослушивания полного аудио с текстом сотрудником, который знает правильное звучание имён и названий. Любая ошибка в имени клиента или бренда возвращает материал на исправление.
- Ударения и имена: отмечаются отдельным списком, а исправления вносятся в словарь.
- Паузы и интонация: проверяется, нет ли обрывов и неверных вопросительных интонаций; в новейших моделях паузы задают знаками препинания, многоточием и тире, а тега паузы там нет.
- Числа и сокращения: читаются так, как задумано.
- Единый голос и темп на протяжении всего материала.
- Запись результата: кто слушал, когда, что исправлено.
Для корпоративной озвучки на собственных моделях есть материал Qwen3 TTS: корпоративная озвучка и проверка, а общий порядок сведения голоса, текста и музыки описан в статье Нейросеть для озвучки видео: текст, тайминг и сведение. Если нужен регламент озвучки с контролем произношения для вашей компании, мы готовим его в рамках консалтинга по внедрению ИИ.