Как сделать закадровую озвучку
Сервисов для озвучки текста много. Но у них есть проблема — они плохо озвучивают русский текст или делают это с явным английским акцентом. Выход есть — пользоваться сервисом Elevenlabs или проверенными модельками на HuggingFace.
Рассказываю, как сделать озвучки шаблонным голосом, а также — как сделать клон своего голоса и озвучивать текст им.
Гайды по теме:
Как сделать озвучку шаблонным голосом
Это вариант бесплатный. Работать можно в Elevenlabs или в модельке Edge TTS Text-to-Speech на HuggingFace. Гайд, как работать с HuggingFace, читайте по ссылке.
Чтобы озвучить текст на HuggingFace, добавьте текст в Input Text (лучше добавлять до 5000 символов), в Select Voice выберите русскую озвучку (есть мужчина и женщина) и кликните на Submit. Практически моментально вы получите озвучку.
Речь спикера можно исправить:
- Перемещайте ползунок Speech Rate Adjustment (%), чтобы диктор говорил быстрее или медленно.
- Перемещайте ползунок Pitch Adjustment (Hz), чтобы менять тональность голоса диктора.

Минус модели — здесь нельзя расставить акценты. Нельзя выделить какие-то слова, чтобы нейронка прочитала их громче или сделала явную вопросительную интонацию. Можно только создать паузу, для этого перед словом нужно поставить запятую «,».
Зато расставить акценты можно в Elevenlabs.
Для этого зарегистрируйтесь в сервисе, откройте вкладку «Speech» и добавьте текст. Затем расставьте акценты:
- Запятую «,», чтобы нейронка сделала паузу между словами. Две запятые «,,», чтобы пауза была дольше.
- Восклицательный знак «!» в конце предложения или после нужного слова, чтобы нейросеть сказала это слово громче и сделала на нем акцент. Два восклицательных знака «!!», чтобы акцент был сильнее.
- Напишите слово через CapsLock «СЛОВО», чтобы нейросеть сказала это слово громче и сделала на нем акцент. При желании добавьте восклицательный знак «СЛОВО!», Иногда так нейронка лучше расставляет акценты, чем при использовании только восклицательных знаков.
- Вопросительный знак «?» в конце предложения, чтобы нейросеть изменила интонацию. Два вопросительных знака «??», чтобы интонация была сильнее.
- Длинное тире «—», чтобы нейросеть выждала паузу. Иногда можно заменить на запятую, нужно тестировать.
Чтобы расставить акценты правильно, прочитайте текст самостоятельно и отметьте, где нужно сделать паузу, где — выделить слово, а где — поставить вопрос.
Например, у меня получился такой текст:
«Взгляните на этот ледник. Он был свидетелем ИСТОРИИ!! но сегодня его трещины и капли воды, стеКАЮЩИЕ по льду, рассказывают о том, КАК изменение климата оставляет свои следы на НАШЕЙ планете! Каждая трещина напоминает нам о ТОМ, что время действовать СЕЙЧАС! ВЫ согласны??»
Теперь разберемся, как сделать клон своего голоса и озвучивать тексты им.
Как сделать озвучку клонированным голосом
Хорошо с этой задачей справляется ElevenLabs. Но здесь уже понадобится платная подписка — она стоит от $5 в месяц. Если платить не хочется, можно воспользоваться моделькой Voice Cloning на HuggingFace, но хороший клон вряд ли получится.
Сначала разберемся с ElevenLabs. Чтобы на выходе получать хорошую озвучку, нужно загрузить в сервис качественные примеры.
Вот, что в ElevenLabs считается качественным примером.
Лучший пример — 1-2 минуты чистого звука без реверберации, артефактов или фонового шума любого рода. Количество используемых примеров не имеет значения. Важна общая длина примеров.
ИИ попытается имитировать все, что он слышит в аудиозаписи: скорость речи человека, а также интонации, акцент и тональность, характер и силу дыхания. А также шумы, звуки глотания и артефакты. Поэтому постарайтесь убрать на записи все факторы, которые могут сбить его с толку.
Лучше загружать аудио в формте MP3 на скорости 128 кбит/с и выше. Более высокие битрейты не дают заметного улучшения качества клона.
Еще один важный момент — ИИ попытается воспроизвести ваш голос с записи. Если вы говорите медленным, монотонным голосом без особых эмоций, именно это ИИ и будет имитировать. А если вы говорите быстро и с большими эмоциями, ИИ повторит за вами. Поэтому лучше создать несколько клонов с разной тональностью.
Не показывайте нейросети слишком тихую или громкую запись. Идеальный вариант — от −23 дБ до −18 дБ.
Если записать видео без артефактов не получается, можно убрать шумы вручную. Бесплатно убрать шумы можно в Adobe Podcast AI или CleanVoice.
Работают сервисы просто: загружаете аудио, нейронка автоматически убирает все лишнее и присылает хорошую запись.
Примеры подготовили, открываем вкладку «Voices» и жмем на «Add a new voice».

Выбираем «Instant voice cloning» и загружаем примеры.

Также голосу нужно дать теги и описание. Эти поля можно не заполнять, т. к. на генерациях это никак не отразится.
Затем нужно отметить чек-бокс и сохранить голос.

Голос готов, можно озвучивать текст.
Важно! Сейчас я рассказал, как сделать мгновенное клонирование голоса. В ElevenLabs есть еще одна функция — профессиональное клонирование голоса. Но чтобы его сделать, нужно оплатить подписку за $22 в месяц, а также записать минимум 30 минут материала. К технике и записи тоже есть требования:
- Любой микрофон, но ElevenLabs рекомендуют XLR-микрофоны.
- Используйте поп-фильтр, чтобы уменьшить количество перепадов по звуку на записи.
- Записывайтесь в помещении без проблем с акустикой. На записи не должно быть эхо и посторонних шумов.
Я эти требования выполнить не могу, поэтому копировал голос мгновенно. Голос все равно скопировался хорошо.
Теперь возвращаемся в раздел «Speech», добавляем текст и выбираем клон нашего голоса.

При первой генерации может показаться, что голос не совсем похож на ваш или что его нужно отредактировать. Чтобы это сделать, кликните на кнопку «Settings» или «Advanced».

Откроется раздел с настройкой речи. Здесь будет несколько установок и ползунков:
Model. Здесь можно выбрать модель, которая будет генерировать голос. Оставляем по умолчанию.
Stability (стабильность). Ползунок стабильности определяет монотонность голоса. Для более живого, эмоционального и драматичного озвучивания передвигайте ползунок влево. Чем ниже будет показатель стабильности, тем сильнее нейросеть будет следовать расставленным акцентам: говорить громче, делать паузы и т. д.
Если хотите получить более монотонную и серьезную речь, передвигайте ползунок вправо.
Similarity (сходство). Ползунок сходства определяет, насколько близко ИИ должен придерживаться исходного голоса при копировании. Если исходный звук низкого качества, а ползунок сходства передвинуть вправо, ИИ может воспроизводить артефакты или фоновый шум, которые были в исходной записи.
Style Exaggeration (увеличение стиля). Эта настройка пытается усилить стиль исходного диктора. Правда, даже сами ElevenLabs не могут объяснить, как это работает, и советуют оставлять значение на 0.
Speaker boost (усиление диктора). Эта настройка повышает сходство с оригинальным оратором. Ее всегда можно держать активной.
Важно! Ответы нейросети все равно остаются случайны. Установка ползунков на определенные значения не гарантирует одинаковых результатов каждый раз. Ползунки работают скорее как диапазон. Они определяют, насколько широкой может быть рандомизация между новыми генерациями. Поэтому лучший вариант получить хорошую озвучку — тестировать.
А я озвучил текст своим голосом и наложил его на видео. Что получилось — смотрите по ссылке.
В Voice Cloning нужно добавить текст для озвучки и загрузить пример голоса. Длительность примера — от 1 до 3 минут. Затем в разделе «language» нужно выбрать «RU» и кликнуть на «Submit».

Лично у меня скопировать свой голос не вышло. Отдаленные сходства есть, но все равно создается ощущение, будто говорит робот. Плюс кое-где все равно проскакивает английский акцент.
Поэтому я рекомендую купить подписку на ElevenLabs и работать там.