Какие нейросети для генерации аудио есть и какими пользоваться
Большинство нейросетей для видео генерируют ролики без звука. Некоторые умеют добавлять аудио, но делают это так себе: звуки не попадают в то, что происходит в кадре, или просто не соответствуют настроению. Исключения — Veo и Sora, которые умеют генерировать и видео, и звук сразу, причем достаточно качественно.
Единственное — звук иногда получается довольно глухим, а голоса роботизированными. Да и на русском языке нейронки не всегда правильно озвучивают слова. Еще неплохой звук выдает Kling. А в Wan еще до генерации можно загрузить нужный звуковые эффекты, а нейронка сгенерирует видео с их учетом. Не всегда качественно, но постарается;)
В общем, сейчас оптимальный процесс выглядит так: сначала генерируете видео, потом отдельно создаете аудио, а затем совмещаете их на монтаже. Аудио может быть чем угодно: и музыкой, и эффектами, и закадровым голосом, и даже голосом актеров в кадре.
Затем видео и аудио просто сводите в любом видеоредакторе, хоть на телефоне. Это не очень удобно, потому что иногда придется повозиться с нормальной синхронизацией видео и аудио. А особенно неудобно, если делаете ролик с говорящим персонажем — тут да, придется заморочиться и использовать Lip-Sync или специальные инструменты вроде HeyGen. Подробнее об этом мы рассказываем в курсе для более опытных.
В любом случае генераторами аудио нужно пользоваться, потому что они развиваются и в какой-то момент точно выкатят фишку автоматической озвучки. Когда вы будете загружать видео, а нейронка будет подбирать звуковые эффекты и все остальное.
Полная версия доступа только подписчикам
Вступив в Нейроцех, вы получите
доступ к материалу, а также:
Закрытое активное
сообщество
Доступ к ежемесячным
вебинарам
100+ подробных гайдов по нейросетям
24 скидки от партнёров на различные сервисы
Это урок из миникурса
Чтобы продолжить чтение, приобретите доступ к курсу или оформите подписку.
Подробнее о курсеУже есть аккаунт? Войти