LONGTAKE / АкадемияВ студию
Академия / Блок 5 · Звук
Урок 5.1

Звук кадра и голос героя

После этого урока твои кадры перестают быть немыми, а герой говорит по-русски своим голосом и с нужной интонацией. Здесь же: сколько речи держит один кадр, почему губы под русский не попадают и когда голос собирают отдельно.

60 минутновый инструмент

Тишина выдаёт генерацию

Правило монтажёров: плохую картинку со звуком зритель досмотрит, хорошую без звука выключит. Кадр с шумом ветра, шагами и дыханием читается как снятый, в тишине он же выглядит компьютерной заставкой.

Три вида звука в промпте

Эмбиент

Фон места: ветер, дождь, гул города. Самый надёжный вид звука: wind and distant seagulls.

Эффекты

Звук того, что происходит в кадре. Работает, пока источник виден: footsteps on wet gravel, a door creaks open.

Речь

Модель произносит реплику сама, отдельный липсинк не нужен. Взамен требует точности: кто говорит, как и на каком языке.

Реплика идёт прямой речью:

промпт
the old man says quietly, without turning: "It is late."
  • Язык называй словами. По написанию реплики модель его не определяет: русская фраза уходит как says in Russian: "…". Русский она произносит чисто, а в губы не попадает: проверено дублем на Seedance 2.5.
  • Длина. Один кадр держит длинную речь: в ролике из урока 7.3 герой говорит одиннадцать секунд подряд, больше двадцати слов, без склейки, а в соседнем восьмисекундном кадре помещаются две фразы. Разносить диалог по кадрам незачем.
  • Тон задай действием: «тихо, не поворачиваясь», «сквозь зубы», «с паузой перед ответом».
  • Музыку запрещай. Голый no music на четырёх дублях сработал так же, как перечень по видам. Перечень оставь страховкой: Nothing else at any point: no music, no score, no crowd, no voiceover. Это одно из немногих мест, где курс пишет запреты.

Голос героя закрепляют сэмплом

Без сэмпла тембр в каждом кадре свой. Сэмпл делается в карточке персонажа, двумя путями.

  • По описанию. Возраст, тембр, манера и фраза, которую надо произнести. Два десятка языков, включая русский. Секунда стоит доли цента.
  • По портрету. Описание оставляешь пустым, и голос собирается по лицу героя.

Сэмпл должен быть сухим: музыка, попавшая в запись, поедет во все сцены.

Когда голос собирают руками

Интонацию модель выбирает сама, а под русский не попадает в губы. Если нужна своя подача или русская реплика точно в губы, кадр и звук делают порознь:

  1. Кадр без речи. Герой говорит, но слова неважны. Длину бери под будущую реплику: втискивать готовый звук в снятый кадр поздно.
  2. Голос отдельно. Сэмпл из карточки персонажа или своя запись.
  3. Липсинк. Видео и звук уходят в сторонний сервис, который переставляет губы под реплику. В студии такого шага нет.
  4. Сборка. Готовый кадр идёт в монтаж вместе с остальными.

Дольше, чем родная речь модели. Зато интонацию переделываешь, не трогая видео.

На крупном плане зритель считывает каждое движение губ, на общем их не разобрать. Крупный план говорящего чаще прочих ловит отказ выходной модерации, уже после рендера. Лечит это промпт портрета из урока 4.1: ordinary unremarkable face, looks nothing like any actor. Отсюда приём:

В студии

Голос героя делается в самой студии, сторонний сервис не нужен. Генератору голоса нужен свой ключ Seed Speech, отдельный от ключа из урока 1.5; без него прикрепи к карточке свою запись. Аудиовход есть только у Seedance: выберешь Veo, Omni или Kling, и голос в кадр не уедет. Готовую реплику переписывает правка дубля на Seedance 2.5: мы проверили, кадр остаётся прежним, а фраза меняется. Синхрон после переозвучки смотри сам.

Получилось, если0/5
Практика в студии

Практика: три звуковых кадра и реплика героя

Три кадра на звук от модели: эмбиент, эффект действия, короткая английская реплика. Потом одна фраза твоего персонажа по-русски, голосом из карточки персонажа. Слушай в наушниках.