← в блог
12 сентября 2026 г.·11 мин чтения

Ролик со своим лицом и голосом: разбор по шагам

Тема выглядит так, будто всё уже решено: загрузил фото, написал промпт, получил видео с собой. На практике между «загрузил» и «получилось» лежит штук пять мест, где результат тихо ломается. Причём ломается не с ошибкой, а просто выходит плохо, и деньги за прогон уже списаны.

Ниже вся цепочка целиком: лицо, голос, замена лица в готовом клипе, генерация с нуля, перевод и липсинк. С ценами по каждому шагу и с местами, где я сам спотыкался.

Что вообще складывается в такой ролик

Разделю сразу, потому что дальше будет путаница. «Ролик со своим лицом» это две совершенно разные задачи, и делают их разные модели:

  • Замена лица. У меня есть снятый клип, я меняю в нём человека. Фон, движение, звук остаются мои. Промпт не нужен, потому что всё, что в кадре, я уже снял.
  • Генерация с нуля. Исходника нет, модель строит кадр по описанию. Промпт обязателен, он задаёт действие, фон и камеру.

Первая даёт реалистичность, потому что это настоящая съёмка. Вторая даёт свободу, но картинка получается чище и синтетичнее. Выбор между ними это выбор «мой фон или мой сценарий».

Шаг 1. Лицо

Начинается всё со набора эталонных фото. Тут первая неочевидная вещь: моделям нужно очень мало фото. Kling берёт максимум четыре референса, и это жёсткий лимит, а не рекомендация. Так что все инструкции в духе «загрузите 15 фотографий» относятся к обучению своей модели, а не к обычной генерации.

Я прошу у себя 5-8 фото. Не потому, что модель их съест, а чтобы было из чего выбрать лучший кадр под конкретную сцену.

Блок эталонных фото в разделе персоны
Блок «Как выглядит». Плитки с ракурсами, требования справа, галка о праве на лицо снизу. Без галки генерация не запустится.

Что реально влияет на результат, по убыванию:

  1. Крупность лица в кадре. Потолок разрешения у свапа 720p. Если человек стоит далеко, на лицо приходится слишком мало пикселей, и модель его просто не вытянет. Средний план работает заметно лучше общего.
  2. Совпадение освещения фото и целевого видео. Про это ниже отдельно, там самая интересная часть.
  3. Ракурс. Лицо должно быть видно целиком. Сильный поворот головы или частично закрытые черты портят результат.
  4. Резкость. Чем хуже исходник, тем хуже выход. Тут без сюрпризов.

И отдельный пункт, до которого я дошёл не сразу: положите одно фото в полный рост или по пояс. Эталоны обычно портретные, и если в сцене будет видно не только лицо, модель придумает фигуру и одежду сама. Иногда прилично, иногда нет.

Если своего лица нет

Половина людей, которые это делают, работают с персонажем, которого не существует. Для них есть второй вход: описываешь внешность текстом, и модель рисует четыре кадра одного и того же несуществующего человека.

Тут была техническая ловушка, на которую я напоролся при сборке. Логично сделать четыре запроса с одним и тем же описанием и разными ракурсами. Так получаются четыре разных человека, потому что у модели нет параметра, который зафиксировал бы внешность между запросами. Работает только так: сгенерить первый кадр, а остальные три выводить из него, передавая его как референс. Тогда это один человек.

Поэтому там же есть кнопка «дорисовать ракурсы»: она берёт настоящие фото и достраивает недостающие углы. Если у вас один хороший портрет, этого уже достаточно для старта.

Создание модели по описанию
Вкладка «Создать модель». Описание внешности, и на выходе фас, три четверти, профиль и улыбка одного лица.

Шаг 2. Голос

Три способа, и они отличаются не качеством, а уникальностью:

СпособЧто нужноУникальность
Клон своего60-90 сек чистой речиАбсолютная, это ваш голос
Собрать голосОписание словамиВысокая, такого тембра нет ни у кого
БиблиотекаНичегоНикакой, звучит у всех, кто выбрал

Для клона хватает минуты-полутора. Читайте любой текст ровным голосом, без музыки и без эха в комнате. Дальше этим голосом читается любой текст.

А вот со «собрать голос» есть деталь, которая меня удивила. У модели нет числовых настроек. Она принимает описание словами. Все ползунки «тембр, темп, теплота», которые вы видите в интерфейсах, это надстройка: они складываются в текст, и уже текст уходит в модель.

Поэтому у нас это описание показано отдельным полем, и его можно переписать руками. Это даёт заметно больше контроля, чем три ползунка. Например, «хриплый мужской голос, ленивая манера, будто рассказывает историю другу» ползунками не выставишь никак.

Вкладка сборки голоса с описанием
Ползунки складываются в описание под ними. Поле редактируемое, и решает именно текст.

Шаг 3. Замена лица. Тут главная грабля

Клип на дорожку, выбрать персону, нажать. И вот место, где чаще всего получается мусор, причём непонятно почему.

Модель считывает личность с одного кадра. Не со всего видео. Одного. И по умолчанию это первый кадр клипа.

Теперь подумайте, что у вас в первом кадре. Затемнение. Титры. Общий план, где вы входите в комнату. Затылок. В любом из этих случаев модели нечего считывать, и замена либо не срабатывает, либо плывёт по всему ролику. А выглядит это как «модель плохая».

Поэтому у нас кадр берётся с текущего положения плейхеда. То есть буквально: поставьте ползунок на момент, где ваше лицо крупно и хорошо видно, и запускайте оттуда. Одно это решает больше, чем все остальные настройки вместе.

Панель замены лица в редакторе
Панель свапа. Переключатель «брать лицо с текущего кадра» и выбор разрешения.

Приём, который вытягивает качество сильнее всего

В инструкциях к похожим сервисам встречается совет: соберите эталонное фото на основе первого кадра целевого видео, чтобы свет и ракурс совпали. Дальше идёт промпт строк на двадцать, который надо скопировать в отдельный графический редактор, собрать там портрет и вернуться обратно.

Совет абсолютно верный. Совпадение освещения это второй по важности фактор после крупности лица. Только делать это руками неудобно настолько, что почти никто не делает.

Но клип-то уже лежит на таймлайне. Значит, кадр можно взять самим, отдать его модели вместе с фото персоны и получить персону в том же освещении и ракурсе, что и в кадре. И уже ею делать замену.

У нас это переключатель «подогнать эталон под этот кадр», включён по умолчанию. Стоит 0,08 доллара сверху, то есть примерно треть от цены самой замены. Выключать стоит только если хочется сэкономить на черновике.

Шаг 4. Генерация с нуля

Здесь исходника нет, и промпт становится единственным, что задаёт кадр. Лицо подставляется как ссылка, которую надо упомянуть в тексте, иначе модель не знает, кто в кадре.

Сравните два промпта. Плохой:

человек танцует под дождём и поёт

Рабочий:

@Image1 танцует под дождём на ночной улице,
средний план, чёрная куртка и джинсы, мокрые волосы,
неоновые отражения в лужах, камера медленно кружит

Разница в том, что во втором указано, кто в кадре, что на нём надето, какая крупность и как движется камера. Всё, чего вы не сказали, модель придумает за вас.

И сразу про пение, потому что это спрашивают чаще всего

Если написать «поёт песню», рот будет двигаться и вид будет как у поющего. Но голос будет выдуманный моделью, не ваш, и конкретной песни не будет.

Это не недоработка конкретного сервиса. Все видео-модели, которые умеют генерировать звук, придумывают голос сами. Ни одна не принимает ваш клон. Чтобы получился именно ваш голос, нужна цепочка из трёх шагов: сгенерировать видео, озвучить клоном, подогнать губы липсинком. И даже тогда останется ограничение: синтез речи не поёт, он читает. Нормального пения своим голосом сейчас нет нигде, и это стоит знать заранее, чтобы не искать.

Шаг 5. Перевод и липсинк

Самый недооценённый сценарий: у вас есть свой ролик, и вы хотите его на английском своим голосом. Для этого клон голоса даже не нужен: модель дубляжа снимает тембр прямо с дорожки. Загрузили, выбрали язык, получили тот же голос на другом языке.

Дальше про цену, и тут есть важная арифметика.

Дубляж тарифицируется за начатую минуту, с округлением вверх. Это значит, что ролик на 19 секунд стоит столько же, сколько на 59: одну полную минуту. Я на этом сначала посчитал цену пропорционально секундам и ошибся втрое. Если собираетесь переводить много коротких роликов, дешевле склеить их в один и перевести пачкой.

Липсинк это отдельная операция и она в пять раз дороже самого перевода. Поэтому у нас он выключен по умолчанию, с честной пометкой. Без липсинка губы не совпадут, и для говорящей головы это нормально, так работает большинство сервисов дубляжа. Включать стоит, когда лицо крупно в кадре и рассинхрон бросается в глаза.

Панель озвучки, вкладка перевода
Вкладка перевода. Языки, выбор голоса и липсинк отдельной галкой с ценой.

Сколько это стоит на самом деле

Цены собрал сам, сверяясь со страницами моделей на 12 сентября 2026. Они меняются, так что проверяйте, но порядок такой:

ОперацияЦенаКак считается
Замена лица, 720p$0,20За клип до 5 сек, дальше вдвое
Подгонка эталона под кадр$0,08За изображение
Генерация с лицом$0,14 / секСо звуком. Без звука $0,112
Оживление фото~$0,30 за 5 секЗа секунду
Перевод$0,60 / минЗа начатую минуту, вверх
Липсинк$3 / минВерсия pro $5
Озвучка текста$0,10 / 1000 знаковРолик на 30 сек ~$0,05

Для сверки: один мой ролик на 5 секунд со звуком обошёлся в 0,28 доллара. Это совпало с расчётом по формуле, так что таблице можно верить.

Обратите внимание на разброс. Озвучка текста стоит копейки, замена лица центы, а липсинк минуты видео уже сравним с обедом. Планировать бюджет надо по липсинку, всё остальное на его фоне шум.

Короткий чеклист

  • 5-8 фото, одно из них в полный рост.
  • Ровный свет, без очков и шапок, лицо целиком.
  • Перед свапом поставить плейхед на кадр с крупным лицом.
  • Подгонку эталона под кадр не выключать.
  • 720p это потолок, HD не будет ни у кого.
  • В промпте описать одежду, крупность и камеру.
  • Для перевода клон не нужен.
  • Липсинк включать только при крупном лице.
  • Короткие ролики переводить пачкой, а не по одному.

Что пока не работает ни у кого

Чтобы не искали там, где нет:

  • Пение своим голосом. Видео-модель придумает голос, синтез речи не поёт.
  • HD в замене лица. Потолок 720p, и это ограничение технологии, а не сервиса.
  • Долгие клипы одним куском. Чем длиннее исходник, тем менее стабилен результат. Если в видео есть склейка или смена образа, режьте на части и собирайте обратно.

Последний пункт, кстати, главная причина, почему всё это удобнее делать в редакторе с таймлайном, а не в боте. Разрезать по сценам, прогнать каждую отдельно и склеить обратно там просто нечем.