Почему модель забывает героя
Причина не в том, что промпт плохой. Причина в том, что каждая генерация независима.
Модель не помнит предыдущий кадр. Для неё каждый запуск это чистый лист. Когда вы пишете «мужчина 30 лет, короткая борода, серая куртка», вы описываете не человека, а целый класс людей: под это описание подходят миллионы лиц. Модель каждый раз выбирает из этого класса заново, и совершенно логично, что выбирает разное.
Текст просто не обладает нужной точностью. Даже если вы распишете разрез глаз, форму носа и родинку на щеке, вы всё равно опишете тип внешности, а не конкретное лицо. Поэтому бороться с проблемой на уровне промпта бессмысленно, сколько бы прилагательных вы ни добавили.
Решение одно: перестать описывать персонажа словами и начать показывать его картинкой.
Способ 1. Референсное изображение
Базовый и самый рабочий приём. Вы загружаете изображение персонажа как образец, и модель опирается на него.
Важный нюанс: референс это не то же самое, что стартовый кадр. Стартовый кадр модель оживляет, то есть строит движение от него. Референс она использует как источник внешности, а сцену строит по вашему описанию. Второе гибче: вы можете поместить того же человека в другую локацию, другую одежду, другой свет.
Что делает референс хорошим:
- Лицо крупно и в фокусе. Если герой занимает десятую часть кадра, модели не с чего считывать черты.
- Нейтральный свет. Резкие тени и цветные подсветки модель воспримет как часть внешности и потащит их дальше.
- Нейтральное выражение. Улыбка до ушей на референсе имеет шанс приклеиться к персонажу навсегда.
- Несколько образцов лучше одного. Если модель принимает больше одного референса, дайте ей разные ракурсы.
Способ 2. Чарактер-шит
Логичное развитие первого способа и то, что отличает любителя от человека, который делает это на потоке.
Чарактер-шит это набор изображений одного героя с разных сторон: анфас, профиль, три четверти, в полный рост, крупный план. Собирается один раз, дальше используется во всех сценах.
Зачем это надо. Один фронтальный референс отлично работает, пока герой смотрит в камеру. Как только он поворачивается боком, модели приходится додумывать профиль, которого она не видела, и она додумывает его каждый раз по-разному. Дайте ей профиль заранее, и додумывать будет нечего.
Как собрать чарактер-шит на практике:
- Сгенерируйте или возьмите одно хорошее фронтальное изображение героя.
- Прогоните его через модель редактирования (например, Nano Banana Pro), попросив показать того же человека в профиль, потом в три четверти, потом в полный рост. Модели редактирования как раз и умеют менять ракурс, сохраняя лицо.
- Отбракуйте кадры, где лицо изменилось. Это нормально, отбраковка будет.
- Сохраните итоговый набор. Это ваш герой, дальше вы только им и пользуетесь.
Способ 3. Last-frame chaining
Приём для длинных сцен, где герой должен непрерывно переходить из ролика в ролик.
Суть: вы генерируете первый отрезок, берёте последний кадр готового ролика и подаёте его стартовым кадром для следующего. Модель начинает новую сцену ровно с того места, где закончилась предыдущая, и тащит за собой не только лицо, но и одежду, свет, обстановку.
Плюс: склейка получается почти бесшовной, персонаж не может измениться, потому что модель отталкивается от реального кадра, а не от описания.
Минус: ошибки накапливаются. Если на пятом ролике у героя чуть поплыло лицо, шестой унаследует уже испорченную версию, седьмой ухудшит её ещё. Поэтому цепочку нельзя тянуть бесконечно: каждые несколько сцен возвращайтесь к исходному чарактер-шиту, чтобы сбросить накопленный дрейф.
Способ 4. Дисциплина промпта
Не заменяет референсы, но без этого они работают хуже.
Опишите персонажа один раз и дальше копируйте это описание дословно. Не «мужчина в куртке» в одной сцене и «парень в серой куртке» в другой. Любое изменение формулировки модель воспринимает как указание что-то поменять.
Не описывайте внешность заново, если дали референс. Это главная ошибка. Когда у модели есть и картинка, и подробное текстовое описание лица, они начинают конфликтовать, и модель ищет компромисс между ними. В итоге получается человек, похожий и на референс, и на описание, но не равный ни тому, ни другому. Если есть референс, в промпте описывайте действие и сцену, а не героя.
Разделяйте персонажа и контекст. «Тот же мужчина, теперь на кухне, наливает кофе, утренний свет из окна». Герой берётся из референса, остальное из текста.
Какой способ когда применять
| Способ | Что решает | Когда применять | Слабое место |
|---|---|---|---|
| Референс | Задаёт лицо вместо текста | Всегда, это база | Работает хуже на непривычных ракурсах |
| Чарактер-шит | Закрывает все ракурсы героя | Серия из 3 и более сцен | Нужно собрать один раз, это время |
| Last-frame chaining | Непрерывность между сценами | Длинные монтажные куски | Ошибки накапливаются от сцены к сцене |
| Дисциплина промпта | Убирает конфликт текста и картинки | Всегда, вместе с референсом | Сама по себе консистентности не даёт |
Правильный набор почти всегда такой: чарактер-шит как основа, референсы в каждой сцене, дисциплина промпта поверх и last-frame chaining только там, где нужен непрерывный переход.
Пошаговый воркфлоу для серии кадров
Как это выглядит на практике, если вам нужен ролик из восьми сцен с одним героем.
- Соберите героя. Сгенерируйте фронтальный портрет, доведите его до того состояния, когда он вам нравится. Не жалейте попыток тут: это лицо вы увидите ещё много раз.
- Соберите чарактер-шит. Через модель редактирования получите профиль, три четверти, полный рост. Отбракуйте неудачные.
- Отладьте промпт на дешёвой модели и в низком разрешении. Проверяете не картинку, а то, держит ли модель лицо. Разрешение для этого не нужно, а разница в цене пятикратная.
- Сгенерируйте сцены. В каждой подавайте референсы и описывайте только действие. Модель, которая принимает несколько образцов сразу, тут сильно выигрывает.
- Длинные куски тяните через last-frame chaining, но каждые три или четыре сцены возвращайтесь к чарактер-шиту, чтобы сбросить дрейф.
- Финал перегенерируйте в высоком разрешении уже отлаженными промптами.
Пять ошибок, из-за которых лицо всё равно плывёт
- Референс низкого качества. Мелкое лицо, шум, размытие. Модель считывает то, что видит, а видит она кашу.
- Описание внешности при наличии референса. Текст конфликтует с картинкой, модель ищет компромисс, получается третий человек.
- Запрос ракурса, которого нет в референсах. Просите вид сзади, не дав ни одного профиля? Модель придумает затылок сама, и каждый раз новый.
- Бесконечная цепочка last-frame. Ошибки копятся, к десятой сцене герой становится своим дальним родственником.
- Смена формулировок между сценами. Каждое переписывание описания это сигнал модели что-то изменить.
Что в итоге
Консистентность персонажа это не свойство модели и не следствие удачного промпта. Это процесс: сначала вы фиксируете героя в виде набора изображений, потом везде опираетесь на них, а текстом описываете только то, что герой делает.
Модели, которые заявляют стабильность персонажа между кадрами и принимают несколько референсов сразу, экономят на этом много времени. Но даже они не спасут, если вы каждый раз описываете лицо словами и надеетесь на совпадение.