КАДР

Как сделать говорящего AI-аватара: инструкция, цены и подводные камни

Ален основатель КАДР Обновлено 2026-07-12 7 мин чтения

AI-аватар делается в два шага: сначала фиксируете внешность спикера картинкой (генерируете лицо в модели изображений или берёте фото реального человека), потом отдаёте её видеомодели с нативным звуком, которая синхронизирует губы с речью. Ролик на 6 секунд со звуком стоит от 76 до 664 рублей в зависимости от модели (данные КАДР, июль 2026). Главных подводных камня два, и оба практические: часть моделей просто откажется работать с фотографией реального человека, а русская артикуляция даётся им заметно хуже английской. Ниже разбираем, какие модели что позволяют и как обойти отказы законным путём.

Зачем бизнесу цифровой спикер

Задача обычно одна и та же: нужен человек в кадре, который что-то рассказывает, а снимать некого, некогда или не на что.

Онлайн-школе нужен преподаватель для уроков. Магазину нужен ведущий для обзора товара. Компании нужен спикер для внутренних инструкций, которых сто штук и переснимать их каждый раз при обновлении никто не будет. Во всех этих случаях синтетический спикер экономит не столько деньги, сколько время на пересъёмку: поменялся текст, перегенерировали ролик за десять минут.

Именно в этом реальная ценность, а не в «замене живых людей».

Шаг 1. Получить лицо

Два пути, и они принципиально разные.

Путь А: сгенерировать несуществующего человека

Вы генерируете лицо в модели для изображений. Самый предсказуемый вариант: такого человека не существует, поэтому фильтры модерации к нему не придираются и генерация не сорвётся на середине проекта.

Что важно на этом шаге:

  • Лицо крупно и в фокусе. Модель будет считывать с этого изображения черты. Мелкое лицо на входе означает кашу на выходе.
  • Нейтральный свет и нейтральное выражение. Резкие тени и широкая улыбка могут приклеиться к персонажу навсегда.
  • Соберите несколько ракурсов. Анфас, три четверти, профиль. Как только спикер повернёт голову, модели придётся додумывать то, чего она не видела.

Как собрать полный набор ракурсов, подробно описано в статье про консистентность персонажа. Цены смешные: изображение в Nano Banana Pro стоит около 22 рублей, в GPT-5 Image около 41 рубля, в Nano Banana 2 около 11 рублей. Набор из пяти ракурсов обойдётся примерно в сотню рублей. Не экономьте тут: ошибка на этом шаге испортит все последующие генерации.

Путь Б: взять фото реального человека

Работает лучше, потому что живое лицо всегда убедительнее сгенерированного. Здесь важно только одно: используйте лицо человека с его письменного согласия, иначе это уже не аватар, а дипфейк со всеми вытекающими.

Но есть и чисто техническая проблема, о которой почти никто не предупреждает заранее.

Модерация: часть моделей просто откажет

Вы загружаете фото сотрудника, пишете промпт, жмёте генерацию и получаете отказ. Не ошибку, а именно отказ: модель не хочет работать с этим запросом.

Так происходит потому, что разработчики моделей боятся дипфейков сильнее, чем вы боитесь потратить деньги. Поэтому они встраивают фильтры, которые срабатывают на реалистичные фотографии людей, особенно если в промпте есть речь. Модель не может проверить, есть ли у вас согласие, поэтому на всякий случай отказывает всем.

Проблема в том, что политики у разработчиков разные, и заранее это нигде не написано человеческим языком.

Показательный пример: у Seedance 2.0 в описании прямо сказано, что модель не подходит для фотографий реальных людей. Она отлично держит персонажа между кадрами, но именно на реальном лице вы упрётесь в фильтр. При этом та же самая задача может спокойно пройти в другой модели.

Что делать при отказе

Первое: не пытайтесь обмануть фильтр. Переформулировки в духе «это не настоящий человек, честно» не работают и могут привести к блокировке аккаунта. Смысла в этом ноль.

Второе: смените модель. Это самое простое решение и обычно оно же самое правильное. Если Seedance отказал на реальном лице, попробуйте Veo, Kling или Sora: у них другие политики. Именно поэтому доступ сразу к нескольким моделям в одном окне экономит не деньги, а нервы: не нужно заводить пять аккаунтов, чтобы выяснить, кто согласится.

Третье: смените исходник. Если задача не требует конкретного человека (а в большинстве бизнес-задач не требует), сгенерируйте несуществующее лицо. Отказов не будет вообще: у синтетического персонажа нет прав, которые можно нарушить, и фильтры к нему не придираются.

Четвёртое: уберите триггеры из промпта. Иногда отказ вызывает не фото, а формулировка. Слова про знаменитостей, политику, конкретные имена, а также просьбы «сказать от лица» кого-то повышают шанс срабатывания фильтра.

Практический вывод

Если аватар нужен на потоке и вам важна предсказуемость, стройте процесс на сгенерированном лице. Оно всегда доступно, никогда не откажет, не уволится и не потребует переснять всё заново. Реальное лицо оставьте для тех случаев, где узнаваемость человека действительно часть ценности.

Шаг 2. Оживить и заставить говорить

Теперь у вас есть лицо. Его надо оживить и синхронизировать с речью.

Для этого нужна модель с нативным звуком: она генерирует видео и аудио вместе, поэтому губы совпадают с речью. Это не то же самое, что наложить озвучку сверху на готовое видео: при наложении артикуляция не совпадёт, и это будет заметно с первой секунды.

Цены на КАДР, ролик 6 секунд, 1080p, звук включён, июль 2026:

Модель Цена, руб.
Google Veo 3.1 Lite 76
Google Veo 3.1 Fast 114
Kling v3.0 Standard 201
Kling v3.0 Pro 213
Google Veo 3.1 379
OpenAI Sora 2 Pro 664

Не является публичной офертой.

Обратите внимание: тут звук включён обязательно, и он удваивает цену. Подробнее про то, из чего складывается цена генерации, есть в статье сколько стоит минута AI-видео. Тот же ролик на Veo 3.1 без звука стоил бы 120 токенов вместо 240. Для аватара звук это смысл всей затеи, поэтому сэкономить на нём не получится. Зато можно сэкономить на разрешении: черновики гоняйте в 720p.

Проблема русской артикуляции

Здесь надо быть честным, потому что об этом почти не пишут.

Модели обучались преимущественно на английской речи. Английская артикуляция у них получается заметно лучше русской. На русском губы двигаются похоже, но не точно: попадают в ритм, но не всегда в конкретные звуки. Внимательный зритель это замечает, даже если не может сформулировать, что именно не так.

Практический вывод: прогоните тест до того, как заложите аватара в проект. Возьмите одну фразу из вашего реального текста, сгенерируйте её в двух до трёх моделях и посмотрите на губы. Это стоит несколько сотен рублей и экономит от разочарования на этапе, когда переделывать поздно.

Что помогает:

  • Короткие фразы. Чем длиннее реплика, тем больше шансов, что артикуляция поплывёт к концу.
  • Средний план вместо крупного. На крупном плане видно каждую неточность. На среднем мозг зрителя достраивает сам.
  • Спокойная речь. Быстрый темп и эмоциональные всплески модели даются хуже.

Как сделать длинное видео со спикером

Модели генерируют отрезки в несколько секунд, а урок или инструкция длятся минуты. Значит, видео собирается из кусков.

Схема:

  1. Разбейте текст на реплики по 8 до 15 секунд.
  2. Сгенерируйте каждую отдельно, подавая одно и то же изображение спикера как референс.
  3. Склейте в монтажной программе.
  4. Чтобы стыки не бросались в глаза, перебивайте их планами: слайд, скриншот, титр. Это стандартный монтажный приём, и он же скрывает мелкие расхождения во внешности между сценами.

Если спикер должен быть непрерывным, используйте приём с последним кадром: финальный кадр одной сцены подаётся стартовым кадром следующей. Но помните, что ошибки при этом накапливаются, и каждые несколько сцен надо возвращаться к исходному изображению.

Где аватар не работает

Честный список, чтобы вы не потратили деньги зря.

  • Там, где нужно доверие к конкретному человеку. Врач, юрист, эксперт. Синтетический спикер в такой роли, если его распознают, обнулит доверие целиком.
  • Там, где нужен реальный товар в руках. Аватар не подержит ваш продукт: модель нарисует похожий, но не ваш.
  • В длинных эмоциональных монологах. Чем дольше зритель смотрит на лицо, тем выше шанс, что он почувствует неладное.

Аватар хорош там, где он служебный: инструкции, объявления, короткие пояснения, повторяющийся контент, который часто обновляется.

Коротко

AI-аватар это два шага: зафиксировать лицо картинкой, оживить его моделью с нативным звуком. Лицо генерируется за копейки, видео со звуком стоит вдвое дороже обычного, а русская артикуляция требует проверки на тесте до начала работы.

И главный практический совет: если аватар нужен на потоке, стройте его на сгенерированном лице. Реальное фото упрётся в фильтры модерации там, где вы этого не ждёте, а синтетический спикер работает всегда.

Частые вопросы

Как сделать говорящего AI-аватара?
В два шага. Сначала получаете изображение спикера: либо генерируете лицо в модели для изображений, либо берёте фото реального человека с его согласия. Потом подаёте изображение в видеомодель с нативным звуком, которая оживит лицо и синхронизирует губы с речью.
Сколько стоит сгенерировать AI-аватара?
Ролик 6 секунд в 1080p со звуком стоит от 76 рублей на Veo 3.1 Lite до 664 рублей на Sora 2 Pro (данные КАДР, июль 2026). Учтите, что включённый звук удваивает цену: без него тот же ролик обошёлся бы вдвое дешевле. Для аватара звук нужен, поэтому экономить тут не выйдет.
Насколько хорошо нейросети говорят по-русски?
Заметно хуже, чем по-английски. Модели обучались преимущественно на английской речи, поэтому русская артикуляция часто выглядит приблизительной: губы двигаются похоже, но не точно. Проверяйте результат на коротком тесте, прежде чем закладывать аватара в большой проект.
Почему нейросеть отказывается генерировать видео с реальным человеком?
Срабатывает фильтр модерации: разработчики моделей блокируют реалистичные фото людей, чтобы их не использовали для дипфейков. Модель не может проверить, есть ли у вас согласие человека, поэтому отказывает на всякий случай. Например, у Seedance 2.0 прямо указано, что она не подходит для фотографий реальных людей.
Что делать, если модель отказала в генерации с фото человека?
Проще всего сменить модель: политики у разработчиков разные, и то, что заблокировал Seedance, может спокойно пройти в Veo, Kling или Sora. Второй вариант: использовать сгенерированное лицо вместо реального, тогда отказов не будет вообще. Обходить фильтр переформулировками не стоит, это не работает и рискует блокировкой аккаунта.
Можно ли сделать аватара из фото реального сотрудника?
Да, но только с его письменного согласия. Учтите, что часть моделей всё равно откажет в генерации из-за фильтров модерации, поэтому для потоковых задач надёжнее использовать сгенерированное лицо.

Сделайте спикера без съёмки

В КАДР можно сгенерировать лицо в Nano Banana Pro или GPT-5 Image, а затем оживить его в Veo 3.1, Kling или Sora 2 Pro с нативным звуком и липсинком. Всё в одном окне, цена генерации видна до запуска. Оплата рублями с российской карты.

Попробовать
Ален
Основатель КАДР. 5 лет в автоматизации, больше 50 проектов. Подключал модели генерации напрямую через API, поэтому цены в статье это не пересказ чужих обзоров.