IskraGen

Как оживить фото со звуком: говорящий портрет с русской речью

Видео8 сентября 20269 мин чтения
Портретная фотография в рамке на тёмном фоне, из которой вправо расходятся фиолетовые звуковые волны — метафора говорящего портрета
Сгенерировано в IskraGen · gpt-image-2-text-to-image
Промпт

Сцена: тёмная студийная сцена, глубокий почти чёрный фон #0A0A0F, мягкая фиолетовая подсветка #7C3AFF слева. Главный объект: одиночная портретная фотография в тонкой металлической рамке, стоящая вертикально; от края снимка вправо расходятся объёмные фиолетовые звуковые волны — концентрические дуги и тонкие эквалайзерные полосы, будто портрет заговорил. Детали: матовая фотобумага с фактурой и лёгким зерном, силуэт человека на снимке размыт и не читается как конкретное лицо, тонкая пыль в луче света, мягкая дымка. Композиция: 16:9, рамка в левой трети, звуковые волны уходят в широкое негативное пространство справа, ракурс на уровне глаз, мягкий контрастный свет, неглубокая глубина резкости. Ограничения: absolutely NO text, NO letters, NO numbers, NO logos, NO watermarks; лицо не показывать крупно и не делать узнаваемым. Назначение: обложка статьи блога о том, как оживить фото со звуком и получить говорящий портрет. Стиль: тёмный фон #0A0A0F, акцентный фиолетовый #7C3AFF, крупный рубленый шрифт, без водяных знаков и чужих логотипов.

Главное:

  • Оживить фото со звуком проще всего через image-to-video: модель сама озвучивает реплику, написанную в промпте.
  • Описание сцены пишут по-английски, реплику — по-русски в кавычках, плюс «говорит по-русски» и «без субтитров».
  • Липсинка под свой аудиофайл в каталоге IskraGen нет: речь берётся только из текста промпта.
  • Кадр решает больше промпта: крупный фронтальный план, 2–3 слова в секунду, эмоция заданная словами.
  • Запуск Veo 3.1 стоит от 360 ₽, оплата в рублях; на удачный дубль обычно уходит две-три попытки.

Оживить фото со звуком — значит получить из статичного снимка короткое видео, где человек в кадре произносит вашу фразу по-русски. Технически это одна кнопка: снимок уходит в видеомодель с нативным звуком, реплика идёт текстом в промпте, на выходе клип с голосом и движением губ. Практически же результат зависит от трёх вещей — какой кадр вы загрузили, как написали промпт и что именно просите сказать. Ниже разбор всех трёх по опыту авторов русскоязычных и англоязычных руководств.

Оживить фото со звуком: три разные задачи, а не одна

Просьба «оживить фото со звуком» скрывает три разные задачи, и решают их разные инструменты: речь из промпта, липсинк под собственный аудиофайл и озвучка уже готового видео.

Речь из промпта. Вы загружаете фотографию, пишете реплику текстом, модель синтезирует голос и сама двигает губы. Звук рождается вместе с картинкой в одном проходе — по описанию Veo 3.1, модель генерирует не немое кино, а сцену со звуком, где реплики совпадают с движением губ, а фоновый шум соответствует происходящему в кадре. Это единственный путь, который целиком закрывается моделями каталога IskraGen.

Липсинк под своё аудио. Здесь вы приносите готовую запись — свой голос, песню, дикторскую озвучку — и просите модель попасть губами в неё. В каталоге IskraGen такого режима нет: ни одна видеомодель не принимает аудиофайл на вход, речь берётся только из текста. Обещать обратное было бы нечестно. У внешних моделей режим есть, но с жёсткими рамками: у Seedance каждый аудиофрагмент длится 2–15 секунд, фрагментов не больше трёх, суммарно не больше 15 секунд, а сам файл не обязателен — реплику всё равно несёт текст промпта.

Пост-липсинк готового видео. Третий сценарий — взять уже снятый или сгенерированный ролик и переозвучить его. Этим занимаются отдельные сервисы вроде HeyGen, Hedra, Dreamina и функции Lip Sync в Kling. Русская речь им даётся: в краш-тесте восьми таких сервисов на русской песне ни один не отказался работать с кириллической фонетикой, претензии авторов были к артикуляции и качеству картинки. Общая беда другая — при нескольких лицах в кадре оживают все сразу: в одном тесте лис за спиной старца начал повторять его реплики. Обход простой и трудоёмкий: героев генерируют по отдельности и накладывают друг на друга через удаление фона.

Для говорящего портрета из одной фотографии почти всегда нужна первая задача: оживить фото со звуком выходит именно через речь из промпта. Если вы просто хотите движение без речи, задача проще и дешевле — про неё отдельный разбор о том, как оживить фото нейросетью.

Почему персонаж отвечает по-английски и как это чинить

Персонаж отвечает по-английски, потому что модель определяет язык речи по языку описания сцены, а не по кириллице внутри кавычек. Английский стоит по умолчанию, и молчаливое согласие с ним — самая частая причина испорченного дубля.

Авторы формулируют правило почти одинаково. «Обязательно прописывайте то, что персонажи должны говорить на русском языке. Если вы напишете просто на русском кириллицей, то не всегда это будет работать», — говорит один. «Пожалуйста, пишите язык», — предупреждает другая, которой пришлось глушить по звуку кадры, где героиня заговорила по-английски. Третий добавляет в промпт строку «все разговоры должны быть на русском». Руководство по Veo 3.1 формулирует то же самое короче: язык указывайте явно, иначе липсинк пойдёт по-английски.

Вторая ловушка — переводчик. Если вы просите языковую модель перевести промпт на английский, она честно переведёт и диалоги тоже. Спасает оговорка «сохрани речь на русском» прямо в запросе. Авторы коммерческих роликов идут дальше и держат две версии промпта: английская уходит в видеомодель, русская остаётся у автора для самоконтроля.

Третья ловушка — субтитры. Модель иногда решает, что раз есть речь, нужны и подписи, и вшивает их прямо в кадр. Лечится строкой «без субтитров» в промпте, а если титры всё же появились — перегенерацией или подрезкой.

Рабочая схема промпта складывается из пяти блоков:

  1. Описание сцены и кадра — по-английски.
  2. Кто говорит: один человек в кадре, крупный план лица.
  3. Сама реплика — по-русски, кириллицей, в кавычках.
  4. Явное указание языка и подачи: говорит по-русски, натуральная русская речь.
  5. Ограничения: без субтитров, без текста в кадре.

Из правила есть исключение. Автор, работавший с MiniMax H3, написал промпт целиком по-русски и получил чистую речь без коверканья. В Google Flow русскими были вообще все промпты, включая диалоги. То есть английское описание — не догма, а страховка: оно надёжнее срабатывает у большинства моделей, но проверить свою модель на русском промпте стоит.

Инфографика: пять блоков промпта для говорящего портрета — английское описание сцены, кто говорит, русская реплика в кавычках, указание языка, запрет субтитров

Пять блоков промпта: описание по-английски, реплика по-русски, явный язык и запрет субтитров.

Какие модели говорят по-русски: Veo 3.1, Kling O3, MiniMax H3

Оживить фото со звуком на русском умеют не все модели с нативным звуком, и разница между ними больше, чем разница в цене.

Veo 3.1 — та модель, которую русскоязычные авторы хвалят именно за речь. «Veo 3 очень классно работает с речевым звуком, поэтому если у вас есть такая задача, то вам её, скорее всего, надо будет делать только там», — итог автора коммерческого кейса. Ролик — до восьми секунд за генерацию, звук синтезируется вместе с картинкой, режим «картинка → видео» позволяет отправить свой снимок. В каталоге запуск Veo 3.1 стоит от 360 ₽, оплата в рублях.

Kling O3 — Картинка в видео даёт звук в кадре и умеет привязывать реплику к конкретному персонажу, что ценно, когда в кадре несколько героев. С русским хуже: в перечне языков озвучки значатся китайский, английский, японский, корейский и испанский, а русского в этом списке нет. Модель стоит от 190 ₽ и хороша для движения, атмосферы и звукового окружения, но говорящий портрет с русской репликой лучше отдать другой.

MiniMax H3 — Картинка в видео — кандидат на проверку. Автор, показавший генерацию целиком, писал промпт по-русски и оценил результат словами «речь полностью вся правильная, русский язык он не коверкал». Руководство по промптам для этой модели требует давать точный текст реплики в формате «персонаж говорит: „…“» и соотносить длину фразы с длиной кадра: трёхсекундный кадр длинную реплику не вместит. В каталоге модель стоит от 150 ₽.

Seedance 2 к русской речи относится хуже. Официального списка языков озвучки у Seedance нет, демонстрации показывают восемь языков без русского, а разборы прямо предупреждают: осмысленной русской речи с точной синхронизацией губ ожидать не стоит. Русские авторы говорят о том же жёстче — модель коверкает слова, и это выливается в лишние перегенерации.

Как оживить фото со звуком: кадр, темп речи и эмоция

Оживить фото со звуком удаётся не тому, кто написал длинный промпт, а тому, кто дал модели удобный кадр и посильную реплику. Три параметра решают почти всё.

Кадр. Самый надёжный исходник — крупный фронтальный план лица с хорошо видимыми губами. Если лиц несколько, модель сама выбирает, кого озвучить, и выбрать вручную нельзя. Персонаж на снимке должен быть виден целиком, а не наполовину: недостающее модель дорисует по своему вкусу, и лицо поплывёт. Резкое движение головой, отвороты и полутьма ухудшают артикуляцию — три классические причины «плавящегося» лица звучат так: слишком много движения, слишком быстрая речь и недостаточно чёткое лицо.

Если подходящей фотографии нет, кадр проще сгенерировать: GPT Image 2 — Text to Image стоит от 5 ₽ за картинку, и портрет анфас на однотонном фоне обходится дешевле неудачного видеодубля.

Темп. Не больше 2–3 слов в секунду. На восемь секунд это 16–24 слова — примерно одна короткая мысль. Попытка уместить больше кончается кашей; автор, разбиравший неудачный дубль, поставил диагноз прямо: «мы слишком много хотим за эти 8 секунд». Реплику полезно прочитать вслух с секундомером до того, как запускать генерацию.

Эмоция. Подачу задают словами, иначе синтезированный голос звучит плоско. Достаточно короткого описания состояния: говорит тихо и устало, улыбается в конце фразы, повышает голос на последнем слове. Ровно то же касается движения: чтобы оживить фото со звуком без искажений, просят микродвижение, а не жестикуляцию, потому что каждое лишнее движение отнимает точность у губ.

Инфографика: правила кадра, темпа речи и эмоции для говорящего портрета — крупный фронтальный план, одно лицо, 2–3 слова в секунду, эмоция словами

Кадр, темп и эмоция решают больше, чем длина промпта.

Ударения, произношение и акцент: тонкая настройка речи

Ударение в конкретном слове видеомодели не задаётся — управлять произношением приходится обходными приёмами, и они одинаковы для речи в кадре и для закадровой озвучки.

Первый приём — синоним. Если слово стабильно выговаривается неправильно, проще заменить его другим, чем бороться за ударение; авторы прямо называют знаки ударения болью и решают вопрос переписыванием фразы. Второй приём — пунктуация как режиссура: точки, запятые и тире ставят не по правилам, а там, где нужна пауза или подъём интонации. Третий — переписать фразу так, чтобы проблемное слово не стояло в конце: последнее слово чаще всего смазывается.

Акцент и манеру речи описывают формулой из пяти полей: регион, темп, энергия, эмоциональное состояние и точная реплика. В оригинале это выглядит как «говорит с неторопливым кингстонским акцентом, естественно, без утрирования, не комедийным голосом» — по-русски работает так же: «говорит спокойно, с лёгким южным говором, без утрирования».

Если речь нужна закадром, а не из губ персонажа, задача решается дешевле. Отдельная озвучка текста стоит от 6 ₽ у модели Gemini 3.1 Flash TTS, и там же настраиваются голос, темп и стиль; подробности — в разборе про нейросети для озвучки текста. Готовую дорожку затем сводят с немым видео на монтаже.

Пять промптов с русскими репликами и частые ошибки

Оживить фото со звуком быстрее с готовым промптом: ниже пять шаблонов под восьмисекундный клип, в каждом описание по-английски, реплика по-русски и явное указание языка.

Портрет-приветствие:

text
Close-up portrait of a woman in her thirties, warm studio light, plain dark background, subtle head movement, static camera. She speaks in Russian, natural conversational Russian voice, calm and friendly: «Привет! Я наконец собралась и записала это видео». No subtitles, no on-screen text.

Поздравление:

text
Medium close-up of an elderly man in a knitted cardigan at a kitchen table, soft window light. He smiles and speaks in Russian, warm unhurried voice: «С днём рождения, дорогая! Мы тебя очень ждём». Slight head nod, no gestures. No subtitles, no captions.

Эксперт в кадре:

text
Close-up of a young man in a dark shirt against a plain grey wall, even soft light, static camera. He speaks in Russian, confident and unhurried, slight pause before the last phrase: «Смотрите на цифру, а не на обещание». No subtitles, no text overlays.

Ребёнок и питомец:

text
Close-up of a child holding a small cat, daylight, shallow depth of field. The child speaks in Russian, light and playful voice: «Мы его нашли во дворе, и он остался». Minimal motion, static camera. No subtitles.

Диалог на двоих:

text
Two people at a cafe table, medium shot, both faces clearly visible, static camera. The woman speaks in Russian first: «Ты правда это сделал?». The man answers in Russian, quietly: «Не хотел. Так получилось». Natural Russian voices, no subtitles, no on-screen text.

Ошибки повторяются от новичка к новичку. Реплика длиннее кадра — самая частая: 30 слов на 8 секунд не помещаются никогда. Отсутствие указания языка — вторая, и её последствия слышны сразу. Несколько лиц в кадре без указания, кто говорит: модель может перепутать героев и отдать реплику соседу, лечится это только перегенерацией. Слишком активная сцена — бег, поворот, жестикуляция — отбирает у модели ресурс на губы. И последняя ошибка бухгалтерская: рассчитывать на один дубль. Авторы говорят о двух-трёх попытках на удачный клип, поэтому бюджет считают сразу на несколько запусков.

Оживить фото со звуком реально с первого вечера, если не ждать от одной генерации целого монолога. Короткая фраза, крупный кадр, явный русский язык в промпте — и дальше уже вопрос вкуса и числа дублей. А если нужен не говорящий портрет, а музыкальный ролик, посмотрите разбор о том, как собирают видео из фото с музыкой.

Частые вопросы

Попробовать Veo 3.1 в IskraGen

Генерация без VPN, оплата в рублях через СБП. Первые генерации — за минуту.

Похожие статьи