Как сделать видео из фото с музыкой: план из трёх шагов

Видео из фото с музыкой собирается в три шага: сначала нейросеть превращает снимки в видеоклипы, затем добавляется закадровый голос, а музыкальный трек накладывается при монтаже. Сразу честно: нейросети на нашей платформе генерируют видео, звук сцены и озвучку, но не сочиняют музыку — трек вы берёте из легальной библиотеки или используете собственный.

Такой конвейер закрывает типовые задачи: слайдшоу на юбилей, ролик о товаре для соцсетей, видеопоздравление из семейных снимков. Разберём каждый шаг с ценами.

Шаг 1. Превращаем фото в видео со звуком сцены

Загрузите фото на странице генерации видео, выберите модель Kling 2.6 и опишите движение: «пара медленно кружится в танце, тёплый вечерний свет, камера плавно отъезжает». Через пару минут получите 5-секундный клип.

Важная деталь про звук: в Kling 2.6 звук включён по умолчанию и удваивает цену — вместо 50 ₽ за 5 секунд вы заплатите 100 ₽. Модель генерирует звук сцены: шаги, шум улицы, фоновую атмосферу. Решите заранее:

  • ролик пойдёт под музыку целиком — отключите звук и сэкономьте половину бюджета;
  • нужна живая атмосфера (звуки природы, город) — оставьте звук, а музыку при монтаже сделайте тише.

Сгенерируйте клип для каждой фотографии — 4-6 сцен по 5 секунд дают полноценный ролик на полминуты.

Шаг 2. Добавляем закадровый голос

Если ролику нужен текст — поздравление, история семьи, описание товара — озвучьте его нейросетью. На странице озвучки текста вставляете текст, выбираете голос и получаете аудиофайл. Цены: ElevenLabs Turbo v2.5 — 6 ₽ за 1000 знаков, ElevenLabs Multilingual v2 — 12 ₽ за 1000 знаков (у него естественнее интонации на русском).

Практический ориентир: 30-секундный закадровый текст — это примерно 400-500 знаков, то есть озвучка обойдётся в 3-6 ₽. Напишите текст заранее и прочитайте вслух с таймером, чтобы голос не пришлось ускорять при монтаже.

Шаг 3. Музыка: где взять трек легально

Генерации музыки на платформе нет, и это стоит учитывать при планировании. Рабочие варианты:

  1. Бесплатные библиотеки без авторских отчислений — например, фонотеки самих соцсетей: у VK и YouTube есть встроенные каталоги треков, разрешённых для роликов.
  2. Стоковые библиотеки по подписке — если ролик коммерческий.
  3. Собственная запись — для личных проектов подойдёт любой трек, которым вы владеете.

Свести всё вместе можно в любом бесплатном видеоредакторе: CapCut, «Клипы VK», iMovie. Порядок дорожек: видео → голос → музыка (на 20-30% тише голоса).

Бюджет ролика на 30 секунд

СоставляющаяРасчётСтоимость
6 клипов по 5 сек, Kling 2.6 без звука6 × 50 ₽300 ₽
Те же клипы со звуком сцены6 × 100 ₽600 ₽
Озвучка ~500 знаковElevenLabs Turbo v2.53 ₽
Музыка из бесплатной библиотеки0 ₽

Итого ролик со звуком и голосом — от 303 ₽. Попробовать конвейер можно на ГПТ Россия: новичку начисляется 50 ₽ приветственного бонуса, которого хватает на первый клип в Kling 2.6 без звука. Оплата российской картой в рублях, VPN не нужен.

Частые вопросы

Может ли нейросеть сама написать музыку для ролика?

На платформе генерации музыки нет — доступны генерация видео, звука сцены и озвучка голосом. Музыкальный трек добавляется при монтаже из легальной библиотеки или из ваших собственных записей.

Что значит «звук удваивает цену» в Kling 2.6?

Kling 2.6 умеет генерировать звук сцены вместе с видео, и эта опция включена по умолчанию: клип со звуком стоит 100 ₽ за 5 секунд вместо 50 ₽. Если ролик целиком пойдёт под музыку, звук лучше отключить.

Можно ли озвучить текст разными голосами?

Да, при генерации озвучки выбирается голос из списка — можно сделать несколько дорожек разными голосами и развести их по сценам при монтаже.

В каком формате лучше собирать ролик для соцсетей?

Для Reels, Shorts и «Клипов VK» — вертикальный 9:16; ориентацию задавайте ещё на этапе генерации видео, а не обрезкой готового горизонтального кадра.