Как сделать видео из фото с музыкой: план из трёх шагов
Видео из фото с музыкой собирается в три шага: сначала нейросеть превращает снимки в видеоклипы, затем добавляется закадровый голос, а музыкальный трек накладывается при монтаже. Сразу честно: нейросети на нашей платформе генерируют видео, звук сцены и озвучку, но не сочиняют музыку — трек вы берёте из легальной библиотеки или используете собственный.
Такой конвейер закрывает типовые задачи: слайдшоу на юбилей, ролик о товаре для соцсетей, видеопоздравление из семейных снимков. Разберём каждый шаг с ценами.
Шаг 1. Превращаем фото в видео со звуком сцены
Загрузите фото на странице генерации видео, выберите модель Kling 2.6 и опишите движение: «пара медленно кружится в танце, тёплый вечерний свет, камера плавно отъезжает». Через пару минут получите 5-секундный клип.
Важная деталь про звук: в Kling 2.6 звук включён по умолчанию и удваивает цену — вместо 50 ₽ за 5 секунд вы заплатите 100 ₽. Модель генерирует звук сцены: шаги, шум улицы, фоновую атмосферу. Решите заранее:
- ролик пойдёт под музыку целиком — отключите звук и сэкономьте половину бюджета;
- нужна живая атмосфера (звуки природы, город) — оставьте звук, а музыку при монтаже сделайте тише.
Сгенерируйте клип для каждой фотографии — 4-6 сцен по 5 секунд дают полноценный ролик на полминуты.
Шаг 2. Добавляем закадровый голос
Если ролику нужен текст — поздравление, история семьи, описание товара — озвучьте его нейросетью. На странице озвучки текста вставляете текст, выбираете голос и получаете аудиофайл. Цены: ElevenLabs Turbo v2.5 — 6 ₽ за 1000 знаков, ElevenLabs Multilingual v2 — 12 ₽ за 1000 знаков (у него естественнее интонации на русском).
Практический ориентир: 30-секундный закадровый текст — это примерно 400-500 знаков, то есть озвучка обойдётся в 3-6 ₽. Напишите текст заранее и прочитайте вслух с таймером, чтобы голос не пришлось ускорять при монтаже.
Шаг 3. Музыка: где взять трек легально
Генерации музыки на платформе нет, и это стоит учитывать при планировании. Рабочие варианты:
- Бесплатные библиотеки без авторских отчислений — например, фонотеки самих соцсетей: у VK и YouTube есть встроенные каталоги треков, разрешённых для роликов.
- Стоковые библиотеки по подписке — если ролик коммерческий.
- Собственная запись — для личных проектов подойдёт любой трек, которым вы владеете.
Свести всё вместе можно в любом бесплатном видеоредакторе: CapCut, «Клипы VK», iMovie. Порядок дорожек: видео → голос → музыка (на 20-30% тише голоса).
Бюджет ролика на 30 секунд
| Составляющая | Расчёт | Стоимость |
|---|---|---|
| 6 клипов по 5 сек, Kling 2.6 без звука | 6 × 50 ₽ | 300 ₽ |
| Те же клипы со звуком сцены | 6 × 100 ₽ | 600 ₽ |
| Озвучка ~500 знаков | ElevenLabs Turbo v2.5 | 3 ₽ |
| Музыка из бесплатной библиотеки | — | 0 ₽ |
Итого ролик со звуком и голосом — от 303 ₽. Попробовать конвейер можно на ГПТ Россия: новичку начисляется 50 ₽ приветственного бонуса, которого хватает на первый клип в Kling 2.6 без звука. Оплата российской картой в рублях, VPN не нужен.
Частые вопросы
Может ли нейросеть сама написать музыку для ролика?
На платформе генерации музыки нет — доступны генерация видео, звука сцены и озвучка голосом. Музыкальный трек добавляется при монтаже из легальной библиотеки или из ваших собственных записей.
Что значит «звук удваивает цену» в Kling 2.6?
Kling 2.6 умеет генерировать звук сцены вместе с видео, и эта опция включена по умолчанию: клип со звуком стоит 100 ₽ за 5 секунд вместо 50 ₽. Если ролик целиком пойдёт под музыку, звук лучше отключить.
Можно ли озвучить текст разными голосами?
Да, при генерации озвучки выбирается голос из списка — можно сделать несколько дорожек разными голосами и развести их по сценам при монтаже.
В каком формате лучше собирать ролик для соцсетей?
Для Reels, Shorts и «Клипов VK» — вертикальный 9:16; ориентацию задавайте ещё на этапе генерации видео, а не обрезкой готового горизонтального кадра.



