Что такое видео по тексту и почему результат бывает плохим

Видео по тексту (text-to-video) — это генерация ролика по словесному описанию: пишете «серфер ловит волну на закате, камера летит рядом», и через пару минут получаете клип. Качество результата на 80% определяется промптом: модель не читает мысли, и расплывчатое «красивое видео про море» даст случайную картинку, а структурное описание — предсказуемую сцену.

Подробное определение технологии и её режимов есть в глоссарии text-to-video; здесь — практика: как писать промпт, что чинить, когда «не получилось», и какую модель выбрать.

Формула промпта: сцена — движение — камера

Рабочий промпт для видео по тексту состоит из трёх обязательных блоков и одного дополнительного:

  1. Сцена — кто и где: «пожилой рыбак в жёлтом дождевике на носу лодки, штормовое море».
  2. Движение — что происходит: «лодка тяжело поднимается на волне, брызги летят в кадр».
  3. Камера — как снято: «камера медленно облетает лодку слева направо».
  4. Стиль (по желанию): «кинематографичная картинка, сумеречный свет, плёночное зерно».

Собранный промпт: «Пожилой рыбак в жёлтом дождевике на носу лодки, штормовое море. Лодка тяжело поднимается на волне, брызги летят в кадр. Камера медленно облетает лодку слева направо. Кинематографичная картинка, сумеречный свет».

Ключевые принципы: одно основное действие на клип (два сюжетных события модель почти всегда смешает в кашу), конкретные глаголы вместо оценок («волосы развеваются на ветру» вместо «красиво»), явное указание камеры — иначе модель выберет ракурс сама.

Типовые фейлы и как их чинить

ПроблемаПричинаКак исправить
Хаотичное движение, «каша»Несколько действий в одном промптеОставить одно действие, остальное — в следующие клипы
Камера дёргаетсяДвижение камеры не заданоДобавить «камера статична» или конкретный приём
Лишние объекты в кадреМодель «додумала» сценуПеречислить состав кадра явно: «в кадре только...»
Текст и надписи с ошибкамиСлабое место всех видеомоделейНе просить надписи, накладывать при монтаже
Персонаж меняется между клипамиt2v не держит идентичностьПовторять дословное описание героя в каждом промпте
Слишком быстрое/медленное действиеТемп не указанДобавить «медленно», «плавно», «стремительно»

Правьте промпт точечно: меняйте один блок за итерацию, иначе не поймёте, что именно сработало.

Какую модель выбрать под видео по тексту

МодельЦенаСильная сторона
Grok Imagine30 ₽ за клип ~10 секДешёвые тесты промпта
Kling 2.650 ₽ за 5 сек (звук ×2)Люди, мимика, пластика
Seedance 220 ₽ за секундуДинамика, гибкая длительность
Veo 3.160 ₽ за 8 сек (Fast)Точное следование промпту, камера

Если важно, чтобы модель выполнила описание максимально буквально, берите Veo 3.1 — она лучше остальных понимает сложные промпты с камерой и атмосферой; за 1080p доплата 10 ₽, есть вариант Quality за 250 ₽ для финальных версий.

Итерации без лишних трат

Схема, которая экономит сотни рублей: черновик → правка → финал. Отработайте промпт на дешёвой модели (Grok Imagine, 30 ₽), добейтесь нужной композиции и движения за 2-3 итерации, и только затем запустите выверенный промпт на флагмане. Все модели доступны в одном окне на странице генерации видео — переключение занимает секунду, промпт сохраняется.

Деньги списываются перед генерацией и автоматически возвращаются при ошибке, так что неудачный запуск по техническим причинам бюджет не съест. Начать можно с приветственного бонуса 50 ₽ на ГПТ Россия — хватит на первые тесты промпта; оплата в рублях российской картой, без VPN.

Частые вопросы

Почему видео по тексту получается не таким, как я описал?

Чаще всего промпт либо перегружен (несколько действий сразу), либо недоопределён (нет камеры и состава кадра). Пройдитесь по формуле «сцена — движение — камера» и правьте по одному блоку за итерацию.

На каком языке писать промпт?

Пишите на русском — модели на платформе понимают русские промпты. Главное — структура и конкретика, а не язык.

Сколько стоит подобрать промпт до хорошего результата?

При схеме «черновики на Grok Imagine, финал на Veo 3.1» типичная сцена обходится в 90-150 ₽: 2-3 теста по 30 ₽ плюс один финальный запуск за 60 ₽.

Можно ли сделать по тексту видео с конкретным человеком?

Точное лицо по одному описанию модель не воспроизведёт. Для этого используйте режим «изображение в видео»: загрузите фото человека как первый кадр и опишите движение текстом.