Что такое видео по тексту и почему результат бывает плохим
Видео по тексту (text-to-video) — это генерация ролика по словесному описанию: пишете «серфер ловит волну на закате, камера летит рядом», и через пару минут получаете клип. Качество результата на 80% определяется промптом: модель не читает мысли, и расплывчатое «красивое видео про море» даст случайную картинку, а структурное описание — предсказуемую сцену.
Подробное определение технологии и её режимов есть в глоссарии text-to-video; здесь — практика: как писать промпт, что чинить, когда «не получилось», и какую модель выбрать.
Формула промпта: сцена — движение — камера
Рабочий промпт для видео по тексту состоит из трёх обязательных блоков и одного дополнительного:
- Сцена — кто и где: «пожилой рыбак в жёлтом дождевике на носу лодки, штормовое море».
- Движение — что происходит: «лодка тяжело поднимается на волне, брызги летят в кадр».
- Камера — как снято: «камера медленно облетает лодку слева направо».
- Стиль (по желанию): «кинематографичная картинка, сумеречный свет, плёночное зерно».
Собранный промпт: «Пожилой рыбак в жёлтом дождевике на носу лодки, штормовое море. Лодка тяжело поднимается на волне, брызги летят в кадр. Камера медленно облетает лодку слева направо. Кинематографичная картинка, сумеречный свет».
Ключевые принципы: одно основное действие на клип (два сюжетных события модель почти всегда смешает в кашу), конкретные глаголы вместо оценок («волосы развеваются на ветру» вместо «красиво»), явное указание камеры — иначе модель выберет ракурс сама.
Типовые фейлы и как их чинить
| Проблема | Причина | Как исправить |
|---|---|---|
| Хаотичное движение, «каша» | Несколько действий в одном промпте | Оставить одно действие, остальное — в следующие клипы |
| Камера дёргается | Движение камеры не задано | Добавить «камера статична» или конкретный приём |
| Лишние объекты в кадре | Модель «додумала» сцену | Перечислить состав кадра явно: «в кадре только...» |
| Текст и надписи с ошибками | Слабое место всех видеомоделей | Не просить надписи, накладывать при монтаже |
| Персонаж меняется между клипами | t2v не держит идентичность | Повторять дословное описание героя в каждом промпте |
| Слишком быстрое/медленное действие | Темп не указан | Добавить «медленно», «плавно», «стремительно» |
Правьте промпт точечно: меняйте один блок за итерацию, иначе не поймёте, что именно сработало.
Какую модель выбрать под видео по тексту
| Модель | Цена | Сильная сторона |
|---|---|---|
| Grok Imagine | 30 ₽ за клип ~10 сек | Дешёвые тесты промпта |
| Kling 2.6 | 50 ₽ за 5 сек (звук ×2) | Люди, мимика, пластика |
| Seedance 2 | 20 ₽ за секунду | Динамика, гибкая длительность |
| Veo 3.1 | 60 ₽ за 8 сек (Fast) | Точное следование промпту, камера |
Если важно, чтобы модель выполнила описание максимально буквально, берите Veo 3.1 — она лучше остальных понимает сложные промпты с камерой и атмосферой; за 1080p доплата 10 ₽, есть вариант Quality за 250 ₽ для финальных версий.
Итерации без лишних трат
Схема, которая экономит сотни рублей: черновик → правка → финал. Отработайте промпт на дешёвой модели (Grok Imagine, 30 ₽), добейтесь нужной композиции и движения за 2-3 итерации, и только затем запустите выверенный промпт на флагмане. Все модели доступны в одном окне на странице генерации видео — переключение занимает секунду, промпт сохраняется.
Деньги списываются перед генерацией и автоматически возвращаются при ошибке, так что неудачный запуск по техническим причинам бюджет не съест. Начать можно с приветственного бонуса 50 ₽ на ГПТ Россия — хватит на первые тесты промпта; оплата в рублях российской картой, без VPN.
Частые вопросы
Почему видео по тексту получается не таким, как я описал?
Чаще всего промпт либо перегружен (несколько действий сразу), либо недоопределён (нет камеры и состава кадра). Пройдитесь по формуле «сцена — движение — камера» и правьте по одному блоку за итерацию.
На каком языке писать промпт?
Пишите на русском — модели на платформе понимают русские промпты. Главное — структура и конкретика, а не язык.
Сколько стоит подобрать промпт до хорошего результата?
При схеме «черновики на Grok Imagine, финал на Veo 3.1» типичная сцена обходится в 90-150 ₽: 2-3 теста по 30 ₽ плюс один финальный запуск за 60 ₽.
Можно ли сделать по тексту видео с конкретным человеком?
Точное лицо по одному описанию модель не воспроизведёт. Для этого используйте режим «изображение в видео»: загрузите фото человека как первый кадр и опишите движение текстом.



