Задачи с видео

Как сделать видео по текстовому описанию

Промпт для видео описывает не картинку, а движение. Из-за этого приёмы из генерации изображений здесь не работают.

Олег Красин··4 мин чтения

Коротко

Главная ошибка — писать для видео промпт как для картинки. В генерации изображений вы описываете кадр, в генерации видео — движение внутри него и движение камеры.

Как сделать видео по текстовому описанию

Чем промпт для видео отличается

В генерации изображений промпт описывает состояние: что в кадре, как выглядит, в каком стиле.

В генерации видео к этому добавляется изменение: что происходит за отведённые секунды и как в это время движется камера. Промпт без описания движения даёт почти статичный кадр с лёгким дрейфом — и это самая частая причина разочарования.

Структура рабочего промпта

Семь элементов, каждый решает свою задачу:

  1. Субъект — кто или что в кадре
  2. Действие — что он делает за эти секунды
  3. План — крупный, средний, общий
  4. Движение камеры — статика, наезд, отъезд, панорама, облёт
  5. Свет — источник, время суток, характер
  6. Настроение — задаёт цветокор и темп
  7. Длительность — под неё соразмеряется действие

Последний пункт недооценивают. За четыре секунды человек успевает повернуть голову, но не пройти по комнате. Действие, не помещающееся в отведённое время, модель либо ускорит до неестественного, либо оборвёт.

Что отрабатывается надёжно

Движение камеры. Наезд, отъезд, медленная панорама. Камере не нужна анатомия, поэтому здесь модели почти не ошибаются.

Природные процессы. Вода, дым, огонь, облака, листва.

Одно простое действие одного субъекта.

Что ломается

Несколько действующих лиц. Два человека, взаимодействующих в кадре, — почти гарантированный сбой.

Сложная последовательность. «Он входит, садится и открывает книгу» — три действия, модель смешает их в одно.

Текст в кадре. Кириллица разваливается особенно быстро.

Руки. В движении ошибки анатомии заметнее, чем на статичном кадре.

Про деньги

Видео тарифицируется посекундно, и неудачный дубль стоит столько же, сколько удачный. Отсюда рабочая стратегия: черновики на дешёвом уровне, финал на дорогом.

Облегчённый уровень Veo 3.1 стоит $0.03 за секунду против $0.40 на стандартном — разница более чем в тринадцать раз. Найдите работающий промпт там. Калькулятор считает по числу попыток, а не готовых роликов.

Симптом, причина, решение

Что видитеПочему такЧто делать
Кадр почти статиченВ промпте нет описания движенияУказать, что происходит за эти секунды и как движется камера
Действие оборвано на серединеОно не помещается в отведённую длительностьСократить действие или разбить на два фрагмента
Персонажи слились в кашуВ кадре несколько действующих лицОдно действие одного субъекта на фрагмент
Движение неестественно быстроеМодель ускорила действие, чтобы уложитьсяТо же: соразмерить действие и длительность
Кадр разъезжается к концуАртефакты накапливаются со временемДержаться коротких фрагментов, склеивать на монтаже

Развилка по задаче

Нужен фон или перебивка. Просите движение камеры, а не объектов: камере не нужна анатомия, и ошибок почти не бывает.

Нужно действие персонажа. Одно простое действие, короткий фрагмент, много дублей. Закладывайте пять попыток минимум.

Нужна сцена с диалогом. Это не задача для генерации по тексту: собирается из фрагментов и липсинка отдельно.

Полевая деталь

Промпт для видео пишется в настоящем времени и от третьего лица: «камера медленно приближается», а не «нужно, чтобы камера приблизилась». Модель обучалась на описаниях кадров, а не на технических заданиях, и первая формулировка отрабатывается заметно надёжнее.

Что не описывается текстом

Часть решений в видео не выражается промптом вообще — не потому, что модель слабая, а потому, что это решения монтажа, а не кадра.

Не описывается точный момент: «на третьей секунде он оборачивается» модель прочитает как «оборачивается», и оборот произойдёт когда придётся.

Не описывается смена плана внутри фрагмента. Одна генерация — один непрерывный кадр; склейка появляется на монтажном столе.

Не описывается ритм: чередование длинных и коротких кадров, пауза перед репликой, ускорение к финалу.

Не описывается связь между фрагментами: взгляд одного персонажа на другого, предмет, перешедший из кадра в кадр.

Отсюда рабочая схема: генерируются куски, а ролик собирается. Промпт отвечает за содержание кадра, монтаж — за то, что происходит между кадрами. Попытка уложить монтажную задачу в промпт даёт ту самую кашу, когда несколько действий смешиваются в одно.

Композиция описывается точнее, чем движение

Указания на построение кадра — план, ракурс, расположение субъекта, свет — отрабатываются заметно надёжнее указаний на движение. Причина механическая: композиция задаётся первым кадром, а это задача генерации изображения, где обучающих данных на порядки больше. Движение — предсказание последовательности, и расхождение с описанием накапливается от кадра к кадру.

Практический вывод: тратьте слова на то, что видно в первом кадре, а движение просите одно и простое. Приёмы из промпта на композицию и языка съёмки переносятся в видео почти без потерь — в отличие от описаний действия.

Управление длиной

Длина — не свойство промпта, а параметр модели, и потолок у моделей разный: восьмисекундный клип с расширением у Veo 3.1, до пятнадцати секунд у Seedance 2.0. Просьба «сделай короче» внутри промпта не меняет ничего.

Сокращать поэтому нужно действие, а не ролик, и лишнее обрезать на монтаже: обрезка дешевле ещё одного дубля ради точной длины. Расчёт бюджета считает оплаченные секунды, а не вошедшие в финальную сборку, и разница между ними обычно больше, чем закладывают.

Частые вопросы

Почему видео получается почти статичным?
Промпт описывает картинку, а не движение. Для видео нужно указать, что происходит за эти секунды и как движется камера.
Сколько действий можно уместить в один ролик?
Одно. Последовательность из нескольких действий модель смешает в одно неразборчивое движение.
Как сэкономить на генерации видео?
Отлаживать промпт на дешёвом уровне и снимать финальный дубль на дорогом. Разница в цене между уровнями бывает более чем тринадцатикратной.

Олег Красин псевдоним

Псевдоним автора технического раздела. Отвечает за локальный запуск моделей, требования к железу и за замеры, которые издание проводит само.

Отвечает за: локальный запуск, требования к железу, методика замеров