Будущее видеогенерации: разделение на профессиональные и упрощённые инструменты.
Рассмотрим видеогенерацию. На выходе получается видео. Что с ним делать, более-менее понятно: композитинг, монтаж, цветокоррекция. Это инструменты и методы, отточенные годами.
Инструменты для онлайн-монтажа рядом с генерацией, которые сейчас разрабатываются, не являются необходимыми. Монтаж будет происходить в профессиональных средах, таких как CapCut, Premiere Pro или DaVinci Resolve, потому что там удобно. В веб-интерфейсе этого удобства нет. Максимум, что может потребоваться, это таймлайн (хотя в Uпопай это не так), где можно указать, что нужно перегенерировать или какие кадры взять за основу для другой генерации. Редактировать же мы будем во внешних программах.
А что на входе?
Условно говоря, до появления нейросетей мы создавали видео двумя основными способами: продакшен и пост-продакшен, или, проще говоря, съёмка и графика.
Съёмка — это сложный хаотический процесс со своим, годами выстроенным пайплайном, терминологией, людьми, коммуникациями и специфическими процедурами.
3D и 2D анимация (в кино, motion design, рекламе) — это также сложнейший процесс со своим, годами выстроенным пайплайном, терминологией, людьми, коммуникациями и множеством специфических процедур.
На выходе получается видео (здесь есть некоторое упрощение, но основная мысль, надеюсь, понятна).
И вот появляются генераторы и предлагают: вводи промпт, загружай картинку — и вперёд!
Позже приходит понимание, что существуют культура и пайплайны, описанные выше.
И начинается:
- попытки указывать в промпте склейки планов в секундах (попытка смонтировать до монтажа);
- предложения загружать сториборд в специальное поле;
- идеи сгенерировать этот сториборд;
- предложения скормить LLM параметры всех камер и учебник по съёмке, чтобы затем формулировать промпты на профессиональном жаргоне;
- планы прикрутить AI-агентов, чтобы они имитировали деятельность на площадке или в пост-продакшене, включая коммуникации, как это принято;
- игнорирование таких концепций, как альфа-канал или композитинг.
Сымитировать годами выстроенные схемы в окне браузера — задача невероятной сложности.
Uпопай, кстати, делает упор именно на это, и они, пожалуй, продвинулись в этом дальше всех.
Как паллиатив выступают технологии вроде Kling Motion Control, Luma Agents и другие решения типа video2video, где традиционное видео направляет видеогенерацию.
Но чтобы сделать это традиционное видео, нужны старые добрые методы и навыки. Вот в чём проблема.
К чему всё это рассуждение?
К тому, что учить пользователя терминологии и давать ему аналог съёмочного процесса в браузере — задача практически безнадёжная, так как пользователь ленив. Количество людей, разбирающихся в процессах, в тысячи раз меньше, чем тех, кто не разбирается и не желает разбираться.
Поэтому необходимо изобретать интерфейсы и пайплайны для неподготовленного пользователя.
Идеальный пример — одна кнопка. К ней микрофон — и всё. Остальное сделают нейросети.
Основная мысль заключается в том, что нас ждёт разделение на профессиональные видеогенераторы (с интерфейсом для профессионалов) и простые, «трёхкнопочные» решения для всех остальных. По аналогии с Notepad и Word, Movie Maker и Premiere, Paint и Photoshop.

