Мы любим генеративное видео, и Джеймс Кэмерон его любит. Но мы не одинаковы: пока мы наслаждаемся просмотром нейросетевого брейнрота, режиссер планирует ускорить создание графики в два раза. Индустрия сделанных с помощью ИИ-роликов развивается так быстро, что сложно уследить за всеми инструментами и трендами. Кинопоиск рассказывает о состоянии генеративного видео на лето 2025 года.
Почему в ваших соцсетях столько видеотреша
Два года назад нейросетевые ролики выглядели иначе. Короткометражка The Frost состояла из статичных кадров, а анимации были если не пугающими, то неестественными. И сравните с тем, что генерируется сегодня! Скорее всего, вам нужно будет присмотреться, чтобы найти артефакты в ролике The Wall Street Journal про жизнь девушки и ее домашнего робота.
Несколько раз в год в мире генеративного видео происходит большое обновление. Например, появляются генерации в качестве 1080p, или увеличивается их длительность с нескольких секунд до минуты. Контентмейкеры пробуют новые возможности, а в наших лентах появляются сотни похожих друг на друга роликов.
Последняя волна связана с выходом Veo 3 — генератора на основе диффузионных моделей, который Google показала на презентации I/O в конце мая. Как и другие инструменты, он создает короткие видео (всего 8 секунд) по текстовому описанию. Но у Veo 3 есть важное преимущество: клипы создаются со звуком. На этапе написания промта можно указать, о чем будут говорить герои, описать музыку или добавить шум толпы или ветра. Это упростило работу с генерацией: то, что раньше делали несколькими инструментами, теперь можно выполнить в одном.
Большинство созданных в Veo 3 видео следуют знакомыми форматами: среди них влоги, уличные интервью, телевизионные репортажи, ASMR. «Это вопрос узнаваемости, — считает создатель нейророликов Дмитрий Алексеев. — Людям проще воспринимать знакомое. Форматы вроде телерепортажа или влога вызывают доверие, потому что они вшиты в наше медиаполе. Такой подход снимает барьер между зрителем и автором, и не стоит забывать про технические ограничения. Уличные опросы и влоги нейросети воспроизводятся стабильно: простая актерская игра, средний звук, сырое качество. Это органично вписывается в такой тип контента».

Дмитрий Пелипас
нейровидеокреатор, pelipas.ru
Я занимаюсь компьютерной графикой всю сознательную жизнь. С 2005 года фрилансил, делал сайты, флеш-анимацию, 3D-графику и видео. Но именно видеонейросетями занялся совсем недавно, когда вышли последние модели Kling и Veo, а качество роликов стало лучше.
Сейчас я работаю в Veo. Эта модель генерирует лучше всех, хотя устроено там все неудобно. Например, нельзя создавать видео по картинке — только по текстовому описанию. Есть большая проблема с повторяемостью персонажей. И дорого — около 50–80 рублей за генерацию одного ролика. Но зато реалистичные движения, живые персонажи, которые даже носом шмыгают.
Мои ролики с Бабой-ягой выстрелили — 20 млн просмотров меньше чем за 10 дней, а у меня много заказов. Завален весь Telegram и Instagram, я не успеваю отвечать. Мы и с Яндексом поработали, и с ТНТ, с крупными и мелкими компаниями. Заказывают как отдельные видео, так и просто упоминание бренда в моем сериале про Бабу-ягу. Сейчас на этом можно неплохо заработать, а кто одним из первых станет известным креатором, тот и снимет все сливки. Потом рынок устаканится, этим начнут заниматься все подряд, цены на ролики упадут.
Как работает генерация
Большинство достижений в области генеративного видео (да и картинок тоже) в последние годы связаны с диффузионными моделями. Впервые они были описаны учеными еще в 2015 году, но заметными стали только в 2020-м. Суть в том, чтобы использовать процессы из термодинамики — прямую и обратную диффузию — для обучения нейронных сетей. Например, вы выливаете чернила в стакан с водой. Сначала они сосредоточены в одном месте, но постепенно распространяются по всему объему воды — это прямая диффузия. Обратная диффузия заключается в том, чтобы вернуть чернила в исходное состояние.
Генерация картинок работает похожим образом. Во время обучения модели показываются изображения с описаниями: что на них происходит, какие объекты находятся. После на картинки добавляется случайный шум. Модель учится удалять этот шум, чтобы восстановить исходное изображение. Когда дело доходит до генерации, модели, наоборот, показывают чистый шум. Из нее она пытается восстановить исходное изображение, которое описано в промте.

При создании видео вместе с диффузионной моделью работает трансформер — это архитектура нейросетей, которая часто используется в чат-ботах. Трансформеры видят задачу целиком, разбивают ее на подзадачи и работают с ними параллельно. В генерации текста это помогает создать связный текст, а для видео — связать предыдущий кадр со следующим.
Диффузионные модели хорошо показали себя на фоне предшественников. Раньше для этого использовались GAN — генеративно-состязательные сети. Но у них куча недостатков: кадры были плохо согласованы, результат оставался непредсказуемым, GAN могли застрять в ограниченном наборе образов. Диффузионные модели более предсказуемые, хотя недостатков у них хватает: пока они очень медленные и требуют больших вычислительных мощностей.

Сергей Овчаренко
руководитель команды нейросетевых технологий компьютерного зрения в Яндексе
Отрасль машинного обучения развивается очень быстро. В последние два-три года за счет появления больших диффузионных моделей мы видели невероятный прогресс в области генерации изображений. Видео было естественным следующим рубежом, и многие исследователи и инженеры стали заниматься им.
Видео — более трудная задача, чем генерация изображений: необходимо не только создавать красивые захватывающие кадры, но еще и учиться моделировать движение. Генерация видео также более сложна с инженерной точки зрения: нужно больше вычислительных мощностей, больше данных, которые надо где-то хранить и быстро доставлять. Создание текстовых описаний видео для обучения модели существенно сложнее, чем для изображений.
Качественные видеоданные значительно менее доступны, чем изображения. Так что, как и часто бывает в машинном обучении, для дальнейшего прогресса нужны хорошие данные, много вычислительных ресурсов и талантливые инженеры, которые разработают улучшения текущих подходов и архитектур.
Где и как это всё делают
Существует множество сервисов генерации видео. Некоторые используют диффузионные модели, другие не раскрывают технологии. У каждого инструмента свои отличия — например, Luma, судя по отзывам, лучше передает движения и понимает физику реального мира. Sora от OpenAI умеет создавать в кадре движение нескольких персонажей. Kling выдает самые длинные отрывки: пока у остальных 10–20 секунд, у Kling — две минуты. Pika предлагает добавлять в ролики свои объекты, персонажей и эффекты, а Runway — студию для профессионалов, где можно, например, скопировать стиль из другого видео.
Процесс создания ролика в одном из этих инструментов может выглядеть так:
1. В генераторе изображений, например Midjourney, получаете статичный кадр.
2. Идете с ним в генератор видео, где прописываете детали сцены: как движется персонаж, как движется камера.
3. В отдельном сервисе, например в ElevenLabs, пишете текст для озвучки.
4. Получившийся аудиофайл загружаете в генератор видео — у большинства есть липсинк.
5. Короткие отрывки по 10 секунд монтируете в обычном редакторе.
Удовольствие это недешевое. Так, чтобы воспользоваться Veo 3, потребуется подписка Google AI Ultra за 250 долларов (а россиянам — еще и VPN и иностранный номер телефона). Она дает около 125 видео в высоком качестве, то есть на один 8-секундный отрывок вы потратите не меньше двух долларов. В других инструментах дешевле: Runway c подпиской за 28 долларов позволит создать где-то 22 отрывка по 10 секунд, каждый по 1,3 доллара. Надо учесть, что эти расчеты не учитывают неудачные варианты, а их будет много. На 30-секундный рекламный ролик может уйти 300–400 итераций.

Дмитрий Алексеев
режиссер, автор Telegram-канала Ai Filmmaker
Я пришел в генеративное видео в конце 2022 года. Начинал с Midjourney V4 — тогда это была самая реалистичная графическая нейросеть. Работал в связке с Adobe After Effects, а со временем для анимации стал использовать Luma AI. Первая моя работа — концепт-трейлер в стиле ретрохоррора. Почти месяц я каждый день сидел по три-шесть часов и разбирался, как сделать так, чтобы кадры были похожи на старую киноленту. В итоге получился один из первых в мире трейлеров, созданных с помощью нейросетей.
К реализму нейросетей все еще есть вопросы. Для другого видео я объединил ретроэстетику уличного опроса на постсоветском ТВ с экзистенциальными монологами ChatGPT. Стилизация под ретро помогает скрыть несовершенства цифрового изображения. Я использовал китайскую Dreamina, которая первой показала качественное видео с реалистичными говорящими персонажами, и Reve. Она отлично воспроизводила советский визуальный код и документальную эстетику. У оригинального поста почти 2 миллиона просмотров. Но это только у меня. С учетом перезаливов охват значительно выше.
Безусловно, генеративный подход ускоряет процесс. Однако это хоть и передовой, но все же инструмент, а с ним можно работать по-разному — или быстро, или качественно. В среднем на минуту видео уходит около месяца, если не заниматься им все выходные: нужно принять правильные решения во время производства и придумать, как обойти ограничения нейросетей. Например, для этого ролика было сгенерировано 708 шотов и отобрано 97 удачных. В монтаж вошло 37. Это неделя интенсивной работы.
Почему генеративные видео так популярны
Одна из причин того, что людям нравится видеослоп, — элемент неожиданности в роликах. Пенсионерка катается на эму, имперский штурмовик записывает влог, а приключения милого рыжего котика заканчиваются суровой драмой. Чтобы видео стало вирусным, оно должно удивлять. В исследовании 2014 года участникам показывали ролики с неожиданными поворотами (например, репортеру в лицо прилетает пакет) и без них. Оказалось, что историями с неожиданным развитием хотелось делиться почти в два раза чаще.
Важна простота, с которой создается генеративное видео. Чтобы сделать ролик про милого рыжего котика по кличке Chubby, нужен час, но в TikTok он может набрать до 50 миллионов просмотров. На всех социальных платформах авторов поощряют за публикации хотя бы раз в день, чтобы не терять охваты. А создатели ИИ-контента могут использовать эти рекомендации: они чаще выпускают видео и чаще получают внимание алгоритмов.
Некоторые авторы используют еще одну черту вирусных видео — сильные эмоции. Исследования показали, что ролики, которые вызывают отклик и заставляют написать комментарий, чаще вирусятся. На это влияют вызванные ими сильные чувства: страх, грусть, гнев, удивление и даже отвращение. Последнее вы можете ощутить, когда посмотрите рилсы про то, как китов чистят от морских паразитов, а хозяева откусывают морды своим собакам.
С негативными эмоциями ИИ-видео часто встречается в рекламе. Несмотря на то, что такие ролики делаются в 10 раз быстрее классических агентских произведений и стоят намного дешевле, генеративную рекламу нередко критикуют.
В комментариях к сгенерированной рекламе пишут, что эмоции в ней ненастоящие, создатели лицемерны, все выглядит словно сцены из антиутопии.
«За последние четыре года я провела больше сорока коммерческих и культурных проектов c полным ИИ-видеоциклом — от трехсекундных роликов до 12-минутных музыкальных фильмов, — говорит нейрохудожница Валерия Титова. — Это был и контент для выставок, и для рекламы, и клипы, и видео для социальных сетей. Сюда входит как генерация с нуля, так и обработка уже существующих видео. Но в целом в современном искусстве генеративное видео делает только первые шаги: если мы посмотрим на крупные ярмарки искусства, на них очень мало генеративного искусства и диджитала, он там все еще стоит особняком».
А что с нейросетями в кино?
Когда заходит речь про нейросети в фильмах и сериалах, часто говорят о дипфейках. Это омоложение актеров: Роберта Де Ниро в «Ирландце», Харрисона Форда в «Колесе судьбы», Тома Хэнкса и Робин Райт — в «Тогда. Сейчас. Потом». В российском кино дипфейки тоже используют. Например, Александра Яценко и Анну Михалкову омолодили в недавнем фильме «Ровесник», Максима Виторгана заменили в сериале «Контакт», а умершего 15 лет назад Владислава Галкина вернули для нового эпизода сериала «Диверсант».
Есть и более интересные примеры. В фильме «Всё везде и сразу» генеративное видео использовали для ротоскопирования. В одной из сцен каменного мира нужно было перенести на передний план камни и песок. У VFX-команды из восьми человек не было времени этим заниматься, поэтому художник по визуальным эффектам сделал всю работу в Runway. Одно из самых заметных появлений нейросетей в кинематографе произошло в сериале «Дом Давида». Рассказанная в начале шестого эпизода история Голиафа практически целиком сделана с помощью Midjourney, Runway и Kling, а также более традиционных инструментов: Unreal Engine, Nuke и After Effects. Новые инструменты сократили время производства с четырех-пяти месяцев до пары недель.

«Нейросети можно применять, чтобы сделать технически сложные кадры — в горах, в океане, для которых нужно снаряжать экспедиции и которые снимают на дроны, — рассказывает Арман Яхин, основатель и генеральный директор Main Road Post. — Если раньше для пролета над горами нужно было вертолет заказывать, то сейчас это сделать проще».
Генеративное видео поможет закрыть и другие потребности кинематографистов. Например, режиссер Дэйв Кларк питчит с помощью него сценарии. Раньше он нарезал отрывки из фильмов, а сейчас все для питчингов собирает в Runway. Кинематографисты создают и персонажей для заднего плана, и фоны для анимации, но ограничения у технологии тоже есть.
Часть из них касается языка. Чтобы получить видео, сначала нужно написать промт. Описать пролет над горами просто, сложнее — специфические жесты, мимику и движения. «У нас есть много слов, чтобы говорить про мир вокруг нас, — отмечал Никола Тодорович, глава компании по производству визуальных эффектов Wonder Dynamics. — Но если я хочу описать какое-то особое движение, я не буду делать это словами. Я просто покажу вам, вы увидите и поймете».
Другие ограничения относятся к качеству видео. «Для YouTube и телевидения нейросеток уже хватает, но для кино их пока не получается использовать полноценно, — продолжает Яхин. — Для большого экрана им не хватает качества и цветового диапазона, в них вообще пока нельзя полноценно работать с цветом. Грубо говоря, это если бы профессиональный фотограф обрабатывал обычный JPEG из интернета».

Арман Яхин
основатель и генеральный директор Main Road Post, делавшей графику для фильмов «Спутник», «Сто лет тому вперед», «Мастер и Маргарита» и т. д.
Мы уже работаем с нейросетями, в рекламе они применяются полным ходом. Недавно сняли с ними целую серию рекламных роликов. Пробуем все существующие инструменты. Все они работают немного по-разному: одна лучше справится, например, с водой, другая — с движущимися объектами, третья — с персонажами.
Главное, что они позволяют быстрее добежать до рабочего прототипа. В классическом процессе путь от задумки до визуализации долгий и дорогой: это раскадровки, концепты, сториборды, аниматики. И на каждом этапе мы имеем дело с художественной интерпретацией — результат может немного отличаться от задумки. С нейросетями большинство промежуточных этапов в какие-то моменты не нужны, и производство видео ускоряется на порядок. Мы недавно работали с клиентами, так они оказались не готовы к тому, как все быстро получалось. В какой-то момент даже попросили вернуться к более привычному процессу!
Стол, на котором стояли все наши рабочие практики в кино, рекламе и графике, медленно переворачивается. Что останется на этом столе, какие новые инструменты появятся, трудно сказать, потому что вещи меняются слишком быстро. Я не хочу никого обижать, но актеры из рекламы, если они не селебрити, и секонд-юниты, которые снимают какие-то добавочные детали и элементы, если не исчезнут, то их точно станет меньше. И это не в будущем, это происходит прямо сейчас.
Чего ждать в ближайшем будущем
«Пока даже лучшие видеогенераторы ограничиваются несколькими секундами видео и часто только одной сценой, — отмечает Овчаренко, который занимается нейросетевыми технологиями компьютерного зрения в Яндексе. — Думаю, следующая задача, которую надо решить, — генерация длинных видео и возможность задавать собственных консистентных персонажей».
Внедрять искусственный интеллект в производство кино планируют Toei Animation (сделали «Красавицу-воина Сейлор Мун», «Драконий жемчуг», «Ван-Пис»), Lionsgate («Пила», «Голодные игры», «Джон Уик»), Netflix, хоррор-студия Blumhouse Productions («Мы», «М3ГАН», «Не говори никому»). Пока речь идет о том, чтобы сделать генеративный ИИ частью привычных процессов, но никто не сможет сказать, как в ближайшие годы изменятся производство и потребление кино и сериалов.
«Мы увидим совершенно новый вид развлечения, — говорит Майкл Блэк, директор одного из институтов в Обществе Макса Планка. — Это будет что-то между игрой, фильмом и повседневной жизнью. Киноиндустрия рассказывает истории пассивно. Я сижу и смотрю, как в театре, или слушаю подкаст. Но в обычной жизни мы рассказываем истории друг другу, что делали в выходные и так далее. И это уже активный способ рассказывать истории».
Автор: Николай Удинцев