Открыть сервисСервис

Нейросети для анимации

Нейросеть для анимации — это программная система на основе искусственных нейронных сетей, предназначенная для генерации, интерполяции и редактирования анимационных изображений, видео и трёхмерных сцен. К данному классу относятся как специализированные модели для создания анимации (например, генерация видеороликов по текстовому описанию или по одному изображению), так и нейросетевые инструменты, применяемые на отдельных этапах классического анимационного производства — интерполяция ключевых кадров, интерполирование движения, ретушь, апскейл и перенос стиля.

Основные направления применения

Генерация видео по тексту и изображению

В конце 2022 — начале 2023 годов ряд технологических компаний представил модели, способные генерировать короткие видеоролики по текстовому описанию (text-to-video). Среди первых публичных систем — Make-A-Video (Meta), Imagen Video (Google), а также сервисы Runway (модель Gen-1 и позднее Gen-2) и стартапы вроде Pika Labs и Stability AI (Stable Video Diffusion). Эти модели, как правило, построены на архитектурах диффузионных моделей, адаптированных для временного измерения: кадры генерируются с учётом предыдущих, что обеспечивает преемственность движения.

Российские разработки в этой области представлены, в частности, моделью Kandinsky Video от компании «Сбер» (входит в семейство моделей Kandinsky, разработанных совместно с ИИ-лабораторией «Алиса» и Институтом программных систем РАН), а также проектами в сфере генерации изображений, таких как Kandinsky 2 и его последующие версии.

Интерполяция и генерация промежуточных кадров

Классическая задача анимации — создание плавного движения между ключевыми кадрами (tweening) — решается нейросетевыми методами интерполяции кадров (frame interpolation). Модели вроде RIFE (Real-Time Intermediate Flow Estimation), FILM (Frame Interpolation for Large Motion) и DAIN (Depth-Aware Video Frame Interpolation) позволяют вставлять промежуточные кадры в существующее видео, повышая частоту кадров или сглаживая анимацию. Эти инструменты широко используются при реставрации старой анимации и при создании анимации вручную, когда художник рисует лишь ключевые позы.

Перенос движения и стилизация

Нейросети применяются для переноса движения с одного объекта на другой (motion transfer), например, при анимации персонажа по видеозаписи актёра. Существуют также системы стилизации, преобразующие реальное видео в анимационный стиль (например, в стиле мультфильма или конкретного художника) — одним из ранних примеров стал проект «Нейросеть переносит стиль мультфильма на видео» (Neural Style Transfer, предложенный в 2015 году группой Леона Гатиса).

Технологическая основа

Большинство современных нейросетевых анимационных систем строятся на трёх базовых архитектурах:

АрхитектураПрименение в анимации
Генеративно-состязательные сети (GAN)Генерация изображений и видео, перенос стиля
Диффузионные моделиГенерация видео по тексту и изображению, апскейл
Трансформеры и рекуррентные сетиИнтерполяция кадров, моделирование движения

Диффузионные модели, ставшие основой большинства публичных генераторов видео в 2023—2024 годах, обучаются на больших датасетах видеоданных и генерируют изображения постепенным «шумоподавлением». Для анимации к ним добавляются механизмы временной согласованности — например, трёхмерные свёрточные блоки или attention-механизмы, учитывающие соседние кадры.

Применение в индустрии

Нейросетевые инструменты внедряются в производство анимационных фильмов и игр. Компания Unity разработала набор инструментов Muse и Sentis для генерации ассетов и анимации в игровых движках. Студии используют нейросети для предварительной раскадровки (previsualization), генерации фонов и текстур, а также для ускорения рутинных операций — например, апскейла старой анимации до разрешения 4K.

В России нейросетевые инструменты для анимации применяются в медиа-индустрии и рекламном производстве; отдельные студии используют открытые модели для генерации раскадровок и концепт-артов.

Ограничения

Существующие нейросетевые системы для анимации имеют ряд ограничений: сложность управления точным движением персонажа, трудности с сохранением идентичности персонажа между кадрами, ограниченная длительность генерируемого ролика (как правило, от нескольких секунд до одной-двух минут), а также вопросы авторских прав на обучающие данные.

Источники:

  • Статьи и пресс-релизы компаний Runway, Stability AI, Google DeepMind (Imagen Video), Meta (организация признана экстремистской, деятельность запрещена в РФ) (Make-A-Video)
  • Публикации по архитектурам диффузионных моделей (Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models, 2022)
  • Материалы конференций CVPR и ICCV по интерполяции кадров (RIFE, FILM, DAIN)
  • Пресс-релизы компании «Сбер» о моделях Kandinsky
  • Материалы Unity о продуктах Muse и Sentis
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru