Открыть сервисСервис

Генеративное ИИ-искусство

Генеративное ИИ-искусство — направление в области искусственного интеллекта, связанное с созданием изображений, иллюстраций и художественных композиций с помощью нейросетей. К нему относятся системы, обученные на больших массивах графических данных, способные генерировать новые картинки по текстовому описанию (text-to-image), дорабатывать или стилизовать существующие изображения. Технология опирается на глубокие генеративные модели — генеративные состязательные сети (GAN), вариационные автоэнкодеры (VAE) и диффузионные модели.

История развития

Первые значимые результаты в генерации изображений нейросетями появились в середине 2010-х годов. В 2014 году Ян Гудфеллоу и коллеги предложили архитектуру GAN, где две сети — генератор и дискриминатор — конкурировали друг с другом, что позволило получать достаточно реалистичные изображения. В 2015 году Google Research опубликовал работу Inceptionism (DeepDream), демонстрирующую визуализацию внутренних представлений свёрточных сетей.

Ключевой перелом произошёл в 2021—2022 годах с выходом моделей диффузионного типа: DALL-E (OpenAI, 2021), Stable Diffusion (Stability AI и исследователи из Мюнхена, 2022), Midjourney (2022). Эти системы научились генерировать изображения высокого качества по текстовому описанию на нескольких языках. В 2022—2023 годах появились модели DALL-E 3, Stable Diffusion XL, а также открытые исследования российских и зарубежных команд над локальными генеративными моделями.

Принципы работы

Большинство современных генеративных моделей изображений строятся на архитектуре трансформера или комбинации свёрточных сетей с механизмами внимания. Обучение обычно проходит в два этапа:

  1. Предобучение на огромном корпусе изображений с подписями (миллионы пар «картинка — текст»).
  2. Дальнейшая тонкая настройка с использованием обратной связи от людей (RLHF) или диффузионного обучения.

Диффузионные модели работают по принципу «шум — изображение»: на этапе обучения к изображению постепенно добавляется случайный шум, а модель учится обратному процессу — восстановлению картинки из шума. На этапе генерации процесс запускается с чистого шума и текстового описания (промпта), и за десятки итераций формируется итоговое изображение.

Области применения

Генеративное ИИ-искусство используется в широком спектре сфер:

  • Иллюстрация и дизайн — создание концепт-артов, обложек, рекламных макетов.
  • Игровая индустрия — генерация текстур, персонажей, окружений.
  • Кинематограф и анимация — раскадровка, предвизуализация, генерация фонов.
  • Образование — иллюстрация учебных материалов, создание наглядных пособий.
  • Личное творчество — генерация изображений для социальных сетей, хобби-рисование.

В России генеративные модели активно развиваются в рамках проектов по локализации ИИ-решений; существуют открытые российские модели и сервисы, обученные на русскоязычных подписях к изображениям.

Юридические и этические вопросы

Генеративное искусство вызывает ряд правовых и этических дискуссий:

  • Авторские права. Модели обучаются на миллионах изображений, созданных художниками, зачастую без их согласия. В ряде стран идут судебные процессы по этому поводу.
  • Подделка изображений. Технология позволяет создавать убедительные фейковые фотографии, что связано с рисками дезинформации.
  • Замещение профессий. Художники и иллюстраторы высказывают обеспокоенность сокращением спроса на их услуги.
  • Этика генерации. Модели могут воспроизводить стереотипы и предвзятости, заложенные в обучающих данных.

В ряде стран обсуждаются обязательства по маркировке ИИ-генерированных изображений; в России действуют нормы, обязывающие помечать контент, созданный с использованием искусственного интеллекта.

Инструменты и сервисы

Основные платформы для генерации изображений:

СервисТипОсобенности
Stable DiffusionОткрытая модельЗапуск локально, свободная настройка
DALL-EКоммерческий сервисИнтеграция с ChatGPT
MidjourneyКоммерческий сервисВысокое художественное качество
KandinskyРоссийская модельОбучение на русскоязычных данных
ШедеврумРоссийский сервисГенерация изображений на базе Kandinsky

Кроме того, существуют специализированные инструменты для редактирования изображений с помощью ИИ — инпейнтинг, апскейлинг, смена стиля.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru