Генеративное ИИ-искусство¶
Генеративное ИИ-искусство — направление в области искусственного интеллекта, связанное с созданием изображений, иллюстраций и художественных композиций с помощью нейросетей. К нему относятся системы, обученные на больших массивах графических данных, способные генерировать новые картинки по текстовому описанию (text-to-image), дорабатывать или стилизовать существующие изображения. Технология опирается на глубокие генеративные модели — генеративные состязательные сети (GAN), вариационные автоэнкодеры (VAE) и диффузионные модели.
¶История развития
Первые значимые результаты в генерации изображений нейросетями появились в середине 2010-х годов. В 2014 году Ян Гудфеллоу и коллеги предложили архитектуру GAN, где две сети — генератор и дискриминатор — конкурировали друг с другом, что позволило получать достаточно реалистичные изображения. В 2015 году Google Research опубликовал работу Inceptionism (DeepDream), демонстрирующую визуализацию внутренних представлений свёрточных сетей.
Ключевой перелом произошёл в 2021—2022 годах с выходом моделей диффузионного типа: DALL-E (OpenAI, 2021), Stable Diffusion (Stability AI и исследователи из Мюнхена, 2022), Midjourney (2022). Эти системы научились генерировать изображения высокого качества по текстовому описанию на нескольких языках. В 2022—2023 годах появились модели DALL-E 3, Stable Diffusion XL, а также открытые исследования российских и зарубежных команд над локальными генеративными моделями.
¶Принципы работы
Большинство современных генеративных моделей изображений строятся на архитектуре трансформера или комбинации свёрточных сетей с механизмами внимания. Обучение обычно проходит в два этапа:
- Предобучение на огромном корпусе изображений с подписями (миллионы пар «картинка — текст»).
- Дальнейшая тонкая настройка с использованием обратной связи от людей (RLHF) или диффузионного обучения.
Диффузионные модели работают по принципу «шум — изображение»: на этапе обучения к изображению постепенно добавляется случайный шум, а модель учится обратному процессу — восстановлению картинки из шума. На этапе генерации процесс запускается с чистого шума и текстового описания (промпта), и за десятки итераций формируется итоговое изображение.
¶Области применения
Генеративное ИИ-искусство используется в широком спектре сфер:
- Иллюстрация и дизайн — создание концепт-артов, обложек, рекламных макетов.
- Игровая индустрия — генерация текстур, персонажей, окружений.
- Кинематограф и анимация — раскадровка, предвизуализация, генерация фонов.
- Образование — иллюстрация учебных материалов, создание наглядных пособий.
- Личное творчество — генерация изображений для социальных сетей, хобби-рисование.
В России генеративные модели активно развиваются в рамках проектов по локализации ИИ-решений; существуют открытые российские модели и сервисы, обученные на русскоязычных подписях к изображениям.
¶Юридические и этические вопросы
Генеративное искусство вызывает ряд правовых и этических дискуссий:
- Авторские права. Модели обучаются на миллионах изображений, созданных художниками, зачастую без их согласия. В ряде стран идут судебные процессы по этому поводу.
- Подделка изображений. Технология позволяет создавать убедительные фейковые фотографии, что связано с рисками дезинформации.
- Замещение профессий. Художники и иллюстраторы высказывают обеспокоенность сокращением спроса на их услуги.
- Этика генерации. Модели могут воспроизводить стереотипы и предвзятости, заложенные в обучающих данных.
В ряде стран обсуждаются обязательства по маркировке ИИ-генерированных изображений; в России действуют нормы, обязывающие помечать контент, созданный с использованием искусственного интеллекта.
¶Инструменты и сервисы
Основные платформы для генерации изображений:
| Сервис | Тип | Особенности |
|---|---|---|
| Stable Diffusion | Открытая модель | Запуск локально, свободная настройка |
| DALL-E | Коммерческий сервис | Интеграция с ChatGPT |
| Midjourney | Коммерческий сервис | Высокое художественное качество |
| Kandinsky | Российская модель | Обучение на русскоязычных данных |
| Шедеврум | Российский сервис | Генерация изображений на базе Kandinsky |
Кроме того, существуют специализированные инструменты для редактирования изображений с помощью ИИ — инпейнтинг, апскейлинг, смена стиля.