Арт-генерация: создание изображений нейросетями¶
Арт-генерация — создание художественных изображений с помощью алгоритмов искусственного интеллекта, преимущественно диффузионных моделей и генеративных состязательных сетей. Термин обозначает процесс, при котором текстовое описание (промпт) или исходное изображение преобразуется в новое произведение визуального искусства: иллюстрацию, картину, эскиз, коллаж. Массовое распространение технология получила в 2022–2023 годах с выходом публичных сервисов на основе моделей Stable Diffusion, Midjourney и DALL-E.
¶История
Первые работы по генеративному изображению относятся к 2010-м годам. В 2014 году Ян Гудфеллоу и коллеги представили архитектуру GAN (Generative Adversarial Network), в которой генератор и дискриминатор соревновались друг с другом, постепенно улучшая качество синтеза. Ранние GAN-модели создавали размытые изображения лиц и объектов.
Переломным стал 2021 год, когда OpenAI выпустила DALL-E — модель, обученную связывать текст и изображения. В августе 2022 года Stability AI опубликовала Stable Diffusion с открытыми весами, что позволило запускать генерацию на потребительских видеокартах. В том же году Midjourney вышла в публичную бета-версию через Discord. В 2023–2024 годах появились модели с расширенным разрешением и пониманием сложных сцен (DALL-E 3, Stable Diffusion XL, Flux), а также инструменты для редактирования изображений по текстовой команде.
¶Технологии
¶Диффузионные модели
Основной современный подход. Модель обучается обратимому процессу зашумления изображения, а затем учится снимать шум шаг за шагом, превращая случайный шум в осмысленную картинку. Ключевые архитектуры — Stable Diffusion (латентная диффузионная модель, работающая в сжатом пространстве) и её производные.
¶Генеративные состязательные сети
Две нейросети — генератор и дискриминатор — обучаются одновременно. Генератор создаёт изображения, дискриминатор отличает их от реальных. Метод остаётся востребованным для специализированных задач, но уступил диффузионным моделям в массовом применении.
¶Текстовые кодировщики
Качество генерации зависит от модели, преобразующей промпт в числовое представление. Используются CLIP (OpenAI) и его модификации, а также более новые энкодеры. От того, насколько точно кодировщик понимает естественный язык, зависит соответствие результата описанию.
¶Способы управления генерацией
| Метод | Описание |
|---|---|
| Промпт | Текстовое описание сюжета, стиля, освещения, композиции |
| Негативный промпт | Перечень того, чего нужно избежать в изображении |
| Seed | Фиксация начального шума для воспроизводимости результата |
| ControlNet | Управление через карту позы, краёв или глубины |
| img2img | Генерация на основе существующего изображения |
| Inpainting | Локальная дорисовка выделенной области |
¶Применение
- Иллюстрация и дизайн: создание концептов, обложек, баннеров, паттернов.
- Игровая индустрия: генерация текстур, концепт-артов, превизуализация сцен.
- Реклама и маркетинг: быстрое производство визуального контента.
- Архитектура и мода: вариативные эскизы, раскладки тканей, интерьерные сценарии.
- Образование: наглядные материалы, иллюстрации к учебным текстам.
- Личное творчество: создание изображений людьми без художественной подготовки.
¶Правовой и этический контекст
В России правовой статус арт-генерации определяется общими нормами авторского права. С 2023 года в Гражданском кодексе РФ закреплено, что произведения, созданные с использованием искусственного интеллекта без участия человека, не охраняются авторским правом. Судебная практика по спорам о правах на сгенерированные изображения только формируется.
Мировое сообщество обсуждает несколько проблемных вопросов: обучение моделей на работах художников без их согласия и вознаграждения; возможность подделки изображений и «фейковых» фотографий; влияние на рынок труда иллюстраторов и дизайнеров. Ряд художественных платформ (например, DeviantArt) ввёл ограничения на загрузку работ, запрещающих их использование в обучении нейросетей без разрешения автора.
¶См. также
¶Источники
- Goodfellow I. et al. Generative Adversarial Networks. — 2014.
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models. — 2022.
- Гражданский кодекс Российской Федерации, ст. 1259, 1260.1.
- Стабильная диффузионная модель: архитектура и обучение. — 2022.