Открыть сервисСервис

Арт-генерация: создание изображений нейросетями

Арт-генерация — создание художественных изображений с помощью алгоритмов искусственного интеллекта, преимущественно диффузионных моделей и генеративных состязательных сетей. Термин обозначает процесс, при котором текстовое описание (промпт) или исходное изображение преобразуется в новое произведение визуального искусства: иллюстрацию, картину, эскиз, коллаж. Массовое распространение технология получила в 2022–2023 годах с выходом публичных сервисов на основе моделей Stable Diffusion, Midjourney и DALL-E.

История

Первые работы по генеративному изображению относятся к 2010-м годам. В 2014 году Ян Гудфеллоу и коллеги представили архитектуру GAN (Generative Adversarial Network), в которой генератор и дискриминатор соревновались друг с другом, постепенно улучшая качество синтеза. Ранние GAN-модели создавали размытые изображения лиц и объектов.

Переломным стал 2021 год, когда OpenAI выпустила DALL-E — модель, обученную связывать текст и изображения. В августе 2022 года Stability AI опубликовала Stable Diffusion с открытыми весами, что позволило запускать генерацию на потребительских видеокартах. В том же году Midjourney вышла в публичную бета-версию через Discord. В 2023–2024 годах появились модели с расширенным разрешением и пониманием сложных сцен (DALL-E 3, Stable Diffusion XL, Flux), а также инструменты для редактирования изображений по текстовой команде.

Технологии

Диффузионные модели

Основной современный подход. Модель обучается обратимому процессу зашумления изображения, а затем учится снимать шум шаг за шагом, превращая случайный шум в осмысленную картинку. Ключевые архитектуры — Stable Diffusion (латентная диффузионная модель, работающая в сжатом пространстве) и её производные.

Генеративные состязательные сети

Две нейросети — генератор и дискриминатор — обучаются одновременно. Генератор создаёт изображения, дискриминатор отличает их от реальных. Метод остаётся востребованным для специализированных задач, но уступил диффузионным моделям в массовом применении.

Текстовые кодировщики

Качество генерации зависит от модели, преобразующей промпт в числовое представление. Используются CLIP (OpenAI) и его модификации, а также более новые энкодеры. От того, насколько точно кодировщик понимает естественный язык, зависит соответствие результата описанию.

Способы управления генерацией

МетодОписание
ПромптТекстовое описание сюжета, стиля, освещения, композиции
Негативный промптПеречень того, чего нужно избежать в изображении
SeedФиксация начального шума для воспроизводимости результата
ControlNetУправление через карту позы, краёв или глубины
img2imgГенерация на основе существующего изображения
InpaintingЛокальная дорисовка выделенной области

Применение

  • Иллюстрация и дизайн: создание концептов, обложек, баннеров, паттернов.
  • Игровая индустрия: генерация текстур, концепт-артов, превизуализация сцен.
  • Реклама и маркетинг: быстрое производство визуального контента.
  • Архитектура и мода: вариативные эскизы, раскладки тканей, интерьерные сценарии.
  • Образование: наглядные материалы, иллюстрации к учебным текстам.
  • Личное творчество: создание изображений людьми без художественной подготовки.

Правовой и этический контекст

В России правовой статус арт-генерации определяется общими нормами авторского права. С 2023 года в Гражданском кодексе РФ закреплено, что произведения, созданные с использованием искусственного интеллекта без участия человека, не охраняются авторским правом. Судебная практика по спорам о правах на сгенерированные изображения только формируется.

Мировое сообщество обсуждает несколько проблемных вопросов: обучение моделей на работах художников без их согласия и вознаграждения; возможность подделки изображений и «фейковых» фотографий; влияние на рынок труда иллюстраторов и дизайнеров. Ряд художественных платформ (например, DeviantArt) ввёл ограничения на загрузку работ, запрещающих их использование в обучении нейросетей без разрешения автора.

См. также

  • Нейросетевая графика
  • CLIP (модель)
  • Prompt engineering
  • Цифровое искусство

Источники

  • Goodfellow I. et al. Generative Adversarial Networks. — 2014.
  • Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models. — 2022.
  • Гражданский кодекс Российской Федерации, ст. 1259, 1260.1.
  • Стабильная диффузионная модель: архитектура и обучение. — 2022.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru