Генеративное изображение нейросетями¶
Генеративное изображение нейросетями — создание графических изображений с помощью программных систем искусственного интеллекта, обученных на больших массивах графических данных. Такие системы, называемые генеративными моделями, способны формировать новые изображения по текстовому описанию (промпту), по исходному изображению или по другим условиям. Технология получила широкое распространение с конца 2021 года и применяется в дизайне, рекламе, иллюстрации, кинематографии и научных исследованиях.
¶История
Ранние работы по генеративно-состязательным сетям (GAN) опубликовал Ян Гудфеллоу в 2014 году. Модель GAN состояла из двух конкурирующих нейросетей: генератора, создававшего изображения, и дискриминатора, оценивавшего их реалистичность. В 2018 году лаборатория NVIDIA выпустила модель StyleGAN, способную генерировать фотореалистичные портреты несуществующих людей.
Переломным стал 2021 год, когда появились системы диффузионные модели — DALL-E от OpenAI, VQGAN+CLIP и др. В 2022 году вышли DALL-E 2, Stable Diffusion (открыта для свободного использования) и Midjourney, что сделало генеративное изображение массовым инструментом. В 2023—2024 годах появились модели с улучшенной анатомией, текстом на изображениях и возможностью редактирования по текстовой команде.
¶Принцип работы
¶Диффузионные модели
Современные системы в основном используют архитектуру диффузионных моделей. Обучение состоит из двух этапов: на первом к исходному изображению постепенно добавляется случайный шум, на втором нейросеть учится обратному процессу — восстанавливать изображение из шума. На этапе генерации система начинает с чистого шума и за несколько десятков шагов «вытаскивает» из него изображение, соответствующее текстовому описанию.
¶Текстовые условия
Текстовое описание кодируется отдельной моделью — как правило, CLIP (Contrastive Language-Image Pre-training), разработанной OpenAI в 2021 году. CLIP сопоставляет текстовые и визуальные эмбеддинги в общем векторном пространстве, что позволяет связать словесный промпт с визуальным содержанием.
¶Латентное пространство
В моделях типа Stable Diffusion генерация происходит не в пиксельном пространстве, а в латентном — сжатом представлении изображения. Это снижает вычислительные затраты и позволяет запускать обучение и генерацию на потребительских видеокартах.
¶Классификация систем
| Тип | Примеры | Особенности |
|---|---|---|
| Диффузионные | Stable Diffusion, DALL-E 3, Midjourney | Генерация по тексту, высокое качество |
| GAN-модели | StyleGAN, VQGAN | Быстрая генерация, узкая специализация |
| Текст-к-изображению | Imagen, Parti (Google) | Акцент на точность соответствия тексту |
| Редакторы | Inpainting, ControlNet | Модификация существующих изображений |
¶Применение
- Дизайн и реклама — создание макетов, иллюстраций, продуктовых визуализаций.
- Кинематограф и игры — генерация концепт-артов, текстур, раскадровок.
- Наука — моделирование молекулярных структур, астрономических изображений, медицинских снимков.
- Образование — создание учебных иллюстраций.
- Личное творчество — генерация изображений для социальных сетей, блогов, персональных проектов.
¶Правовой и этический аспект
В России и ряде других стран действуют требования к маркировке сгенерированных изображений. С 1 сентября 2023 года в России вступили в силу поправки в закон «О рекламе», обязывающие маркировать рекламные материалы с использованием ИИ. В 2024 году в России обсуждались инициативы по маркировке ИИ-контента в СМИ.
Ключевые этические вопросы связаны с авторскими правами: модели обучались на миллионах изображений, многие из которых защищены авторским правом. Ряд исков к разработчикам моделей был подан художниками и фотографами. Другая проблема — дипфейки и дезинформация, что привело к появлению инструментов обнаружения сгенерированных изображений.
¶См. также
- Генеративно-состязательная сеть
- Диффузионная модель
- CLIP (нейросеть)
- Stable Diffusion
- Дипфейк
¶Источники
- Goodfellow I. et al. Generative Adversarial Networks. — 2014.
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models. — 2022.
- Radford A. et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP). — 2021.
- Официальная документация Stable Diffusion, Midjourney, DALL-E.