Генеративные ИИ-модели для создания изображений¶
Генеративные ИИ-модели для создания изображений — это класс программных систем искусственного интеллекта, способных генерировать изображения по текстовому описанию (промпту), рисунку или другому входному сигналу. Ключевой технологией является диффузионная модель, обученная на больших массивах графических данных; в России подобные системы разрабатывают в ряде исследовательских центров и технологических компаний.
¶Принцип работы
Генерация изображения по описанию строится на нескольких последовательных этапах:
- Текстовый энкодер преобразует пользовательскую строку (промпт) в числовое представление — вектор признаков. Для этого используются языковые модели, обученные на парах «текст — изображение».
- Диффузионная модель строит изображение, последовательно удаляя «шум» из случайного шумового поля под управлением текстового условия. Вместо прямого предсказания пикселей модель обучается обратному процессу — восстановлению чистого изображения из зашумлённого.
- Декодер (чаще всего вариационный автоэнкодер, VAE) переводит латентное представление в растровое изображение.
Альтернативный подход — генеративно-состязательные сети (GAN), в которых генератор и дискриминатор конкурируют друг с другом; в 2020-е годы диффузионные модели вытеснили GAN в большинстве публичных систем генерации изображений.
¶История развития
Первые значимые результаты в генерации изображений нейросетями получены в середине 2010-х годов на основе GAN, предложенных Яном Гудфеллоу в 2014 году. В 2021 году OpenAI представила DALL-E, а в 2022-м — DALL-E 2, продемонстрировавшие высокое качество генерации по текстовым описаниям. В том же 2022 году вышли Stable Diffusion (от Stability AI, разработанная при участии немецких исследователей) и Midjourney, ставшие доступными широкой аудитории.
В России работы по генеративным моделям ведутся в академических и корпоративных лабораториях. Среди известных отечественных разработок — нейросети «Сбер», «Яндекса» и ряда стартапов, в том числе системы, работающие с русскоязычными описаниями и учитывающие специфику кириллицы.
¶Классификация систем
| Тип модели | Особенности | Примеры |
|---|---|---|
| Диффузионные | Высокое качество, медленная генерация | Stable Diffusion, DALL-E, Midjourney |
| GAN | Быстрая генерация, ограниченное разнообразие | StyleGAN, VQGAN+CLIP |
| Трансформерные (autoregressive) | Последовательная генерация токенов | Parti, VAR |
| Гибридные | Комбинация подходов | Imagen, Kandinsky |
¶Применение
Генеративные модели изображений применяются в дизайне и рекламе (создание макетов, иллюстраций, продуктовых снимков), в кинематографии и игростроении (концепт-арт, текстуры, превью сцен), в образовании (визуализация сложных понятий), в медицине (генерация синтетических данных для обучения диагностических моделей), а также в личном творчестве.
¶Правовые и этические вопросы
Генерация изображений вызывает споры вокруг авторских прав: модели обучены на миллионах картинок, созданных художниками, и результат может воспроизводить узнаваемый стиль конкретного автора. В ряде юрисдикций идут судебные процессы по этому поводу. Отдельная проблема — дипфейки, то есть поддельные изображения реальных людей, используемые для дезинформации и мошенничества; в России за распространение заведомо ложной информации и дипфейков предусмотрена административная и уголовная ответственность.
¶Промпт-инжиниринг
Качество результата существенно зависит от формулировки описания. Пользователи применяют техники промпт-инжиниринга: указание стиля («акварель», «кинематографический кадр»), композиции, освещения, художественного направления, а также негативных промптов — того, что не должно появиться в изображении. Существуют библиотеки готовых промптов и сообщества, где пользователи делятся рабочими описаниями.
Источники:
- Goodfellow I. et al. Generative Adversarial Networks. — NeurIPS, 2014.
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models. — CVPR, 2022.
- Ramesh A. et al. Zero-Shot Text-to-Image Generation. — ICML, 2021.
- Saharia C. et al. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. — NeurIPS, 2022.
- Encyclopædia Britannica: «Generative adversarial network», «Diffusion model».