Генеративные изображения нейросетями¶
Генеративные изображения — цифровые картинки, создаваемые программно с помощью нейросетей на основе текстового описания (промпта) или исходного изображения. Технология относится к классу генеративного искусственного интеллекта и базируется на архитектурах диффузионных моделей и генеративных состязательных сетей. С конца 2022 года генерация изображений стала массово доступна широкой аудитории через облачные сервисы и открытые модели.
¶Принцип работы
Диффузионные модели, лежащие в основе большинства современных генераторов, обучаются в два этапа. На первом этапе сеть учится постепенно «зашумлять» изображение, добавляя случайный шум до получения чистого шума. На втором — разучиваться удалять шум, шаг за шагом восстанавливая изображение. При генерации модель стартует со случайного шума и итеративно «вытаскивает» из него картинку, соответствующую текстовому описанию.
Текстовые описания кодируются отдельной языковой моделью (чаще всего на основе архитектуры трансформера), которая преобразует промпт в векторное представление. Это представление направляет процесс денойзинга, задавая содержание и стиль результата.
Генеративные состязательные сети (GAN) — более ранний подход, в котором две сети конкурируют: генератор создаёт изображения, а дискриминатор пытается отличить их от реальных. GAN-модели (например, StyleGAN) до сих пор используются для генерации лиц и стилизации.
¶Ключевые модели и сервисы
| Модель / сервис | Разработчик | Год | Особенности |
|---|---|---|---|
| DALL-E | OpenAI | 2021 | Ранняя текстово-графическая модель |
| Stable Diffusion | Stability AI (с участием исследователей из России) | 2022 | Открытые веса, работа на потребительском железе |
| Midjourney | Midjourney, Inc. | 2022 | Акцент на художественном качестве |
| Imagen / Parti | 2022 | Крупные проприетарные модели | |
| Kandinsky | «Сбер» | 2022 | Первая российская открытая генеративная модель |
| FusionBrain | «Сбер» | 2023 | Платформа с API и обучением пользовательских моделей |
| Шедеврум | «Яндекс» | 2023 | Сервис генерации изображений на базе собственной модели |
Stable Diffusion заслуживает отдельного упоминания: её разработка велась при участии немецкого института LMU и российской компании Stability AI, а открытый релиз весов в августе 2022 года стал поворотным моментом — технология оказалась доступной для локального запуска на обычных видеокартах.
Российские разработки получили развитие в 2022–2024 годах. Модель Kandinsky от «Сбера» поддерживает русскоязычные промпты и стилизацию по референсным изображениям, а платформа FusionBrain позволяет пользователям обучать собственные модели на своих данных.
¶Способы генерации
- Текст в изображение (text-to-image) — базовый режим: пользователь описывает желаемую картинку словами, нейросеть генерирует изображение.
- Изображение в изображение (image-to-image) — модель дорабатывает или стилизует исходную картинку, сохраняя её композицию.
- Инпейнтинг — заполнение выделенной области изображения с учётом контекста.
- Аутпейнтинг — расширение изображения за его исходные границы.
- Контроль композиции — использование дополнительных модулей (например, ControlNet), задающих позы, контуры или карту глубины.
¶Применение
Генеративные изображения используются в иллюстрации, рекламе, дизайне, кинематографической раскадровке, создании концепт-артов для игр, подготовке обучающих материалов и в научной визуализации. В России технология применяется в маркетинге, медиа и образовании; крупные компании интегрируют генерацию в свои продукты — например, «Яндекс» — в поисковую выдачу и редактор «Диск», «Сбер» — в платформу FusionBrain и мессенджер «СберСалют».
¶Правовой статус в России
С 2023 года в России действует требование маркировать изображения, созданные с помощью ИИ, — на них должна стоять пометка «сгенерировано ИИ». Норма закреплена в поправках к закону об информации и направлена на противодействие дезинформации. Ответственность за отсутствие маркировки предусмотрена Кодексом РФ об административных правонарушениях.
¶Ограничения и критика
Типичные проблемы генеративных изображений — «галлюцинации» (анатомические аномалии, искажённый текст на картинках), непредсказуемость результата и зависимость от формулировки промпта. Технология также вызывает дискуссию о правах на обучающие данные: художники и фотографы указывают, что модели обучены на миллионах работ без согласия авторов. В ряде юрисдикций идут судебные процессы по этому вопросу.