Открыть сервисСервис

Генеративные изображения нейросетями

Генеративные изображения — цифровые картинки, создаваемые программно с помощью нейросетей на основе текстового описания (промпта) или исходного изображения. Технология относится к классу генеративного искусственного интеллекта и базируется на архитектурах диффузионных моделей и генеративных состязательных сетей. С конца 2022 года генерация изображений стала массово доступна широкой аудитории через облачные сервисы и открытые модели.

Принцип работы

Диффузионные модели, лежащие в основе большинства современных генераторов, обучаются в два этапа. На первом этапе сеть учится постепенно «зашумлять» изображение, добавляя случайный шум до получения чистого шума. На втором — разучиваться удалять шум, шаг за шагом восстанавливая изображение. При генерации модель стартует со случайного шума и итеративно «вытаскивает» из него картинку, соответствующую текстовому описанию.

Текстовые описания кодируются отдельной языковой моделью (чаще всего на основе архитектуры трансформера), которая преобразует промпт в векторное представление. Это представление направляет процесс денойзинга, задавая содержание и стиль результата.

Генеративные состязательные сети (GAN) — более ранний подход, в котором две сети конкурируют: генератор создаёт изображения, а дискриминатор пытается отличить их от реальных. GAN-модели (например, StyleGAN) до сих пор используются для генерации лиц и стилизации.

Ключевые модели и сервисы

Модель / сервисРазработчикГодОсобенности
DALL-EOpenAI2021Ранняя текстово-графическая модель
Stable DiffusionStability AI (с участием исследователей из России)2022Открытые веса, работа на потребительском железе
MidjourneyMidjourney, Inc.2022Акцент на художественном качестве
Imagen / PartiGoogle2022Крупные проприетарные модели
Kandinsky«Сбер»2022Первая российская открытая генеративная модель
FusionBrain«Сбер»2023Платформа с API и обучением пользовательских моделей
Шедеврум«Яндекс»2023Сервис генерации изображений на базе собственной модели

Stable Diffusion заслуживает отдельного упоминания: её разработка велась при участии немецкого института LMU и российской компании Stability AI, а открытый релиз весов в августе 2022 года стал поворотным моментом — технология оказалась доступной для локального запуска на обычных видеокартах.

Российские разработки получили развитие в 2022–2024 годах. Модель Kandinsky от «Сбера» поддерживает русскоязычные промпты и стилизацию по референсным изображениям, а платформа FusionBrain позволяет пользователям обучать собственные модели на своих данных.

Способы генерации

  • Текст в изображение (text-to-image) — базовый режим: пользователь описывает желаемую картинку словами, нейросеть генерирует изображение.
  • Изображение в изображение (image-to-image) — модель дорабатывает или стилизует исходную картинку, сохраняя её композицию.
  • Инпейнтинг — заполнение выделенной области изображения с учётом контекста.
  • Аутпейнтинг — расширение изображения за его исходные границы.
  • Контроль композиции — использование дополнительных модулей (например, ControlNet), задающих позы, контуры или карту глубины.

Применение

Генеративные изображения используются в иллюстрации, рекламе, дизайне, кинематографической раскадровке, создании концепт-артов для игр, подготовке обучающих материалов и в научной визуализации. В России технология применяется в маркетинге, медиа и образовании; крупные компании интегрируют генерацию в свои продукты — например, «Яндекс» — в поисковую выдачу и редактор «Диск», «Сбер» — в платформу FusionBrain и мессенджер «СберСалют».

Правовой статус в России

С 2023 года в России действует требование маркировать изображения, созданные с помощью ИИ, — на них должна стоять пометка «сгенерировано ИИ». Норма закреплена в поправках к закону об информации и направлена на противодействие дезинформации. Ответственность за отсутствие маркировки предусмотрена Кодексом РФ об административных правонарушениях.

Ограничения и критика

Типичные проблемы генеративных изображений — «галлюцинации» (анатомические аномалии, искажённый текст на картинках), непредсказуемость результата и зависимость от формулировки промпта. Технология также вызывает дискуссию о правах на обучающие данные: художники и фотографы указывают, что модели обучены на миллионах работ без согласия авторов. В ряде юрисдикций идут судебные процессы по этому вопросу.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru