Открыть сервисСервис

Рисующий ИИ: генеративные модели изображений

Рисующий ИИ — обобщённое название класса программных систем на основе искусственного интеллекта, способных создавать изображения по текстовому описанию, эскизу или другому входному сигналу. К этой категории относятся генеративные модели глубокого обучения, обученные на больших массивах графических данных и умеющие синтезировать новые картинки, а не просто обрабатывать существующие. Технология получила массовое распространение в конце 2020-х годов и применяется в дизайне, иллюстрации, рекламе, разработке игр и научной визуализации.

Принцип работы

Рисующие системы строятся на архитектурах генеративного моделирования. Ключевые из них:

  • Генеративно-состязательные сети (GAN) — состоят из генератора, создающего изображения, и дискриминатора, оценивающего их реалистичность; обучение идёт до тех пор, пока дискриминатор не перестаёт отличать сгенерированные картинки от настоящих.
  • Диффузионные модели — постепенно зашумляют изображение, а затем учатся обратному процессу: восстановлению картинки из шума по текстовому описанию. Именно диффузионные модели (Stable Diffusion, DALL-E, Midjourney) обеспечили прорыв в качестве генерации в 2022–2023 годах.
  • Трансформерные архитектуры — обрабатывают изображение как последовательность токенов (например, модели на основе VQ-VAE и авторегрессионных декодеров).

Входом обычно служит текстовый промпт на естественном языке. Текст кодируется в векторное представление (через CLIP-подобные модели), которое направляет процесс генерации. Пользователь может уточнять стиль, композицию, освещение, детализацию, а также задавать негативные промпты — то, чего на картинке быть не должно.

История

Первые заметные GAN-модели появились в 2014 году (работа Яна Гудфеллоу). К 2019–2021 годам GAN-системы вроде StyleGAN от NVIDIA учились генерировать портреты людей, которых не существует. Однако качественный скачок произошёл с приходом диффузионных моделей: в 2020 году исследователи Google опубликовали работу о диффузионных генераторах, а в 2022 году вышли DALL-E 2, Stable Diffusion и улучшенный Midjourney — все три обеспечили доступ широкой аудитории к генерации изображений.

В России разработками в этой области занимались несколько команд. В 2023–2024 годах были представлены отечественные диффузионные модели, обученные на русскоязычных подписях, в частности Kandinsky (компания «Сбер») и ряд исследовательских проектов академических лабораторий. Эти системы поддерживают русскоязычные промпты и учитывают особенности русской культуры в обучающих данных.

Возможности и ограничения

Современные рисующие модели умеют:

  • генерировать изображения в различных стилях — от фотографии до акварели и аниме;
  • редактировать существующие картинки по текстовой инструкции (inpainting, outpainting);
  • менять стиль при сохранении композиции (image-to-image);
  • создавать вариации и апскейлить изображения до высокого разрешения.

Типичные ограничения:

  • ошибки в анатомии (шесть пальцев, неправильные пропорции тела);
  • сложности с точной отрисовкой текста на изображении;
  • «усреднённость» стиля и отсутствие авторской логики композиции;
  • юридические вопросы: авторские права на обучающие данные и на сгенерированные изображения во многих странах остаются неурегулированными.

Применение

Рисующий ИИ используется в коммерческой иллюстрации и концепт-арте, где ускоряет предварительные этапы работы художника. В рекламе и маркетинге — для быстрого прототипирования визуала. В игровой индустрии — для генерации текстур, концептов окружения и персонажей. В образовании — как инструмент визуализации и объект изучения. Отдельное направление — генеративный дизайн в промышленности и архитектуре, где ИИ предлагает варианты форм и конструкций по заданным параметрам.

Этика и правовой статус

Дискуссия вокруг рисующего ИИ ведётся вокруг трёх узлов: авторские права художников, чьи работы использовались для обучения моделей; вопрос о том, считать ли сгенерированное изображение произведением; и проблема дипфейков — поддельных изображений реальных людей. В ряде стран идут судебные процессы художников против разработчиков моделей. В России правовое регулирование генеративного ИИ в 2024 году обсуждалось на уровне законодательных инициатив, в частности в контексте маркировки сгенерированного контента.

Источники:

  • Доклады и статьи о диффузионных моделях (Ho et al., 2020; Rombach et al., 2022)
  • Публикации NVIDIA о StyleGAN (Karras et al., 2019)
  • Материалы разработчиков Stable Diffusion, DALL-E, Midjourney
  • Публичные материалы компаний «Сбер» о модели Kandinsky
  • Обзорные статьи о генеративном ИИ в русскоязычных изданиях (Хабр, «Компьютерра»)
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru