Открыть сервисСервис

Генеративное изображение с помощью ИИ

Генеративное изображение с помощью ИИ — это создание изображений нейронными сетями по текстовому описанию (промпту) или другому входному сигналу. Технология относится к классу генеративных моделей глубокого обучения и получила массовое распространение с 2022 года, когда вышли публичные сервисы вроде DALL-E 2, Stable Diffusion и Midjourney.

Принцип работы

Большинство современных систем генерации изображений построены на архитектуре диффузионных моделей. Обучение состоит из двух этапов:

  1. Прямой процесс — к реальному изображению постепенно добавляется гауссов шум, пока картинка не превратится в случайный шум.
  2. Обратный процесс — модель учится удалять шум шаг за шагом, восстанавливая изображение.

Текстовое описание кодируется отдельным текстовым энкодером (чаще всего на основе трансформера CLIP), и его векторное представление направляет процесс генерации. В результате модель «вытаскивает» из случайного шума картинку, соответствующую описанию.

Ключевые компоненты системы:

Основные модели и сервисы

МодельРазработчикГод выходаОсобенности
DALL-E 2 / 3OpenAI2022 / 2023Интеграция с ChatGPT, высокое качество текста на картинках
Stable DiffusionStability AI2022Открытые веса, работает локально на потребительских GPU
MidjourneyMidjourney Inc.2022Художественная стилизация, доступ через Discord
KandinskyСбер2022Русскоязычная модель, открытые веса
ШедеврумЯндекс2023Сервис на базе собственной диффузионной модели

В России разработаны и другие системы: у Яндекса есть диффузионная модель, интегрированная в поиск и редактор фото; Сбер выпустил серию моделей Kandinsky, поддерживающих русский язык промптов без внешнего перевода.

Способы управления генерацией

Помимо текстового описания, результат можно корректировать дополнительными приёмами:

  • Негативный промпт — перечисление того, что не должно попасть на картинку («размытость, лишние пальцы, низкое качество»).
  • ControlNet — дополнение к Stable Diffusion, позволяющее задать позу человека, контуры сцены или карту глубины.
  • Img2img — генерация на основе существующего изображения с заданной силой преобразования.
  • Inpainting — перерисовка отдельной области картинки с сохранением остальной части.
  • Seed — фиксация случайного числа для воспроизводимого результата.

Применение

Генеративные изображения используются в иллюстрации, рекламе, дизайне, геймдеве (создание концептов и текстур), кинематографе (раскадровка, превизуализация) и образовании. В России технологии применяются в медиа, маркетинге и образовательных проектах; крупные компании встраивают генерацию в свои продукты — например, Яндекс добавил функцию создания изображений в поисковую выдачу и редактор.

Ограничения и этические вопросы

Текущие модели склонны к ошибкам в анатомии (лишние пальцы, искажённые уши), плохо воспроизводят точный текст на изображении и иногда «галлюцинируют» детали. Обучение происходит на больших датасетах, собранных из интернета, что вызывает споры о правах авторов изображений. Отдельную проблему представляет генерация дипфейков — подделок с лицами реальных людей, что привело к правовым ограничениям в ряде стран.

История

До диффузионных моделей использовались GAN (генеративно-состязательные сети), показавшие первые убедительные результаты генерации лиц (проект This Person Does Not Exist, 2019). В 2021 году OpenAI представила DALL-E, работавшую на трансформерной архитектуре, а в 2022 году диффузионные модели вытеснили GAN благодаря открытому релизу Stable Diffusion и высокому качеству Midjourney.

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru