Открыть сервисСервис

Нейросеть для генерации изображений

Нейросеть для генерации картинки — это программа на основе искусственного нейронного сети, обученная создавать изображения по текстовому описанию (промпту) или другому входному сигналу. К подобным системам относятся генеративные модели, построенные на архитектурах трансформеров и диффузионных моделей, — в частности, DALL-E, Midjourney, Stable Diffusion, Kandinsky, «Шедеврум» и другие. Технология применяется в дизайне, рекламе, медицине, образовании и разработке игр, а также вызывает дискуссии о правах на интеллектуальную собственность и достоверности изображений.

Принцип работы

Генеративные модели изображений строят картинку «с нуля», а не ищут её в базе данных. Обучение происходит на огромных наборах изображений с подписями — обычно сотнях миллионов пар «фотография + текстовое описание». Модель учится связывать слова и их комбинации с визуальными признаками: объектами, цветами, композицией, стилем.

Наибольшее распространение получили два подхода:

  • Диффузионные модели. Обучение строится на постепенном зашумлении изображения и обратном процессе его восстановления. На этапе генерации модель начинает со случайного шума и шаг за шагом «вытаскивает» из него картинку, соответствующую текстовому описанию. Так работают Stable Diffusion, DALL-E 2/3, Midjourney, Kandinsky.
  • Генеративные состязательные сети (GAN). Две нейросети — генератор и дискриминатор — соревнуются друг с другом: первая создаёт изображения, вторая оценивает их реалистичность. GAN-модели (например, StyleGAN) широко применяются для генерации лиц и стилизации.

Текстовая часть системы обычно основана на мультимодальных трансформерах, которые преобразуют промпт в числовое представление, понятное генеративной модели.

Ключевые архитектуры

Stable Diffusion

Открытая диффузионная модель, разработанная компанией Stability AI совместно с исследователями из LMU Munich и Runway. Доступна свободно, может работать на потребительских видеокартах благодаря латентному пространству (модель обучается не на пикселях, а на сжатом представлении изображения). Стала основой для множества сторонних инструментов и сообщества моделей.

DALL-E

Серия моделей OpenAI: DALL-E (2021), DALL-E 2 (2022), DALL-E 3 (2023). DALL-E 2 построен на архитектуре CLIP и диффузионной модели, DALL-E 3 — на улучшенном трансформере. Интегрирован в ChatGPT.

Midjourney

Коммерческий сервис, известный высокой художественной выразительностью результатов. Изначально работал через интерфейс Discord, позднее получил веб-интерфейс. Модель закрыта, веса не опубликованы.

Kandinsky

Российская генеративная модель, разработанная компанией «Сбер» (Сбер AI). Открытая, с русскоязычным интерфейсом и поддержкой русских промптов. Версии Kandinsky 2.1, 2.2 и 3.0 опубликованы под свободными лицензиями.

«Шедеврум»

Сервис генерации изображений от «Яндекса», работающий на базе собственной диффузионной модели. Доступен пользователям без специальных технических навыков, интегрирован в продукты компании.

Применение

  • Дизайн и реклама. Быстрое создание иллюстраций, макетов, визуализаций идей.
  • Игры и кино. Генерация концепт-артов, текстур, персонажей, раскадровок.
  • Медицина. Синтез медицинских изображений для обучения моделей диагностики, аугментация наборов данных.
  • Образование. Создание наглядных материалов, иллюстраций к учебным текстам.
  • Наука. Моделирование молекул, кристаллов, астрономических наблюдений (например, модели на основе диффузии для предсказания структуры белков).

Этические и правовые вопросы

Генеративные модели обучаются на данных, собранных из интернета, что порождает споры о нарушении авторских прав: художники указывают, что их работы использовались без согласия. В ряде стран идут судебные процессы по этому поводу.

Другая проблема — дипфейки и дезинформация: синтезированные изображения могут имитировать реальных людей и события. В России действует закон, обязывающий маркировать сгенерированные ИИ изображения и видео особым цифровым знаком.

Отдельный вопрос — предвзятость моделей: если обучающие данные содержат стереотипы, модель воспроизводит их в результатах.

Источники:

  • Goodfellow I. et al. Generative Adversarial Networks // Advances in Neural Information Processing Systems, 2014.
  • Ho J., Jain A., Abbeel P. Denoising Diffusion Probabilistic Models // NeurIPS, 2020.
  • Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models // CVPR, 2022.
  • Radford A. et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP) // ICML, 2021.
  • Сайты Stability AI, OpenAI, Midjourney, «Сбер» (Kandinsky), «Яндекс» («Шедеврум»).
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru