Открыть сервисСервис

Генерация изображений по картинке

Генерация изображений по картинке — это класс задач компьютерного зрения и искусственного интеллекта, при котором нейросеть создаёт новое изображение на основе входного изображения-условия (промпта-картинки). В отличие от текстовой генерации, где условие формулируется словами, здесь в качестве управляющего сигнала выступает сам визуальный контент: фотография, эскиз, схема или частично завершённый рисунок. Технология применяется для стилизации, редактирования, апскейла, перевода изображения в другой модальность (например, фото в аниме) и синтеза новых сцен с сохранением композиции.

Принцип работы

Современные системы генерации по картинке построены на архитектурах диффузионных моделей (diffusion models), которые в 2020-е годы вытеснили генеративно-состязательные сети (GAN) в задачах синтеза изображений высокого качества. Обучение диффузионной модели состоит из двух этапов: прямого — постепенное зашумление исходного изображения до чистого гауссова шума, и обратного — обучение сети убирать шум шаг за шагом, восстанавливая изображение.

Для генерации по картинке к базовой модели добавляется модуль условного контроля (control module), который «читает» входное изображение и передаёт его признаки в процесс генерации. Наиболее распространённые механизмы контроля:

  • ControlNet — отдельная ветвь сети, обученная извлекать из входного изображения карту признаков (контур, позу, глубину, сегментацию) и направлять её в основную модель через нулевые конволюции. Предложен исследователями Стэнфордского университета в 2023 году и стал стандартом де-факто.
  • IP-Adapter — модуль, преобразующий эмбеддинг входного изображения в набор «ключ-значений» (key-value tokens), которые ассоциируются с текстовым промптом через механизм cross-attention.
  • Image-to-image перевод (img2img) — базовый механизм, при котором входное изображение сначала зашумляется до определённого уровня (strength), а затем модель «дорисовывает» его, сохраняя общую композицию.
  • Вариационный автоэнкодер (VAE) — используется для кодирования картинки в латентное пространство, где и происходит генерация, что резко снижает вычислительные затраты.

Классификация задач

По характеру входного изображения и желаемого результата генерацию по картинке делят на несколько групп:

ЗадачаВходРезультат
СтилизацияФото + текстовый промптИзображение в указанном стиле
Апскейл (увеличение разрешения)Маленькое изображениеКрупное детализированное
РеставрацияПовреждённое фотоВосстановленное изображение
Сегментация-гидКарта сегментацииРеалистичное изображение
Поза-гидСкелетная разметка позыФигура в заданной позе
Перевод модальностиФотоАниме, рисунок, 3D-текстура
InpaintingИзображение с маскойИзображение с заменённой областью

История развития

Первые системы image-to-image переводов появились в 2017 году в работе Филиппа Изолы и коллег «Image-to-Image Translation with Conditional Adversarial Networks» (pix2pix), предложившей единую архитектуру для парных задач — от перевода карт в фото до сегментации. В 2018 году появился CycleGAN, позволивший обучать перевод без парных данных (например, «зима → лето»).

Революцию совершили диффузионные модели: Stable Diffusion (2022, Stability AI) открыла латентную диффузионную архитектуру с доступным весами, что породило экосистему пользовательских модификаций. В 2023 году вышли ControlNet и IP-Adapter, сделавшие контроль по картинке массовым. В 2024–2025 годах крупные лаборатории (OpenAI с DALL-E 3 и GPT-4o, Google с Imagen 3 и Gemini, Яндекс с «Шедеврум» и Kandinsky) интегрировали image-to-image генерацию в свои флагманские модели, добавив возможности точного редактирования по маске и референсу.

Применение

Технология получила широкое распространение в коммерческих и творческих сферах:

  • Графический дизайн и реклама — быстрая генерация вариантов макетов, стилизация продуктовых фото.
  • Игровая индустрия — создание текстур, концепт-артов, апскейл старых ассетов.
  • Кинематограф и анимация — предвизуализация, ротоскопия, генерация раскадровок.
  • Медицина — синтез синтетических данных для обучения диагностических моделей, аугментация медицинских снимков.
  • Архитектура — перевод эскизов в фотореалистичные рендеры.
  • Восстановление архивных фото — апскейл, раскрашивание, удаление повреждений.

Ограничения и этические вопросы

Технология сталкивается с рядом проблем. Модели склонны к «галлюцинациям» — добавлению несуществующих деталей, что критично для медицинских и научных применений. Существует вопрос авторских прав: системы обучены на миллионах изображений из интернета без явного согласия авторов, что привело к судебным искам против Stability AI, Midjourney и других компаний. Отдельную проблему представляет deepfake-генерация — подделка изображений реальных людей, что вынуждает регуляторов вводить обязательную маркировку синтетического контента (в России с 1 сентября 2024 года действует требование маркировать ИИ-контент).

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru