Генеративные модели изображений людей¶
Генеративные модели изображений людей — класс нейросетей, создающих фотореалистичные изображения человеческих лиц и фигур, не существующих в реальности. Такие системы строят изображение попиксельно на основе обучающих выборок, обучаясь распределению реальных фотографий. Технология применяется в рекламе, кинематографии, дизайне и исследовательских целях, а также порождает дискуссии о достоверности визуальной информации.
¶Принцип работы
Генеративно-состязательные сети (GAN), предложенные Яном Гудфеллоу в 2014 году, стали первой массовой архитектурой для синтеза лиц. Сеть состоит из генератора, создающего изображение из случайного шума, и дискриминатора, различающего сгенерированные и реальные фотографии. В ходе соревнования генератор учится обманывать дискриминатора, и качество синтеза растёт.
В 2019 году лаборатория NVIDIA выпустила модель StyleGAN, которая позволила получать лица высокого разрешения с плавным контролем атрибутов — возраста, причёски, цвета кожи, выражения лица. StyleGAN и его развитие StyleGAN2 стали основой большинства «сайтов с фейковыми людьми» — например, проекта This Person Does Not Exist, где при каждом обновлении страницы генерируется новый несуществующий человек.
Диффузионные модели, ставшие основой Stable Diffusion (2022), DALL-E 2 и Midjourney, генерируют изображение через обратный процесс диффузии: из шума модель постепенно «вытаскивает» изображение за десятки шагов. Эти системы принимают текстовое описание (промпт) и создают изображение по нему, включая фотографии людей.
¶Качество и достоверность
Современные модели достигают уровня, при котором сгенерированное лицо трудно отличить от фотографии. Исследования показывают, что люди в тестах угадывают сгенерированные лица с точностью, близкой к случайной, хотя остаются маркеры — асимметрия ушей, артефакты зубов, неестественная текстура кожи.
Для борьбы с недостоверными изображениями разрабатываются детекторы синтеза, анализирующие артефакты генерации. Появляются стандарты водяных знаков и метаданных C2PA, фиксирующих происхождение изображения.
¶Применение
- Реклама и дизайн: сгенерированные модели заменяют фотосессии, снижая стоимость производства изображений.
- Кинематограф и игры: цифровые актёры и персонажи создаются на основе генеративных моделей.
- Медицина и наука: синтез данных для обучения диагностических систем без проблем приватности.
- Психология: исследования восприятия лиц и эмоций на синтетических стимулах.
¶Правовые и этические вопросы
Генерация изображений людей затрагивает вопросы авторского права, прав на собственный образ и распространения дипфейков — подделанных видео и фото с лицами реальных людей. В ряде стран, включая Россию, действуют нормы, ограничивающие использование чужого изображения без согласия и криминализирующие распространение порнографических дипфейков.
Источники:
- Goodfellow I. et al. Generative Adversarial Networks, 2014
- Karras T. et al. A Style-Based Generator Architecture for GANs (StyleGAN), 2019
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models, 2022
- This Person Does Not Exist — проект лаборатории NVIDIA
- Стандарт C2PA (Coalition for Content Provenance and Authenticity)