Технология дипфейк: создание и распознавание¶
Дипфейк (от англ. deep learning — глубокое обучение и fake — подделка) — технология синтеза изображения, аудио и видео на основе искусственных нейронных сетей, позволяющая создавать реалистичные поддельные материалы, в которых лицо, голос или действия человека заменяются или имитируются с высокой степенью достоверности. В отличие от традиционного видеомонтажа, дипфейки создаются автоматически алгоритмами, которые обучаются на больших массивах данных и способны генерировать контент, практически неотличимый от подлинного.
¶История развития
Основы технологии были заложены в 2014 году, когда исследователь Ян Гудфеллоу с коллегами предложил архитектуру генеративно-состязательных сетей (GAN). В такой системе две нейронные сети — генератор и дискриминатор — соревнуются друг с другом: первая создаёт изображения, вторая пытается отличить их от настоящих. В результате генератор постепенно учится производить всё более реалистичный контент.
Термин «дипфейк» появился в конце 2017 года, когда пользователь под псевдонимом Deepfakes разместил на платформе Reddit видео порнографического содержания с лицами известных актрис. Вскоре после этого сообщество было заблокировано, однако технология получила широкую огласку и стала активно развиваться.
Значительный прогресс произошёл в 2019–2022 годах благодаря появлению архитектур на основе автокодировщиков и методов переноса стиля. В 2022 году компания Stability AI выпустила открытую модель Stable Diffusion, способную генерировать изображения по текстовому описанию, что упростило создание фотореалистичных подделок. В 2023–2024 годах распространение получили алгоритмы, позволяющие синтезировать видео в реальном времени, что сделало технологию доступной для массового использования.
¶Технология создания
¶Основные методы
Современные дипфейки создаются с помощью нескольких подходов. Наиболее распространённый — использование автокодировщиков: модель обучается на тысячах фотографий целевого человека, выделяя характерные черты лица, а затем переносит их на видео с другим человеком.
Генеративно-состязательные сети позволяют достигать более высокого качества, однако требуют значительных вычислительных ресурсов. Для создания видео в реальном времени применяются нейронные сети на основе свёрточных архитектур, которые обрабатывают каждый кадр с учётом предыдущих.
Отдельное направление — синтез голоса. Модели текста-в-речь обучаются на записях голоса конкретного человека и способны воспроизводить его речь с характерными интонациями и особенностями произношения.
¶Необходимые данные
Для создания качественного дипфейка требуется от нескольких сотен до нескольких тысяч изображений или часов аудиозаписей целевого человека. Чем больше исходного материала, тем выше реалистичность результата. Современные алгоритмы способны работать и с ограниченным набором данных, но качество в таких случаях заметно снижается.
¶Применение
¶Позитивные сферы использования
Технология дипфейк находит применение в киноиндустрии для цифрового омоложения актёров, воссоздания образов умерших исполнителей и дублирования сцен. Например, в фильмах студии Lucasfilm технология использовалась для воссоздания образа актёра Питера Кушинга, скончавшегося до начала съёмок.
В образовании дипфейки применяются для создания виртуальных лекторов, говорящих на разных языках голосом и с внешностью реальных преподавателей. В медицине технология используется для моделирования течения заболеваний и обучения студентов.
В сфере развлечений дипфейки позволяют создавать развлекательный контент, например, подменять лица в популярных видеороликах. Некоторые музеи применяют технологию для «оживления» исторических личностей в экспозициях.
¶Злонамеренное использование
Основную озабоченность вызывает использование дипфейков для создания порнографических материалов без согласия изображённых лиц. По данным исследовательской компании Sensity AI, около 96 % всех дипфейков в интернете составляют именно такие видео.
Технология также применяется для распространения дезинформации: создаются фальшивые выступления политиков, поддельные новостные сюжеты и сфабрикованные доказательства. Известны случаи мошенничества, когда злоумышленники использовали синтезированный голос руководителя компании для отдачи распоряжений о переводах крупных сумм.
В России зафиксированы случаи использования дипфейков для получения доступа к банковским счетам: мошенники звонили жертвам голосом их родственников и просили перевести деньги.
¶Методы распознавания
¶Технические признаки
Дипфейки часто содержат характерные артефакты: неравномерное моргание, несоответствие освещения, искажения вокруг рта и глаз, неестественные движения головы. Алгоритмы глубокого обучения способны выявлять микродефекты, незаметные человеческому глазу, например, несоответствие частоты пульса, отражающейся в изменении цвета кожи.
Современные исследовательские центры разрабатывают детекторы, анализирующие пространственно-временные характеристики видео. Такие системы обучаются на больших наборах подлинных и поддельных записей и достигают точности распознавания свыше 95 %.
¶Организационные меры
Крупные интернет-платформы внедряют автоматические системы фильтрации дипфейк-контента. В России действует закон, обязывающий социальные сети выявлять и блокировать материалы, созданные с использованием технологий синтеза, если они содержат признаки нарушения законодательства.
Для борьбы с мошенничеством банки внедряют многофакторную аутентификацию, не полагающуюся исключительно на биометрические данные. Разрабатываются стандарты цифровой аутентификации, позволяющие подтверждать подлинность видеозаписей с помощью криптографических меток.
¶Правовое регулирование
В России распространение дипфейков, нарушающее права граждан, подпадает под действие законодательства о персональных данных и о защите чести и достоинства. Создание и распространение поддельных материалов с целью опорочить человека может квалифицироваться как клевета (статья 128.1 Уголовного кодекса РФ). Использование дипфейков для мошенничества влечёт уголовную ответственность по соответствующим статьям.
В 2020 году в России вступили в силу поправки к закону «Об информации», обязывающие владельцев сайтов удалять дипфейк-контент по требованию изображённых в нём лиц. Аналогичные нормы приняты в Китае, Европейском союзе и ряде штатов США.
¶Критика и этические аспекты
Основная этическая проблема дипфейков связана с отсутствием согласия человека на использование его изображения и голоса. Технология создаёт угрозу приватности и может использоваться для манипуляции общественным мнением. Исследователи отмечают, что распространение дипфейков подрывает доверие к подлинным видеозаписям как доказательствам в суде и источникам информации.
В ответ на эти вызовы разрабатываются технические стандарты маркировки синтетического контента. Крупные технологические компании объявили о внедрении цифровых водяных знаков, позволяющих отличать сгенерированные материалы от подлинных.
¶Источники
- Гудфеллоу Я. и др. Генеративно-состязательные сети // Достижения в области нейронных информационных систем, 2014.
- Sensity AI. Отчёт о состоянии дипфейк-технологий, 2023.
- Федеральный закон «Об информации, информационных технологиях и о защите информации» с изменениями 2020 года.
- Westerlund M. Появление дипфейк-технологий и их последствия для бизнеса и общества // Журнал бизнес-исследований, 2019.
- Уголовный кодекс Российской Федерации, статья 128.1.