Генерация изображений нейросетью по текстовому запросу¶
Генерация изображений нейросетью по текстовому запросу — процесс создания цифровых изображений с помощью искусственных нейронных сетей, в котором пользователь формулирует текстовое описание (промпт), а модель преобразует его в растровое изображение. Технология относится к классу генеративных моделей глубокого обучения и получила массовое распространение с конца 2022 года.
¶История
Первые системы генерации изображений по тексту появились в начале 2010-х годов и создавали грубые, расплывчатые картинки. Существенный прорыв произошёл в 2021 году, когда исследователи OpenAI представили модель DALL-E, а затем DALL-E 2 (2022). В 2022 году компания Stability AI выпустила открытую модель Stable Diffusion, что сделало технологию доступной для массового использования на обычных потребительских видеокартах. В том же году Google представила Imagen и Parti, а в 2023 году вышла DALL-E 3 от OpenAI, интегрированная в ChatGPT.
¶Принцип работы
Современные генеративные модели построены на архитектуре трансформеров и диффузионных моделей. Диффузионный подход заключается в том, что модель обучается на двух этапах: на прямом процессе изображение постепенно «зашумляется», а на обратном — нейросеть учится восстанавливать чистое изображение из шума, ориентируясь на текстовое описание.
Текстовый запрос (промпт) обрабатывается текстовым энкодером — обычно языковой моделью, преобразующей слова в числовые векторы. Эти векторы направляют процесс генерации, определяя сюжет, стиль, композицию и детали изображения. Пользователь может уточнять запрос, добавляя указания на художественный стиль, освещение, ракурс, качество и другие параметры.
¶Основные модели
| Модель | Разработчик | Год | Особенности |
|---|---|---|---|
| DALL-E 2 / DALL-E 3 | OpenAI | 2022 / 2023 | Интеграция с ChatGPT, высокое качество |
| Stable Diffusion | Stability AI | 2022 | Открытые веса, работа на потребительских GPU |
| Midjourney | Midjourney, Inc. | 2022 | Акцент на художественное качество |
| Imagen / Parti | 2022 | Высокая детализация текста в изображении | |
| Kandinsky | Сбер | 2023 | Русскоязычная модель с поддержкой русского промпта |
¶Применение
Технология используется в иллюстрации, рекламе, дизайне, архитектурной визуализации, создании концепт-артов для игр и кино, обучении и научных публикациях. В России генеративные модели применяются в медиа, маркетинге и образовании; отдельные сервисы работают на базе отечественных разработок, включая Kandinsky от Сбера и модели от Яндекса.
¶Правовые и этические вопросы
Генерация изображений по запросу порождает ряд правовых вопросов: авторство сгенерированных изображений, использование чужих работ в обучающих данных моделей, создание дипфейков и дезинформации. В ряде стран, включая Россию, действуют нормы, обязывающие помечать сгенерированные ИИ-изображения. Сами компании-разработчики внедряют фильтры, запрещающие генерацию изображений реальных людей, насилия и других запрещённых категорий.
Источники:
- Статьи OpenAI о моделях DALL-E и DALL-E 3
- Технические публикации Stability AI по Stable Diffusion
- Материалы Google Research по моделям Imagen и Parti
- Пресс-релизы Сбера о нейросети Kandinsky