Открыть сервисСервис

Генерация изображений нейросетью по текстовому запросу

Генерация изображений нейросетью по текстовому запросу — процесс создания цифровых изображений с помощью искусственных нейронных сетей, в котором пользователь формулирует текстовое описание (промпт), а модель преобразует его в растровое изображение. Технология относится к классу генеративных моделей глубокого обучения и получила массовое распространение с конца 2022 года.

История

Первые системы генерации изображений по тексту появились в начале 2010-х годов и создавали грубые, расплывчатые картинки. Существенный прорыв произошёл в 2021 году, когда исследователи OpenAI представили модель DALL-E, а затем DALL-E 2 (2022). В 2022 году компания Stability AI выпустила открытую модель Stable Diffusion, что сделало технологию доступной для массового использования на обычных потребительских видеокартах. В том же году Google представила Imagen и Parti, а в 2023 году вышла DALL-E 3 от OpenAI, интегрированная в ChatGPT.

Принцип работы

Современные генеративные модели построены на архитектуре трансформеров и диффузионных моделей. Диффузионный подход заключается в том, что модель обучается на двух этапах: на прямом процессе изображение постепенно «зашумляется», а на обратном — нейросеть учится восстанавливать чистое изображение из шума, ориентируясь на текстовое описание.

Текстовый запрос (промпт) обрабатывается текстовым энкодером — обычно языковой моделью, преобразующей слова в числовые векторы. Эти векторы направляют процесс генерации, определяя сюжет, стиль, композицию и детали изображения. Пользователь может уточнять запрос, добавляя указания на художественный стиль, освещение, ракурс, качество и другие параметры.

Основные модели

МодельРазработчикГодОсобенности
DALL-E 2 / DALL-E 3OpenAI2022 / 2023Интеграция с ChatGPT, высокое качество
Stable DiffusionStability AI2022Открытые веса, работа на потребительских GPU
MidjourneyMidjourney, Inc.2022Акцент на художественное качество
Imagen / PartiGoogle2022Высокая детализация текста в изображении
KandinskyСбер2023Русскоязычная модель с поддержкой русского промпта

Применение

Технология используется в иллюстрации, рекламе, дизайне, архитектурной визуализации, создании концепт-артов для игр и кино, обучении и научных публикациях. В России генеративные модели применяются в медиа, маркетинге и образовании; отдельные сервисы работают на базе отечественных разработок, включая Kandinsky от Сбера и модели от Яндекса.

Правовые и этические вопросы

Генерация изображений по запросу порождает ряд правовых вопросов: авторство сгенерированных изображений, использование чужих работ в обучающих данных моделей, создание дипфейков и дезинформации. В ряде стран, включая Россию, действуют нормы, обязывающие помечать сгенерированные ИИ-изображения. Сами компании-разработчики внедряют фильтры, запрещающие генерацию изображений реальных людей, насилия и других запрещённых категорий.

Источники:

Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru