Мультимодальная модель¶
Мультимодальная — модель искусственного интеллекта, способная обрабатывать и генерировать данные нескольких модальностей одновременно: текст, изображения, аудио, видео и код. В отличие от одно модальных систем, работающих только с одним типом данных, мультимодальные модели строят общее представление о мире, объединяя сигналы из разных источников, что приближает их к человеческому восприятию.
¶История развития
Ранние системы ИИ были узкоспециализированными: распознавание речи, классификация изображений, машинный перевод существовали как отдельные задачи. Переломным стал 2021 год, когда OpenAI выпустила модель CLIP, обученную сопоставлять изображения и текстовые описания в общем векторном пространстве. В 2022–2023 годах появились генеративные мультимодальные системы: DALL-E 2, Stable Diffusion, а затем и GPT-4 (2023), способный принимать на вход и текст, и изображения.
В России разработкой мультимодальных моделей занимаются Сбер (семейство Kandinsky для генерации изображений, GigaChat), Яндекс (YandexGPT, YandexART), а также МФТИ и лаборатории при ведущих вузах. Государственная программа «Искусственный интеллект» предусматривает создание отечественных больших языковых и мультимодальных моделей.
¶Принцип работы
Архитектура мультимодальной модели обычно включает три компонента:
- Энкодеры модальностей — отдельные сети для каждого типа данных (текстовый трансформер, свёрточная сеть или ViT для изображений, аудиоэнкодер).
- Слой объединения (fuser) — механизм, сопоставляющий представления разных модальностей в общем пространстве. Часто используется механизм внимания (cross-attention).
- Декодер — генерирует ответ в требуемой модальности.
Ключевая идея — приводить разнородные данные к единому векторному представлению, где близкие по смыслу текст и изображение оказываются рядом. Обучение идёт на парных датасетах (описание — картинка, субтитры — видео) и через RLHF.
¶Классификация
| Тип | Вход | Выход | Примеры |
|---|---|---|---|
| Понимающие | текст + изображение | текст | GPT-4V, GigaChat Vision |
| Генеративные | текст | изображение | Kandinsky, DALL-E, YandexART |
| Речевые | аудио + текст | аудио/текст | Whisper, голосовые ассистенты |
| Видеомодели | видео + текст | текст/видео | Gemini, Sora |
¶Применение
- Виртуальные ассистенты — анализ скриншотов, документов, ответы на вопросы по изображениям.
- Медицина — сопоставление описаний симптомов и снимков МРТ, КТ.
- Автономный транспорт — объединение данных камер, радаров и LiDAR.
- Образование — разбор рисунков, чертежей, рукописных решений.
- Промышленность — контроль качества по фото и текстовым регламентам.
¶Ограничения
Мультимодальные модели подвержены «галлюцинациям» — генерации правдоподобных, но ложных утверждений, в том числе о содержании изображений. Точность сильно зависит от качества обучающих пар. Вычислительная стоимость обучения на порядок выше, чем у текстовых моделей. Существуют этические вопросы: обучение на изображениях без согласия авторов, генерация дипфейков.