Gemini — семейство ИИ-моделей Google¶
Gemini — семейство многофункциональных (мультимодальных) больших языковых моделей (LLM), разработанных компанией Google DeepMind. Модели способны работать с текстом, изображениями, аудио, видеоматериалами и компьютерным кодом, выполняя задачи генерации, анализа, перевода и рассуждения. Gemini является преемником модели LaMDA и серии PaLM и с 2023 года позиционируется Google как основная платформа искусственного интеллекта для потребительских и корпоративных продуктов.
¶История и анонс
Разработка Gemini велась подразделением Google DeepMind, образованным в апреле 2023 году объединением Google Brain и DeepMind. 6 декабря 2023 года Google официально анонсировала семейство моделей Gemini 1.0 в трёх вариантах: Nano (для локального запуска на мобильных устройствах), Pro (универсальная модель) и Ultra (наиболее мощная версия). По заявлению компании, Gemini Ultra на момент выхода превзошла GPT-4 OpenAI по ряду бенчмарков академического и профессионального уровня, включая тест MMLU.
В феврале 2024 года вышла обновлённая версия Gemini 1.5 Pro, основанная на архитектуре Transformer с механизмом «миксированной экспертизы» (Mixture-of-Experts, MoE), что позволило увеличить контекстное окно до 1 миллиона токенов, а в дальнейшем — до 2 миллионов. В декабре 2024 года представлена линейка Gemini 2.0, ориентированная на «агентные» сценарии — автономные системы, способные выполнять многошаговые задачи с использованием инструментов.
¶Архитектура и возможности
Gemini — мультимодальная модель «от начала до конца» (native multimodal): она обучалась одновременно на данных разных типов, а не путём соединения отдельных модалей. Поддерживаются текстовые запросы, загрузка изображений и PDF-документов, анализ видео и аудио, генерация изображений (через встроенную модель Imagen), синтез речи и написание программного кода.
Ключевые технические особенности:
- Контекстное окно — до 2 млн токенов в Gemini 1.5 Pro и 2.0, что позволяет обрабатывать часы видео, сотни тысяч слов или десятки тысяч строк кода за один запрос.
- Архитектура MoE — модель разбивается на множество «экспертов», из которых для каждого токена активируется лишь часть, что снижает вычислительные затраты.
- Режим Thinking — в моделях Gemini 2.0 Flash Thinking модель «рассуждает» перед ответом, пошагово анализируя задачу, что повышает точность на логических и математических бенчмарках.
¶Продуктовая линейка
| Уровень | Назначение |
|---|---|
| Gemini Nano | Локальная работа на смартфонах (Pixel, Samsung Galaxy S24 и новее) |
| Gemini Flash | Быстрая и дешёвая модель для массовых задач |
| Gemini Pro | Универсальная модель для сложных запросов |
| Gemini Ultra / Advanced | Максимальная производительность, доступ по подписке |
Доступ к моделям осуществляется через веб-интерфейс (gemini.google.com), мобильные приложения, API Google AI Studio и платформу Vertex AI для корпоративных клиентов. В России прямой доступ к сервису Gemini официально не предоставляется: Google ограничила выход продуктов на российский рынок после 2022 года, однако модели доступны через облачные API для разработчиков из ряда других регионов.
¶Интеграция в продукты Google
С 2023 года Gemini стала основой поисковой системы Google: функция SGE (Search Generative Experience), позднее переименованная в AI Overviews, генерирует сводные ответы поверх результатов поиска. Модель интегрирована в Gmail (функция «Help me write»), Google Docs, Google Sheets, Google Slides, сервис Google Translate, ассистента Google Assistant (его преемник — ассистент Gemini), а также в операционную систему Android. В 2024 году Google представила проект Astra — прототип ассистента, способного «видеть» через камеру смартфона и отвечать на вопросы о происходящем в реальном времени.
¶Сравнение с конкурентами
Основными конкурентами Gemini являются GPT-4o и GPT-o1 от OpenAI, Claude от Anthropic, Llama от Meta (организация признана экстремистской, деятельность запрещена в РФ) и модели семейства YandexGPT и GigaChat в России. По результатам независимых бенчмарков (MMLU, HumanEval, MMMU, GPQA) Gemini 1.5 Pro и 2.0 конкурируют с GPT-4o, заметно превосходя их по длине контекстного окна, но уступая в некоторых сценариях рассуждения и генерации кода.
¶Критика
После декабрьского анонса 2023 года Gemini подвергалась критике за ошибки в ответах: модель демонстрировала тенденцию к «галлюцинациям» (генерации недостоверных фактов), а в феврале 2024 года Google приостановила функцию генерации изображений персонажей после жалоб на исторически неточное изображение основателей США и другие случаи «политкорректных» искажений. В 2024 году ряд изданий сообщал о случаях, когда Gemini отказывалась отвечать на запросы, касающиеся политических лидеров России, что Google объясняла ограничениями по санкционному законодательству.
Источники:
- Google Blog. Introducing Gemini: our largest and most capable AI model (декабрь 2023)
- Google DeepMind. Gemini 1.5: Unlocking multimodal understanding across millions of tokens
- Google Blog. Gemini 2.0: New frontier for agentic AI (декабрь 2024)
- Репортажи Reuters и The Verge о запуске и развитии Gemini
- Документация Google AI Studio и Vertex AI
