Открыть сервисСервис

Gemini — семейство ИИ-моделей Google

Gemini — семейство многофункциональных (мультимодальных) больших языковых моделей (LLM), разработанных компанией Google DeepMind. Модели способны работать с текстом, изображениями, аудио, видеоматериалами и компьютерным кодом, выполняя задачи генерации, анализа, перевода и рассуждения. Gemini является преемником модели LaMDA и серии PaLM и с 2023 года позиционируется Google как основная платформа искусственного интеллекта для потребительских и корпоративных продуктов.

История и анонс

Разработка Gemini велась подразделением Google DeepMind, образованным в апреле 2023 году объединением Google Brain и DeepMind. 6 декабря 2023 года Google официально анонсировала семейство моделей Gemini 1.0 в трёх вариантах: Nano (для локального запуска на мобильных устройствах), Pro (универсальная модель) и Ultra (наиболее мощная версия). По заявлению компании, Gemini Ultra на момент выхода превзошла GPT-4 OpenAI по ряду бенчмарков академического и профессионального уровня, включая тест MMLU.

В феврале 2024 года вышла обновлённая версия Gemini 1.5 Pro, основанная на архитектуре Transformer с механизмом «миксированной экспертизы» (Mixture-of-Experts, MoE), что позволило увеличить контекстное окно до 1 миллиона токенов, а в дальнейшем — до 2 миллионов. В декабре 2024 года представлена линейка Gemini 2.0, ориентированная на «агентные» сценарии — автономные системы, способные выполнять многошаговые задачи с использованием инструментов.

Архитектура и возможности

Gemini — мультимодальная модель «от начала до конца» (native multimodal): она обучалась одновременно на данных разных типов, а не путём соединения отдельных модалей. Поддерживаются текстовые запросы, загрузка изображений и PDF-документов, анализ видео и аудио, генерация изображений (через встроенную модель Imagen), синтез речи и написание программного кода.

Ключевые технические особенности:

  • Контекстное окно — до 2 млн токенов в Gemini 1.5 Pro и 2.0, что позволяет обрабатывать часы видео, сотни тысяч слов или десятки тысяч строк кода за один запрос.
  • Архитектура MoE — модель разбивается на множество «экспертов», из которых для каждого токена активируется лишь часть, что снижает вычислительные затраты.
  • Режим Thinking — в моделях Gemini 2.0 Flash Thinking модель «рассуждает» перед ответом, пошагово анализируя задачу, что повышает точность на логических и математических бенчмарках.

Продуктовая линейка

УровеньНазначение
Gemini NanoЛокальная работа на смартфонах (Pixel, Samsung Galaxy S24 и новее)
Gemini FlashБыстрая и дешёвая модель для массовых задач
Gemini ProУниверсальная модель для сложных запросов
Gemini Ultra / AdvancedМаксимальная производительность, доступ по подписке

Доступ к моделям осуществляется через веб-интерфейс (gemini.google.com), мобильные приложения, API Google AI Studio и платформу Vertex AI для корпоративных клиентов. В России прямой доступ к сервису Gemini официально не предоставляется: Google ограничила выход продуктов на российский рынок после 2022 года, однако модели доступны через облачные API для разработчиков из ряда других регионов.

Интеграция в продукты Google

С 2023 года Gemini стала основой поисковой системы Google: функция SGE (Search Generative Experience), позднее переименованная в AI Overviews, генерирует сводные ответы поверх результатов поиска. Модель интегрирована в Gmail (функция «Help me write»), Google Docs, Google Sheets, Google Slides, сервис Google Translate, ассистента Google Assistant (его преемник — ассистент Gemini), а также в операционную систему Android. В 2024 году Google представила проект Astra — прототип ассистента, способного «видеть» через камеру смартфона и отвечать на вопросы о происходящем в реальном времени.

Сравнение с конкурентами

Основными конкурентами Gemini являются GPT-4o и GPT-o1 от OpenAI, Claude от Anthropic, Llama от Meta (организация признана экстремистской, деятельность запрещена в РФ) и модели семейства YandexGPT и GigaChat в России. По результатам независимых бенчмарков (MMLU, HumanEval, MMMU, GPQA) Gemini 1.5 Pro и 2.0 конкурируют с GPT-4o, заметно превосходя их по длине контекстного окна, но уступая в некоторых сценариях рассуждения и генерации кода.

Критика

После декабрьского анонса 2023 года Gemini подвергалась критике за ошибки в ответах: модель демонстрировала тенденцию к «галлюцинациям» (генерации недостоверных фактов), а в феврале 2024 года Google приостановила функцию генерации изображений персонажей после жалоб на исторически неточное изображение основателей США и другие случаи «политкорректных» искажений. В 2024 году ряд изданий сообщал о случаях, когда Gemini отказывалась отвечать на запросы, касающиеся политических лидеров России, что Google объясняла ограничениями по санкционному законодательству.

Источники:

  • Google Blog. Introducing Gemini: our largest and most capable AI model (декабрь 2023)
  • Google DeepMind. Gemini 1.5: Unlocking multimodal understanding across millions of tokens
  • Google Blog. Gemini 2.0: New frontier for agentic AI (декабрь 2024)
  • Репортажи Reuters и The Verge о запуске и развитии Gemini
  • Документация Google AI Studio и Vertex AI
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru