Открыть сервисСервис

GPT — семейство языковых моделей OpenAI

GPT (англ. Generative Pre-trained Transformer, «генеративный предварительно обученный трансформер») — семейство больших языковых моделей (LLM), разрабатываемых американской компанией OpenAI. Модели построены на архитектуре трансформер и обучены предсказывать следующий токен в тексте, что позволяет им генерировать связные тексты, отвечать на вопросы, переводить, программировать и решать другие языковые задачи. Наиболее известным продуктом на базе GPT стал чат-бот ChatGPT, запущенный в ноябре 2022 года.

Архитектура и принцип работы

GPT относится к классу автокодированных языковых моделей (decoder-only transformer). Ключевые особенности:

  • Токенизация. Текст разбивается на токены — подсловные единицы, использующие метод Byte Pair Encoding (BPE). Словарь GPT-3 насчитывает около 50 000 токенов.
  • Трансформер. Модель состоит из последовательности слоёв с механизмом самовнимания (self-attention), который позволяет учитывать контекст всего предшествующего текста при предсказании следующего токена.
  • Предобучение. Модель обучается на большом корпусе текстов (книги, сайты, статьи) методом языкового моделирования — предсказанием следующего слова.
  • Дообучение с подкреплением (RLHF). После предобучения модель уточняется на диалогах с участием человека и оптимизируется методом обучения с подкреплением через модель предпочтений, что делает ответы более полезными и безопасными.

Поколения моделей

МодельГодПараметрыПримечание
GPT-12018117 млнПервая модель, статья «Improving Language Understanding by Generative Pre-Training»
GPT-220191,5 млрдИзначально ограниченно выпущена из-за опасений злоупотреблений
GPT-32020175 млрдДемонстрация возможностей few-shot обучения
GPT-42023не раскрытоМультимодная модель (текст + изображения)
GPT-4o2024не раскрытоМультимодная модель «omni», работающая в реальном времени

История

OpenAI основана в 2015 году как некоммерческая организация; в 2019 году компания преобразована в прибыльную структуру с дочерней коммерческой. Первая модель GPT опубликована в июне 2018 года. GPT-2 представлена в феврале 2019 года; её полная версия из-за рисков генерации дезинформации выпущена лишь в ноябре того же года. GPT-3 показана в июне 2020 года и открыта через API.

В ноябре 2022 года OpenAI выпустила ChatGPT — чат-интерфейс поверх GPT-3.5, который за два месяца набрал 100 млн пользователей и стал одним из самых быстрорастущих потребительских приложений в истории. В марте 2023 года вышел GPT-4, в мае 2024 года — GPT-4o.

Применение

Модели GPT используются в чат-ботах, поисковых системах (например, в Bing Search от Microsoft, инвестировавшей в OpenAI), генерации кода (GitHub Copilot), образовании, переводе, создании контента и научных исследованиях. API-доступ к моделям предоставляется по платной подписке.

Критика и ограничения

К числу известных проблем моделей GPT относятся:

  • Галлюцинации — уверенная генерация фактически неверной информации.
  • Ограничение контекста. Длина контекста GPT-3 составляла 2048–4096 токенов; у GPT-4 она увеличена до 8–128 тыс. токенов в зависимости от версии.
  • Энергозатраты. Обучение больших моделей требует значительных вычислительных ресурсов и электроэнергии.
  • Этические вопросы. Обсуждаются влияние на рынок труда, авторские права на обучающие данные, предвзятость моделей и риски распространения недостоверного контента.

В России и ряде других стран обсуждаются вопросы регулирования ИИ и ограничений на использование зарубежных моделей в госсекторе.

Источники

  • Radford A. et al. Improving Language Understanding by Generative Pre-Training. OpenAI, 2018.
  • Brown T. et al. Language Models are Few-Shot Learners. NeurIPS, 2020.
  • OpenAI. Introducing ChatGPT. OpenAI Blog, 30 ноября 2022.
  • OpenAI. GPT-4 Technical Report. arXiv, 2023.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru