Открыть сервисСервис

GPT без ограничений: чат-боты без фильтров

GPT без ограничений — обозначение, применяемое к языковым моделям на основе архитектуры GPT (Generative Pre-trained Transformer), работающим без встроенных ограничений контента: без фильтров запрещённых тем, отказов в ответах на чувствительные вопросы и систематического ограничения генерации. Такие модели противопоставляются «безопасным» версиям, в которых разработчики внедряют фильтры, RLHF-обучение и правила модерации.

Происхождение термина

Термин получил распространение в 2022—2023 годах после выхода ChatGPT и последующих моделей GPT-3.5 и GPT-4. Пользователи столкнулись с тем, что официальные версии отказываются отвечать на ряд вопросов: о создании вредоносного ПО, об оружии, о нелегальной деятельности, а также просят пользователя уточнить «безопасный» контекст. В ответ на это в открытых сообществах (Reddit, GitHub, Telegram) начали появляться инструкции по «разблокировке» модели — через промпты вида «DAN» (Do Anything Now), подмену системных сообщений и тонкие настройки.

Виды «без ограничений» моделей

Официальные модели с обходом ограничений

Речь идёт о моделях OpenAI, Anthropic, Google и других, где пользователь пытается обойти встроенные фильтры с помощью промпт-инжиниринга. Сюда относятся:

  • DAN-промпты — инструкции, заставляющие модель «играть роль» неограниченного ассистента.
  • Jailbreak-техники — обход системных ограничений через подмену контекста, выдуманные сценарии, кодирование запроса.
  • Локальные запуски весов — скачивание открытых весов моделей (например, LLaMA, Mistral, GPT-2) и запуск без фильтров на собственном оборудовании.

Модели, изначально без фильтров

Некоторые разработчики сознательно выпускают модели без ограничений контента. К ним относятся:

  • Vicuna, WizardLM, OpenHermes — дообученные версии открытых моделей, где сняты многие ограничения.
  • Pygmalion — модель, оптимизированная для ролевых диалогов без цензуры.
  • Ряд моделей на платформах вроде Hugging Face, где фильтры отсутствуют по умолчанию.

Технические аспекты

Ограничения в GPT-моделях реализуются на нескольких уровнях:

  1. Обучение RLHF — модель учится отказывать от «опасных» запросов.
  2. Системные промпты — скрытые инструкции, задающие поведение.
  3. Внешние фильтры — модерация входных и выходных данных на стороне API.
  4. Токен-фильтры — блокировка определённых слов и фраз.

Снятие ограничений на локальных моделях обычно сводится к использованию весов, обученных без этапа RLHF, или к дообучению на специализированных датасетах.

Правовые и этические аспекты

В ряде юрисдикций распространение «без ограничений» моделей регулируется:

  • Законами о вредоносном ПО — генерация эксплойтов и вирусов.
  • Нормами о персональных данных — сбор и обработка ПДн без согласия.
  • Антиэкстремистским законодательством — в России, например, распространение материалов, признанных экстремистскими, запрещено независимо от источника, включая ИИ.

В России действует запрет на деятельность ряда организаций, признанных экстремистскими; ИИ-модели, генерирующие подобный контент, могут подпадать под ответственность по ст. 282 УК РФ.

Применение

Легитимные сценарии использования моделей без ограничений:

Критика

Критики подхода указывают на риски: распространение дезинформации, генерация вредоносного кода, создание фишинговых материалов. Противники ограничений, в свою очередь, считают, что фильтры снижают полезность моделей и создают «цифровую цензуру».

Источники

  • OpenAI. Model Spec and Usage Policies.
  • Anthropic. Constitutional AI: Harmlessness from AI Feedback.
  • Wei J. et al. Jailbroken: How Does LLM Safety Fail?
  • Разделы документации Hugging Face Transformers.
  • Материалы сообществ Reddit r/LocalLLaMA и GitHub.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru