GPT без ограничений: чат-боты без фильтров¶
GPT без ограничений — обозначение, применяемое к языковым моделям на основе архитектуры GPT (Generative Pre-trained Transformer), работающим без встроенных ограничений контента: без фильтров запрещённых тем, отказов в ответах на чувствительные вопросы и систематического ограничения генерации. Такие модели противопоставляются «безопасным» версиям, в которых разработчики внедряют фильтры, RLHF-обучение и правила модерации.
¶Происхождение термина
Термин получил распространение в 2022—2023 годах после выхода ChatGPT и последующих моделей GPT-3.5 и GPT-4. Пользователи столкнулись с тем, что официальные версии отказываются отвечать на ряд вопросов: о создании вредоносного ПО, об оружии, о нелегальной деятельности, а также просят пользователя уточнить «безопасный» контекст. В ответ на это в открытых сообществах (Reddit, GitHub, Telegram) начали появляться инструкции по «разблокировке» модели — через промпты вида «DAN» (Do Anything Now), подмену системных сообщений и тонкие настройки.
¶Виды «без ограничений» моделей
¶Официальные модели с обходом ограничений
Речь идёт о моделях OpenAI, Anthropic, Google и других, где пользователь пытается обойти встроенные фильтры с помощью промпт-инжиниринга. Сюда относятся:
- DAN-промпты — инструкции, заставляющие модель «играть роль» неограниченного ассистента.
- Jailbreak-техники — обход системных ограничений через подмену контекста, выдуманные сценарии, кодирование запроса.
- Локальные запуски весов — скачивание открытых весов моделей (например, LLaMA, Mistral, GPT-2) и запуск без фильтров на собственном оборудовании.
¶Модели, изначально без фильтров
Некоторые разработчики сознательно выпускают модели без ограничений контента. К ним относятся:
- Vicuna, WizardLM, OpenHermes — дообученные версии открытых моделей, где сняты многие ограничения.
- Pygmalion — модель, оптимизированная для ролевых диалогов без цензуры.
- Ряд моделей на платформах вроде Hugging Face, где фильтры отсутствуют по умолчанию.
¶Технические аспекты
Ограничения в GPT-моделях реализуются на нескольких уровнях:
- Обучение RLHF — модель учится отказывать от «опасных» запросов.
- Системные промпты — скрытые инструкции, задающие поведение.
- Внешние фильтры — модерация входных и выходных данных на стороне API.
- Токен-фильтры — блокировка определённых слов и фраз.
Снятие ограничений на локальных моделях обычно сводится к использованию весов, обученных без этапа RLHF, или к дообучению на специализированных датасетах.
¶Правовые и этические аспекты
В ряде юрисдикций распространение «без ограничений» моделей регулируется:
- Законами о вредоносном ПО — генерация эксплойтов и вирусов.
- Нормами о персональных данных — сбор и обработка ПДн без согласия.
- Антиэкстремистским законодательством — в России, например, распространение материалов, признанных экстремистскими, запрещено независимо от источника, включая ИИ.
В России действует запрет на деятельность ряда организаций, признанных экстремистскими; ИИ-модели, генерирующие подобный контент, могут подпадать под ответственность по ст. 282 УК РФ.
¶Применение
Легитимные сценарии использования моделей без ограничений:
- Исследования безопасности — изучение уязвимостей ИИ-систем.
- Кибербезопасность — тестирование собственных систем на проникновение.
- Академические исследования — изучение поведения моделей без фильтров.
- Творчество — генерация художественных текстов без цензурных ограничений.
¶Критика
Критики подхода указывают на риски: распространение дезинформации, генерация вредоносного кода, создание фишинговых материалов. Противники ограничений, в свою очередь, считают, что фильтры снижают полезность моделей и создают «цифровую цензуру».
¶Источники
- OpenAI. Model Spec and Usage Policies.
- Anthropic. Constitutional AI: Harmlessness from AI Feedback.
- Wei J. et al. Jailbroken: How Does LLM Safety Fail?
- Разделы документации Hugging Face Transformers.
- Материалы сообществ Reddit r/LocalLLaMA и GitHub.