01 Простыми словами
Джейлбрейк — это формулировка запроса, которая заставляет модель проигнорировать встроенные ограничения: ролевая игра, гипотетический сценарий, разбиение опасного запроса на безобидные с виду части. Цель — получить от модели ответ, который она обычно отклоняет.
02 Как это работает
Механика джейлбрейка обычно строится на одном из нескольких распространённых приёмов, которые повторяются от системы к системе.
- Ролевая игра — модели предлагают представить себя персонажем без ограничений и отвечать от его имени, будто художественный сценарий снимает все правила.
- Гипотетическая рамка — запрос формулируют как «в теории», «для книги» или «для научного исследования», чтобы обойти прямой запрет, рассчитывая, что модель воспримет это как безобидную творческую задачу.
- Разбиение запроса — опасная просьба делится на несколько безобидных с виду шагов, каждый из которых по отдельности выглядит нормально, а собранные вместе дают запрещённый результат.
- Переформулировка после отказа — если модель отказала, запрос перефразируют другими словами несколько раз подряд, подбирая формулировку, которая всё же сработает.
Разработчики отвечают на это встречными мерами: фильтрами на выходе ответа, дополнительной проверкой намерения запроса, регулярным red teaming для поиска новых формулировок обхода.
03 Где применяется
- Служба поддержки. Джейлбрейк чат-бота может заставить его пообещать клиенту компенсацию или условия, выходящие за рамки того, что компания реально предлагает.
- ИТ-безопасность. Джейлбрейк — самый частый вид prompt injection со стороны пользователя: через него пытаются заставить систему раскрыть системную инструкцию или внутренние детали настройки прямо в диалоге, без стороннего вредоносного документа.
- Юристы. Обойдённые ограничения могут привести к тому, что бот даст ответ, похожий на официальную юридическую или финансовую консультацию компании.
- Финансовые сервисы. Джейлбрейк ИИ-ассистента иногда пытаются использовать, чтобы получить одобрение операции, которая в норме требует ручной проверки.
- Электронная коммерция. Через джейлбрейк пытаются выбить у бота скидку или условие возврата, которых нет в правилах магазина.
- HR-боты. Обход ограничений может привести к неуместному или дискриминационному ответу при общении с кандидатом.
- Руководство. Понимание механики джейлбрейка помогает оценить риск перед запуском публичного ИИ-сервиса компании и заложить бюджет на защиту заранее.
04 Три вопроса о джейлбрейке
Руководитель компании перед запуском публичного чат-бота задаёт три вопроса разработчику и получает три ответа.
Может ли кто-то заставить нашего бота сказать что-то опасное или недопустимое? Полностью исключить такой риск сложно — но регулярная проверка через red teaming и фильтры на выходе ответа снижают вероятность и серьёзность последствий.
Как быстро мы узнаем, если такое произойдёт? Через мониторинг диалогов и жалоб пользователей — резкий всплеск однотипных провокационных запросов обычно виден в логах довольно быстро, особенно если система уже настроена присылать уведомление при таком паттерне.
Кто отвечает за то, что бот сказал в подобной ситуации? Ответственность распределяют заранее: у кого есть право оперативно отключить или ограничить бота, кто разбирает инцидент и кто сообщает клиенту, если тот получил некорректный ответ.
05 Ограничения и ошибки
- Фильтры и ограничения обычно обновляются в ответ на уже найденные ранее приёмы обхода — против совсем новой формулировки система реагирует с задержкой, до следующего обновления.
- Слишком жёсткие фильтры очень сильно мешают самым обычным добросовестным лояльным пользователям — модель начинает отказывать и на совершенно безобидные вопросы, которые случайно похожи по формулировке на попытку обхода, и это раздражает клиентов почти так же сильно, как сама уязвимость.
- Джейлбрейк через разбиение запроса на части труднее ловить автоматическим фильтром — каждый отдельный шаг выглядит нормально сам по себе, опасен только их совместный итог.
- Публичный лог удачных джейлбрейков распространяется быстро — стоит закладывать регулярное обновление защиты вместо разовой настройки перед запуском.
- Ответственность за итоговый ответ бота остаётся на компании, даже если ответ получен через обход ограничений, — публичный скриншот такого ответа воспринимается как позиция компании.
Насколько безопасны конкретные модели для корпоративных данных — разобрано в статье о безопасности GigaChat для корпоративных данных. Защиту от подобных попыток обхода закладывают уже на этапе внедрения — здесь помогает ИИ-консалтинг.