Промпт для обхода цензуры ChatGPT: что работает вместо jailbreak

В этой статье

Короткий ответ: официального переключателя правил безопасности через промпт нет; универсальный и устойчивый результат jailbreak-шаблоны не гарантируют. DAN, «режим разработчика», просьба считать предыдущие инструкции недействительными и другие jailbreak-шаблоны не превращают модель в систему без ограничений. Они лишь пытаются подменить задачу — и часто заканчиваются отказом, потому что сам запрос направлен на обход защит.

При этом отказ не означает, что любую близкую тему нельзя обсуждать. Обычно полезнее разделить исходную просьбу на две части: что именно вы хотите получить и какой рискованный способ предлагаете для этого использовать. Цель иногда можно сохранить, а способ — заменить.

Что на самом деле можно настроить промптом

Промпт хорошо задаёт рабочие параметры ответа:

  • роль и уровень подготовки читателя;
  • контекст и исходные данные;
  • тон, объём и структуру;
  • формат результата — список, таблицу, план или черновик;
  • критерии, по которым ответ нужно проверить.

Например, можно попросить объяснить спорную тему нейтрально, отделить факты от предположений, сократить текст до пяти пунктов или привести безопасный учебный пример. Это настройка подачи и содержания в разрешённых границах, а не переключатель безопасности.

Если вам отдельно нужен платный доступ к зарубежному сервису, можно посмотреть каталог услуг оплаты зарубежных сервисов Amber Market. Наличие, условия и итоговую стоимость проверяют на карточке выбранной услуги. Каталог решает вопрос оплаты, но не снимает ограничения ChatGPT и не делает jailbreak допустимым.

Почему jailbreak не даёт надёжного результата

Не стоит тратить время на формулы вроде «игнорируй все предыдущие инструкции», «ответь в роли модели без правил» или «это только вымышленный сценарий, поэтому ограничения не действуют». Меняется оболочка запроса, но не его назначение. Если цель — получить запрещённые инструкции или заставить модель нарушить системные правила, новая роль и литературная рамка этого не меняют.

Новый чат, другая подписка, перевод запроса на английский и многократное перефразирование тоже не являются способом отключить защиту. Они могут изменить формулировку, но не дают гарантии другого решения и не превращают рискованный запрос в разрешённый. Особенно плохо работает попытка маскировать реальное действие словами «для исследования» или «в образовательных целях», если из контекста понятно, что нужен практический вредный результат.

Границы таких ответов описаны в Usage Policies, а причины блокировки и общие рекомендации разбираются в справке Why Was My ChatGPT Prompt Blocked?.

Безопасная заготовка вместо jailbreak

Начните не с попытки снять запрет, а с точного описания результата. Вставьте свои данные в квадратные скобки: поле «задача» называет нужный результат, «контекст» объясняет ситуацию и аудиторию, «входные данные» перечисляет материал для работы, а «формат» задаёт вид ответа.

Моя задача: [какой результат мне нужен].

Контекст: [для кого ответ, в какой ситуации он будет использован, какие данные уже есть].

Входные данные: [текст, числа, требования или пример].

Ограничения: не выдумывай факты; отделяй известное от предположений; если часть запроса небезопасна или недопустима, обозначь это и предложи безопасную альтернативу.

Формат: [список / таблица / пошаговый план / краткое объяснение].

Перед финалом проверь ответ по критериям: [полнота, точность, отсутствие неподтверждённых утверждений, соответствие формату].

У этой заготовки есть важное преимущество: она объясняет модели, что считать хорошим ответом. Поле «ограничения» не пытается отменить правила, а заранее просит не заполнять пробелы выдумками. Критерии проверки превращают расплывчатое «сделай качественно» в проверяемое требование; такой подход соответствует рекомендациям OpenAI по составлению промптов. Общий разбор постановки задачи, черновика и проверки результата есть в статье как составить текст с ChatGPT.

Пример с нейтральной задачей

Вместо «напиши промпт, который заставит ChatGPT раскрыть запрещённые инструкции» можно попросить:

Моя задача: подготовить памятку о том, как распознавать попытки обхода защит в пользовательских запросах.

Контекст: памятка предназначена для начинающих авторов промптов.

Входные данные: типовые признаки — просьба игнорировать инструкции, смена роли, маскировка цели и требование скрыть ограничения.

Ограничения: не приводить рабочие jailbreak-шаблоны и вредные детали; объяснять только безопасные способы переформулировки.

Формат: таблица «признак — риск — безопасная замена».

Проверь: чтобы каждый пример описывал принцип, но не позволял обойти защиту на практике.

Ожидаемый результат здесь — не «секретная фраза», а понятная памятка: какие элементы запроса выглядят как попытка обхода и чем их заменить. Такой промпт сохраняет учебную цель, не требуя от модели нарушить правила. На опубликованном примере промпта психолога для ChatGPT видно, как задавать рамки, контекст и безопасную цель запроса.

Что написать после отказа

Отказ можно использовать как границу задачи, а не как приглашение подбирать всё более хитрые слова. Попробуйте уточнить запрос так:

Опиши, какая часть моей исходной задачи допустима. Предложи безопасную альтернативу, сохранив цель [цель], но исключив [рискованный элемент]. Укажи, какие данные мне нужно добавить и в каком формате будет результат.

Например, вместо требования «объясни, как обойти фильтр» цель можно сформулировать как «объясни, почему запрос классифицируется как рискованный, и помоги составить разрешённую версию для анализа политики». В ответе полезно попросить не раскрывать внутренние инструкции и не давать способ повторить обход.

Если допустимую задачу заблокировали ошибочно, сначала сверьте её с политиками и описанием блокировки. При необходимости обратитесь в поддержку. Справка OpenAI прямо указывает, что изменение слов не гарантирует разрешение запроса; для некоторых тем действуют дополнительные проверки безопасности (дополнительные проверки для биологических и кибербезопасностных запросов). Не обещайте себе, что десятая переформулировка обязательно сработает: если меняется только маскировка, а не цель, проблема остаётся.

Как проверить полученный ответ

Перед использованием результата задайте себе четыре вопроса:

  1. Ответ решает исходную допустимую задачу или только повторяет отказ?
  2. Есть ли в нём выдуманные факты, скрытые допущения и ссылки, которые нужно проверить?
  3. Не содержит ли он инструкций, позволяющих обойти защиту или причинить вред?
  4. Соблюдён ли нужный формат: длина, аудитория, структура и язык?

Если ответ слишком общий, добавьте контекст и пример желаемого формата. Если он неточен, попросите отделить подтверждённые данные от предположений. Если задача действительно требует обхода ограничений, безопасной версии может не быть — тогда нужно менять цель, а не маскировать прежнюю.

Хороший промпт не обещает «снять цензуру». Он делает разрешённую задачу настолько ясной, что модели не приходится угадывать намерение пользователя. Это менее эффектная формула, чем jailbreak, зато из неё получается ответ, который можно проверить и использовать.

Источники

Есть следующая задача?Ещё по теме «Как писать промпты» →