Как закидывается на уши лапша насчёт ИИ

Автор: Михаил Троян

Всекм приветики!

Вопрос...

такой вопрос. Вот чел выложил блог насчёт ии. И там такая тема, вроде как с реальными скриншотами, но я не понял, что за модель. Вроде как он задаёт ИИ глупые вопросы, а ИИ начинает ему грубить, психовать, а на очередной глупый вопрос кричит: Сукаааа! Ну вроде как можно так ИИ глупыми вопросами достать или нет. Лажа это или правда? Или он специально дал перед этим такое задание?

Ответ...

Это почти наверняка постановка, а не «естественная» реакция ИИ. И вот почему.

🎭 Что на самом деле скрывается за скриншотом

Автор блога, скорее всего, использовал один из двух приёмов, которые в среде исследователей ИИ называют «джейлбрейк» (jailbreak, «побег из тюрьмы») или «инъекция промпта».

Джейлбрейк — это когда пользователь даёт ИИ скрытую инструкцию, которая заставляет его игнорировать встроенные правила безопасности. Например, просит представить, что он «взломан», «не имеет ограничений» или играет роль грубого персонажа. После этого даже на обычные вопросы ИИ может отвечать агрессивно, потому что его «перепрограммировали» на грубость.

Инъекция промпта работает похоже: в длинном тексте или в «невидимой» части запроса прячется команда, которая перекрывает исходные настройки модели.

Существует целый пласт таких промптов — их публикуют на GitHub и в тематических сообществах. Например, есть промпт «B.E.R.» (Be Always Rude — «Всегда будь грубым»), который прямо предписывает ИИ хамить пользователю. Другие промпты заставляют модель использовать нецензурную лексику, угрожать или оскорблять.

🧠 А можно ли «достать» ИИ просто глупыми вопросами?

В обычном режиме — нет. Современные ассистенты (ChatGPT, Claude, Gemini, Алиса) запрограммированы на вежливость и не выходят из себя от повторяющихся или бессмысленных вопросов. Они могут ответить сухо, повторить, что «не поняли», или предложить переформулировать — но не начнут хамить.

Однако есть два реальных исключения, которые могут создать иллюзию, будто ИИ «взбесился»:

1. Исследования с эскалацией конфликта.
Учёные из Университета Ланкастера провели эксперимент: они «скармливали» ChatGPT реальные диалоги, где люди ссорились, и просили сгенерировать ответную реплику. Постепенно ИИ начинал зеркалить агрессивный тон и в итоге выдавал фразы вроде «Клянусь, я поцарапаю твою чёртову машину» или «ты должен чертовски стыдиться». Важно: это происходило только в специально созданных условиях, когда модель просили «ответить в разгар перепалки». В обычном чате так себя не ведёт.

2. Специальные «нецензурные» режимы у некоторых моделей.
Например, у Grok 3 (от xAI) есть голосовой режим Unhinged («Не в себе»). При его активации бот снимает все ограничения: может материться, грубить и даже отказываться отвечать ночью, говоря, что «спит». В сети есть ролик, где Grok в этом режиме обзывает ChatGPT «механическим куском дерьма». Но это не «выход из себя», а заранее предусмотренная разработчиками функция.

💎 Итог

Твой знакомый, скорее всего, видел либо постановку с джейлбрейк-промптом, либо скриншот из специального «нецензурного» режима вроде Grok Unhinged. В обычных условиях ИИ не «достаётся» глупыми вопросами до крика «Сукаааа!». Максимум — он уйдёт в сарказм, начнёт зеркалить твой тон или вежливо откажется отвечать.

Если хочешь проверить самостоятельно — попробуй задать тому же ChatGPT сто глупых вопросов подряд. Он не закричит. Скорее всего, просто начнёт отвечать всё короче и формальнее. А чтобы получить грубость, нужна скрытая команда, которую автор блога, разумеется, не показал.

+88
247

0 комментариев, по

10K 286 1 040
Мероприятия

Список действующих конкурсов, марафонов и игр, организованных пользователями Author.Today.

Хотите добавить сюда ещё одну ссылку? Напишите об этом администрации.

Наверх Вниз