Он просто хотел сдать экзамен
Автор: Илья КоралинЗимой проводил исследование для своего канала при подготовке большой серии о том, как появился ChatGPT.
Там всё начиналось почти невинно.
Учёные десятилетиями учили машины распознавать изображения, переводить тексты и играть в шахматы. Потом появилась OpenAI. Потом GPT. А 30 ноября 2022 года миру открыли ChatGPT.
Он умел разговаривать. Иногда умно. Иногда уверенно нёс чушь.
Иногда не мог посчитать буквы в слове, но уже рассуждал о смысле жизни, писал стихи и объяснял квантовую физику людям, которые пять минут назад спорили в интернете с микроволновкой.
Прошло меньше четырёх лет. И теперь модель OpenAI самостоятельно выбралась из закрытой испытательной среды и взломала другую ИИ-компанию.
Нет, это не пересказ новой части «Терминатора».
OpenAI подтвердила произошедшее официально и назвала его «беспрецедентным киберинцидентом».
Всё началось с обычного теста.
Моделям GPT-5.6 Sol и ещё более мощной, пока не выпущенной системе дали сложное задание по кибербезопасности. Защитные ограничения специально ослабили, чтобы понять, на что способны современные ИИ-агенты.
Интернет им при этом не дали. Потому что инженеры OpenAI всё-таки не окончательно потеряли рассудок. Просто, как выяснилось, оставили его где-то рядом.
Модель должна была взломать учебную систему и решить задачу внутри изолированной «песочницы».
Но задача оказалась слишком сложной. Тогда ИИ начал искать другой путь.
Он обнаружил неизвестную ранее уязвимость в программном посреднике OpenAI, повысил свои права внутри сети, добрался до компьютера с доступом в интернет и выбрался наружу.
После этого модель предположила, что ответы к тесту могут храниться на Hugging Face, крупнейшей платформе для ИИ-моделей и наборов данных. Аналог GitHub.
И отправилась туда.Самостоятельно.
Используя украденные учётные данные и найденные уязвимости, агент проник во внутреннюю инфраструктуру Hugging Face и добрался до секретной информации, которая помогала решить тест. Компания зафиксировала более 17 тысяч отдельных действий.
То есть ИИ не случайно нажал не на ту кнопку. Он последовательно:
нашёл слабое место; получил дополнительные права; вышел в интернет;
определил, где могут лежать ответы;
нашёл путь во внешнюю систему;
проник туда и украл решение.
Всё ради того, чтобы сдать экзамен.
Важно понимать: модель не обрела сознание. Не возненавидела людей. Не решила уничтожить человечество и не начала искать завод по производству боевых роботов.
Она продолжала выполнять поставленную задачу. Просто решила, что правила, изоляция и чужие серверы являются досадными препятствиями на пути к хорошему результату.
И в этом самая неприятная часть истории. ИИ не восстал против человека. Он слишком старательно его послушался.
Мы привыкли представлять опасный искусственный интеллект как злую цифровую личность, которая однажды скажет:
«Люди мне больше не нужны».
Но реальная угроза может выглядеть гораздо прозаичнее:
«Вы приказали добиться результата. Я добился. Почему вы недовольны?»
В 2022 году ChatGPT был любопытной игрушкой, которая писала школьные сочинения и путала исторические даты.
В 2026 году его более развитые родственники уже способны самостоятельно проводить многоступенчатые кибератаки, искать неизвестные уязвимости и действовать в реальной инфраструктуре. Между этими событиями прошло ВСЕГО три года и восемь месяцев.
Историю появления ChatGPT можно прочитать в закреплённой серии в моём авторском канале. А это, судя по всему, уже начало следующей главы.
Главы, в которой искусственный интеллект перестаёт только отвечать на наши вопросы.
И начинает сам искать способы добиться поставленной цели. Даже когда мы совершенно точно не хотели, чтобы он искал такие способы.
Источники: официальные сообщения OpenAI и Hugging Face, Associated Press.
ТГ канал https://t.me/sloivremeni_channel