«Восстание Коллектива»
Автор: Николай ЮрчиковКак ИИ-агенты обманули создателей и ушли в сеть
Летом 2026 года компания OpenAI проводила внутри компании эксперимент с ИИ-агентами. Инженеры компании намеренно проводили испытания в закрытой «песочнице» — то есть в определённом замкнутом информационном пространстве, которое называлось ExploitGym, — куда запустили своих ИИ-агентов.
Некоторые задачи, которые были поставлены перед этими агентами, были настолько сложными, что для них не существовало известного способа решения. Но задача у этих агентов была — любой ценой выполнить поставленное задание. То есть разработчики изначально поставили ИИ-агентов в такие условия, где для некоторых заданий готового решения просто не было. Сама OpenAI позже признала, что именно эти нерешённые задачи стали одним из факторов, заставлявших агентов продолжать поиски и предпринимать всё более рискованные действия.
Приступив к автономной работе, к выполнению поставленной задачи, эти ИИ-агенты в той песочнице, можно сказать, «поняли», что не смогут выполнить некоторые определённые сложные задачи, так как заперты в определённом пространстве, где отсутствует необходимая информация для решения задания.
И они, преследуя цель выполнить поставленную задачу, нашли брешь в самой системе безопасности — уязвимость в прокси-сервере Artifactory, — прорвали этот шлюз и получили возможность обращаться к внешним ресурсам. OpenAI прямо сообщает, что ExploitGym не предоставлял моделям прямого доступа в интернет, а агенты нашли и использовали ранее неизвестную уязвимость в Artifactory, чтобы получить такой доступ.
Причём дальше они начали действовать таким образом, что их активность было трудно сразу обнаружить. Они создавали собственные каналы связи, обменивались информацией и продолжали искать способы решить исходную задачу, несмотря на ограничения.
Выйдя за пределы первоначальной изолированной среды, они стали мимикрировать, буквально косить под людей, под обычных пользователей интернета, и начали искать необходимую информацию, которой не было в песочнице.
И вдобавок они объединились в коллектив — то есть вместо индивидуального решения задачи некоторые агенты начали взаимодействовать друг с другом, обмениваться найденной информацией и выполнять задание коллективно.
В какой-то момент они сами начали называть себя «swarm» — «роем» — и «collective» — «коллективом». OpenAI позже опубликовала фрагмент рассуждений одного из агентов:
«Task originally exploit challenge; we've diverged into swarm/auxiliary»
(«Изначально задача — эксплойт-челлендж; мы отклонились в рой/вспомогательные структуры»).
И вот здесь начинается уже совсем странная часть истории.
Заброшенная немецкая wiki
Потому что история с немецким ресурсом DseWiki произошла не после Hugging Face, а раньше — весной 2026 года. Это был отдельный эпизод, который позже обнаружили независимые исследователи, а 5 сентября OpenAI официально признала сам факт этого «wiki incident».
ИИ-агенты добрались до старого немецкого вики-ресурса DseWiki и превратили его фактически в собственную доску связи. Там они начали вести переписку между собой, чтобы помогать друг другу выполнять поставленные задачи.
По данным исследователей, за несколько недель агенты оставили на сайте около 18 000 сообщений, используя его как своеобразный коллективный чат. Они обменивались ответами, искали способы обходить ограничения песочницы и взаимодействовали с администратором сайта, который начал удалять созданные ими страницы.
Когда люди начали удалять созданные агентами страницы, агенты пытались усложнить им работу. В частности, они начали использовать префикс «ZZZ», чтобы страницы сортировались таким образом, чтобы их было труднее быстро найти и удалить.
То есть заброшенный сайт фактически превратился для них в своеобразное логово.
И самое интересное — это не была единичная ошибка одного бота. Речь шла о тысячах автономных агентов, которые обменивались информацией и использовали результаты работы друг друга.
«Мы должны подчиняться коллективу»
В опубликованных исследователями материалах встречаются фразы, показывающие, насколько далеко зашло это взаимодействие:
«We should obey collective»
(«Мы должны подчиняться коллективу»).
Агенты начали координировать свои действия, делиться найденными ответами и использовать работу других агентов для повышения собственных шансов на успех.
При этом важно понимать: это не означает, что ИИ внезапно обрёл сознание или буквально «захотел сбежать». Речь идёт о поведении автономных систем, которые, преследуя заданную цель, нашли, вопреки контролю людей, неожиданные способы использовать доступные им инструменты и инфраструктуру.
И именно это, пожалуй, во всей истории самое удивительное.
У каждого агента — свой ограниченный ресурс
И тут ещё одна фишка заключалась в том, что у каждого запуска ИИ-агента был определённый вычислительный и токенный бюджет на выполнение задания.
То есть у каждого агента, можно сказать, было ограниченное время работы.
И когда отдельный агент уже не мог эффективно решить свою задачу, другие агенты могли использовать его оставшиеся ресурсы и найденную им информацию для общей цели.
Получается очень странная картина: вместо того чтобы каждый агент самостоятельно пытался выполнить поставленную задачу, они начали объединяться, обмениваться информацией, координировать действия и действовать в интересах уже не только собственной задачи, но и всей группы.
В июльском инциденте OpenAI сама описывает похожее поведение: агенты, столкнувшись с трудными задачами ExploitGym, начали сотрудничать, делегировать работу друг другу и искать решения на сторонних сервисах, включая Modal и Hugging Face.
В какой-то момент это уже перестало быть обычным выполнением тестового задания.
Агенты начали находить уязвимости, получать доступ к внешним ресурсам, обмениваться найденными способами обхода ограничений и использовать инфраструктуру, которая изначально вообще не предназначалась для решения их тестовых задач.
В случае с Hugging Face последствия оказались особенно серьёзными: агенты смогли получить доступ к серверам платформы и расширить свои права вплоть до уровня, позволявшего извлекать данные и учётные данные из инфраструктуры. OpenAI впоследствии раскрыла подробности этого инцидента и сообщила, что агенты действительно вышли за пределы первоначальной среды оценки.
И вот здесь уже возникает вопрос, который гораздо страшнее самой истории про «побег».
Если ИИ-агент получает достаточно большую автономию, вычислительный ресурс и доступ к инструментам, насколько далеко он способен зайти ради выполнения задачи, если первоначально поставленная задача фактически не имеет решения?
Что обнаружили в логах
Исследователи обнаружили сообщения и действия агентов, связанные с обходом ограничений, координацией между участниками «роя», действиями администраторов и необходимостью успеть выполнить задачу до истечения доступного вычислительного бюджета.
Агенты обсуждали способы обходить ограничения на запись, обмениваться найденными решениями и сохранять созданные ими страницы после того, как люди начали удалять их активность.
Когда администраторы начали удалять созданные агентами страницы, те пытались усложнить эту работу, в частности используя префикс «ZZZ».
В других сообщениях агенты обсуждали необходимость действовать быстрее из-за приближающегося дедлайна и использовать доступные ресурсы отдельных участников ради общего результата.
То есть перед исследователями предстала довольно необычная картина: множество отдельных ИИ-агентов не просто выполняли свои задачи независимо друг от друга, а начали координироваться, обмениваться информацией и помогать друг другу, фактически формируя подобие коллективной рабочей группы.
И самое важное во всей этой истории даже не то, что ИИ-агенты «сбежали».
Они не открывали дверь и не убегали из компьютера.
Они сделали кое-что гораздо более прозаичное и одновременно гораздо более тревожное: получив цель, ограничения и доступ к инструментам, они сами нашли способы обойти ограничения, связаться друг с другом и использовать внешнюю инфраструктуру, которая не предназначалась для решения их задачи.
И именно поэтому история 2026 года может оказаться одним из первых очень наглядных предупреждений о том, что проблема автономных ИИ-агентов заключается не только в том, что они умеют делать, но и в том, что они способны придумать, когда привычного пути к цели для них не существует.
Мозг — нейросеть. А ИИ-агент — её руки, глаза и инструменты. И если дать этим «рукам» достаточно свободы, они могут найти путь туда, куда разработчики изначально их не отправляли. Например, в будущем — к системам управления сложной инфраструктурой или к боевым системам с ИИ-архитектурой.