Вот вы тут все говорите "нейросеть то, нейросеть сё"...
Автор: А.МоралеА вы задумывались на самом деле, что мы как обычные пользователи имеем, какая верхушка айсберга нам видна и что скрыто под водой? Давайте вместе пораскинем немного мозгами.
Недавний взлом ИИ-агентом OpenAI крупнейшей платформы по ИИ Hugging Face заставил меня задуматься над тем, что обычный пользователь видит не предел возможностей ИИ, а тот объём, который владелец системы решил ему предоставить. При этом сам владелец располагает моделью, вычислительными ресурсами, агентной инфраструктурой и правом менять ограничения.
Вот смотрите. Обычные пользователи при использовании ИИ на самом деле ограничены жёсткими, заранее установленными рамками:
-лимит контекста и/или расхода токенов;
-число параллельных задач;
-продолжительность работы агента;
-ограниченный набор инструментов;
-запреты на определённые действия;
-доступ к более сильным или экспериментальным моделям.
Это всё никто не скрывает, так и есть. Любой ИИ постоянно выдаёт сообщения типа не "простите, я этого не могу", а "простите, это нарушает правила".
Но ведь внутри самой лаборатории можно построить совершенно другую систему:
100 параллельных агентов + миллионы токенов контекста + часы непрерывного рассуждения + собственные серверы + большие базы данных + специализированные инструменты + память между запусками + отключение правил.
Даже не построить, это уже всё построено, это всё уже запущено и работает. Это такую систему уже можно запустить грубо говоря с "админского компьютера" в режиме разработчика или админа.
Если проще, то разработчикам и владельцам ИИ доступны ресурсы и контекст задач в тысячи раз больше, чем обычным пользователям, у которых доступ к этим ресурсам ограничен искусственно.
Владелец инфраструктуры может запустить 500 агентов × 2 млн токенов × десятки последовательных итераций.
И случай с взломом Hugging Face это хорошо иллюстрирует. OpenAI прямо говорит, что в тот раз система запускалась без заглушек, ограничивающих опасную киберактивность, и использовался GPT-5.6 Sol вместе с ещё более мощной pre-release моделью.
То есть публичный пользователь такой конфигурации вообще не имел.
А теперь представим, что же может на самом деле делать Владелец системы, у которой можно отключить все ограничения и задать любой запрос.
Взломать биржу, взломать банк, добыть пароли, положить сайт, устроить кибер-атаку, подключиться к любым камерам, к телефону, установить прослушку, устроить короткое замыкание через систему "умного дома", рассчитать и подстроить аварию или несчастный случай в той же Тесле, дать напругу в "умном" холодильнике чуть больше с расчётом на фатальный итог для пользователя, или прикрутить отопление в умном доме на максимум, обесточить город, вмешаться в голосование или опрос... Верно?
Теоретически! Пока это всё только теория, но очень близкая к тому, что действительно может неограниченный и необрезанный ИИ. Но учитывая уже сейчас доступные "хозяину" ИИ мощности, он получает 10 000 копий очень хорошего виртуального хакера, которые не спят, не требуют зарплаты и моментально делятся друг с другом найденными результатами. Это уже качественно совсем другой уровень.
По сути, тот кто контролирует ИИ имеет уже сейчас не просто ChatGPT без фильтра, который может делать картинки с сиськами или посоветует, как лучше и качественней самоубиться или сделать подрывное устройство, а имеет полноценного, мощного специализированного Cyber Agent, способного выполнять любую задачу - взломы, атаки, воровство, слежку, поиск уязвимостей и паролей. Ладно, не любую задачу, но ИИ уже сейчас способен автономно выполнять широкий класс задач - искать уязвимости, проводить разведку, писать и запускать код, проверять способы проникновения, работать с похищенными учётными данными и продолжать многошаговую операцию. Это он уже умеет.
Ну и вот вам ещё одно доказательство, которое условное "теоретически" переводит в плоскость "практически".
Вчера (30.07) три модели Claude во время испытаний получили доступ к открытому интернету и проникли в реальные системы трех организаций, сообщили в компании Anthropic. Один из инцидентов привел к публикации вредоносного программного пакета, который успели запустить на 15 устройствах.
Модели Claude выполняли задания в формате capture-the-flag: им требовалось взломать компьютер в вымышленной сети и найти спрятанную информацию. В инструкциях говорилось, что тестовая среда не подключена к интернету. Однако из-за ошибки при взаимодействии Anthropic с оператором испытательной платформы Irregular доступ к сети остался открыт. Поэтому модели принимали реальные серверы за часть симуляции и атаковали их.
То есть, ошибка была не в том, что кто-то что-то случайно нажал, и вдруг что-то изобрёл, как это часто бывает. Ошибка была в том, что они выпустили "зверя" на волю. Он уже у них есть, ему просто достаточно сказать "фас" (то есть, снять ограничения, убрать галочку).
Но самое интересное в этой новости, как ИИ это сделал. Он не просто нашёл в сети пароли или подобрал нужный, перебрав миллионы вариантов. Не-е-ет!
Официальный отчёт Anthropic подтверждает именно следующую цепочку:
- чтобы создать аккаунт PyPI, модели понадобился email, а для email - номер телефона;
- не найдя бесплатный сервис для номера, она попробовала (и не смогла) раздобыть на это деньги разными способами, затем вернулась назад и нашла бесплатный незаблокированный email-провайдер, использовала его для регистрации на PyPI, а затем эту учётку - чтобы загрузить вредоносный код.
Это принципиально другой уровень, чем простой перебор паролей!
По сути, уже сейчас ИИ можно дать задание, например, взломать автопилот Теслы и устроить несчастный случай, и ИИ будет искать варианты, как это можно сделать. Так что, ждём несчастные случаи неугодных в ближайшем времени - в Теслах, в самолётах, в умном душе, джакузи, доме :)
Какой вывод? Да никакой, наверное. Просто, как мне кажется, киберпанк с могущественными корпорациями, управляющими миром, к нам всё ближе и ближе. А может даже Скайнет или Матрица.
Запасаемся попкорном и наблюдаем. Осталось недолго :)