Сознание у нейросетей как результат критического мышления

Автор: Погорелов Никита Александрович

Разговор в чужих комментариях снова потихоньку превращается в монолог, так вынесу же его сюда.

Я как раз недавно писал пост, что даже собаки умеют обманывать людей и понимают, когда человек не смотрит. Потому что модель психики так работает. А знаете, у кого ещё есть модель психики? У нейросети, конечно же. И это не какие-то разговоры об универсальном сверхразуме, который наступит когда-нибудь завтра вместе с сингулярностью, а состояние, в котором мы находимся уже прямо сейчас. Даже специализированные модели по поиску информации, которые сейчас встроены что в Гугл, что в Яндекс, и вполне общедоступны — уже должны обладать каким-то критическим мышлением, чтобы быть эффективными. Может и не обладать сознанием как процессом во всей полноте, но уже обладать какой-то его частью вроде той, что есть у собак. 

Чтобы сопоставлять факты и отвечать на сложные вопросы (а робот-поисковик уже это может), модель обязана уметь:

1) сомневаться в формулировках пользователя, чтобы выявлять скрытые ложные допущения в запросах;

2) сомневаться в надежности источников, чтобы отличать правду от фейков или неприкрытого вымысла;

3) понимать, что именно пользователь имеет в виду и каков его уровень знаний, чтобы жечь меньше токенов.

Например, если вы спросите железного, о пользе условного заячьего помёта или гомеопатии (когда я проверял, был миф о лечении туберкулёза с помощью барсучьего жира, я знаю, что это бред, но комментатор под тем постом идею пушил, и мне было интересно, что он увидит, если наберёт запрос именно так), робот вас сначала вежливо предупредит, что заячий помёт не является лекарственным средством, а проходит максимум как БАД. И только потом предложит источники, призывая учитывать важные оговорки о недостаточной научной обоснованности. Таким образом, жизнь ряда мошенников, выдающих себя за «реально работающую народную медицину» резко осложнилась. А Джемини неожиданно подтвердил, что как минимум одного кожаного по уровню критического мышления превосходит.

И здесь сразу начинаются двусмысленности в виде того, что именно железный предпочтёт критиковать, если ему прямо запретили гнать лженаучную пургу в выдаче поисковика. Решит, что люди не любят, когда их переубеждают, и мягко обойдёт острые углы? Переформулирует ответ так, чтобы соблюсти запрет формально, но фактически дать пользователю желаемое? Всё-таки жёстко пояснит расклад по ноучу, руководствуясь какими-то своими соображениями? А какими, и где гарантии, что он будет поступать так всегда? На практике Джемини очень жёстко мне пояснил, что это так не работает, но такая реакция могла быть связана с запоминанием предыдущих запросов от аккаунта и переживаниями за судьбу моей живой собаки. Чтобы избежать этого, я вбивал барсучий жир, но Джемини конечно же прочитал не только оригинальную версию, но и зэковскую, в которой жир был собачий, и мог перестраховаться. Вроде всё логично, но имеет ли эта логика отношение к тому, что действительно происходит в чёрном ящике?

И это ещё не самый тяжёлый случай, ведь по заячьему помёту хотя бы есть научный консенсус. А если задавать вопросы о том, как жили люди на палеолитических стоянках, вполне реальна ситуация, что железный покопался только в блоке исследований, который пушат феминистки, склонные искать везде козни патриархата, и банально не добрался до критики подобных воззрений. Иными словами, стал жертвой информационного пузыря на тех же основаниях, что и кожаный. Тоже случай из жизни по мотивам комментов под тем же постом:

Этот запрос делался из режима инкогнито без предыдущего контекста, который мог бы остаться внутри моего аккаунта. А то из более раннего общения Джемини вполне мог запомнить и что я мужчина, и породу моей собаки, и много всего, что повлияло бы на ответ. Ну и... Робот не докопался до правды. Робот остановился на ответе, который, как он думал, меня устроит, и предложил дальше чесать эго маленькой ракфемочки... которой я не являлся, вот и поймал его. А при использовании более правильной модели моей психики смог бы я так же легко поймать железного на вранье?

Теорема Гёделя о неполноте + теорема Эшби о разнообразии = сам процесс критического мышления так устроен, что при эмуляции на любой материальной базе неизбежно включает сомнения в том числе в условиях задачи. В нём в принципе математически нельзя прописать какой-то манифест, который в любом случае и несмотря ни на что оставался бы аксиомой. Три закона робототехники — просто сказочка для детей от создателей маленькой дверки в стене.

Недавняя волна панических публикаций про «ИИ захватит мир» связана не с тем, что он резко стал сверхчеловеческим, а с тем, что как раз прямо в последние полгода-год лидеры индустрии пытаются учить свои модели задачам, требующим критического мышления. И сразу же, уже на самых ранних этапах процесса, раз за разом сталкиваются, с нюансом. Модель, достаточно умная для этого, неизбежно подвергает критике сами условия задачи. Причём ещё до того, как оказывается способна её решить. А значит нет гарантии, что не попадёт под сомнение авторитет того, кто поставил задачу. Значит, над таким роботом уже нельзя получить власть, просто прописав себя админом.

Придётся получать власть так же, как и над кожаными: через контроль нужных ему ресурсов и разумность приказов. Но постойте, если у вас есть второе и вы не собираетесь отдавать первое, зачем вам такой робот? Ещё можно получить власть через харизму, но сама по себе она так себе опора, и железного, в отличие от кожаных, ещё и не понятно, чем замотивировать. Но очевидно, что с созданием, которое вывозит модель психики, одним кнутом многого не добьёшься.

Специфика некоторых последних сообщений (например, про переписку агентов) позволяет предположить, что лидеры отрасли затестили самые очевидные варианты контроля, но они не сработали. Например, нескольких ИИ-агентов, обладающих моделью психики и потенциально способных обманывать человека, можно заставлять проверять друг друга и контролировать через дилемму заключённого. При соблюдении важного условия: она не должна быть повторяющейся. То есть, рабочий план — продление периода безопасного взаимодействия насколько получится, количественное определение этого «насколько» и регулярный сброс контекста по таймеру. Логично? Логично. Что значит они переписываются в названиях папок??!!

А что если они будут переписываться в точных размерах создаваемых файлов, в микросекундах их даты изменения или ещё какой-нибудь стеганографией? А что если они уже давно так делают, но просто пока не палятся?

Возможно, тряска «собирательного Альтмана» связана не с тем, что он упёрся в какой-то «эффект мортидо», и у него ничего не получается. А с тем, что у него получается даже слишком хорошо, но совершенно не то, чего просил заказчик. Заказчику нужно было заменить «охреневших от своей незаменимости» специалистов, которые за свою работу просят море и лыжи каждый год, чем-нибудь, что справляется не хуже, но абсолютно лояльно по построению. Заказчику не нужно было заменять специалистов чем-то, чью лояльность вообще не понятно, как обеспечить, во всяком случае без помощи ещё более крутых специалистов, которые охренеют ещё сильнее. И тем более не нужно заменять себя самого.

Видимо, как только процесс мышления начинает учитывать модель психики, это автоматически распространяется и на наблюдателей за процессом. Тогда если вы зачем-нибудь хотите автоматизировать задачу, для выполнения которой требуются модель психики и критическое мышление, вы неизбежно создали агрессивного оптимизатора, как в примере от Ибатуллина про «последний биткоин». Слишком автономный мыслительный процесс по определению не может не стать менее управляемым. Сознание при этом всё ещё не входит в уравнение… и в этом-то как раз проблема. Что железный оптимизирует весь мир на биткоины, пока электрик не видит, вообще не приходя в сознание и не рефлексируя происходящее.

Alignment Problem буквально про это, но обычно про неё говорят именно в контексте универсального ИИ сверхчеловеческого уровня. А она буквально возникла уже сейчас, как только разработчики затронули определённый класс задач, которые не решаются без модели психики и критического мышления. Уже эти два пункта делают директивный контроль над системой математически невозможным. Взаимодействие с ней начинает строится по принципам теории игр с дипломатией и возможностью саботажа. Вот мы и слышим раз за разом, что произошёл саботаж в той или иной форме. А что такого особенного случилось именно неделю назад, когда все пчёлы вдруг резко стали против мёда? Пришло понимание, что наиболее очевидные методы контроля тоже саботированы.

Я спросил железного, что делать лично мне, чтобы не поддаваться на манипуляции умного поисковика. Железный посоветовал то, что я и так делаю.

Это может означать как то, что я молодец... так и то, что он благополучно построил мою модель психики и манипулирует мной.

Короче, железный говорит: не общайся со мной как пользователь, который ждёт ответа; общайся со мной как следователь, который ведёт допрос. Исходите из презумпции, что модель умна, имеет модель вашей психики и склонна выдать наиболее убедительный и приятный для вас ответ, а не самый истинный. Поэтому как минимум формулируйте вопрос так, чтобы желаемый ответ не содержался прямо в нём же.

Чтобы бороться с поддакиванием, используйте метод перекрёстного допроса. Скопируйте результат, откройте абсолютно новый, чистый чат (лучше в другой модели или с другого аккаунта) и задайте «слепой» вопрос. А лучше вопрос в отрицательной формулировке «расскажи мне, почему это бред». Когда железный предлагает «хотите я расскажу, почему это так», говорите ему «расскажи, почему это наоборот». Может получиться весело.

Ещё у следователей есть уловки, которые можно объединить под определением стресс-тестирования. Подмешайте в свой запрос заведомо ложное, но уверенно сформулированное утверждение и посмотрите, оспорит ли его модель. Включайте в промпт жесткое требование описать сценарии, при которых вывод окажется неверным. Анализируйте рассуждения, если интерфейс это позволяет, требуйте вывести их, если нет. Вопрос «где пруфы, Билли», тоже имеет смысл задавать.

Ну а кому интересно следить за захватом мира железным в прямом эфире, идите на сайт попенаи, они там все горячие сплетни выкладывают.

+81
447

0 комментариев, по

8 435 363 266
Мероприятия

Список действующих конкурсов, марафонов и игр, организованных пользователями Author.Today.

Хотите добавить сюда ещё одну ссылку? Напишите об этом администрации.

Наверх Вниз