Свой собственный GPT на своем компьютере. Локально, бесплатно.
Автор: Sango
...знаю, звучит фантастически. Но с другой стороны еще лет 5-6 назад мы вообще почти слыхом не слыхивали про ИИ, а сейчас их запускают даже на смартфонах (я вон летом пробовал). Или года 4 назад когда я только начал знакомиться с локальными моделями для генерации картинок - качество было скажем так не прямо таки совсем уж. А сейчас вон какие ничешные арты у себя на компе делаю. Прогресс не стоит на месте!

Да и в принципе запустить собственную ИИ как бы "несложно". Вон у Kimi k3 веса в открытом доступе. Нужно то всего 1.5 терабайта памяти. Покупаешь 16 (а лучше про запас 20) штук RTX PRO 6000 96 ГБ (на озоне такая стоит 2.5 миллиона), находишь для них питание (кучу ватт-киловатт), делаешь сервер у себя в холодильнике (чтобы сразу охлаждались), и вперед!

...но ладно, давайте всё-таки рассмотрим более приземленные и доступные варианты. Зависаю в телеграмм-каналах посвященных LLM, и несколько дней назад из одного такого канала узнал о Strata. Это движок заточенный под конкретную архитектуру Qwen3.8-Flash-Next. То есть любую LLM на нем не запустишь, ток конкретные модели. Но за счет заточенности данный движок умеет грамотно перекидывать "экспертов" по разным типам памяти (VRAM/RAM/SSD), за счет чего на 12 гигабайт видеопамяти и 64 гигабайт оперативной памяти можно запустить чекпоинт весом 40-50 гигабайт и добиться от него скорости ответа в 70-80 токенов в секунду!

Короче я не стал тянуть...

...а быстренько скачал и поставил себе это "чудо". Благо мощности у меня как раз подходящие (16 гигов видеопамяти и 64 гига оперативки). Да и вообще ставится и настраивается движок очень легко. Скачивание нужных моделей и файлов например занимает куда как больше времени...

И да, после запуска в первых тестах я действительно увидел те самые 70-80 токенов в секунду. Так что не врут, оно работает!

Дальше пошли уже пляски с расширением функционала. Например прикрутить поиск информации в интернете (как умеют всякие GPT когда задаешь им какой-то нетиповой вопрос или просишь найти информацию) оказалось чуть более хитрой задачей. Точнее оч простой если пользоваться поисковиками вроде DuckDuckGo, но я хотел например поиск через Яндекс (нравится он мне) или Гугл. После полутора часов попыток поправить пару готовых решений (чтобы они стабильно работали) я устал...

...и с помощью того же codex написал свой mcp-модуль. Он работает, и теперь если я прошу LLM чет найти в интернете - он ищет и даже чет находит...

...а потом я упоролся и прикрутил генерацию картинок на базе anima. Да-да, как в том же gpt, где если пишешь в чате запрос и чат понимает его как желание картинки - картинка генерируется! То есть мой чат теперь и художник!

...в общем я уже написал очередной телеграмм-бот для работы с локальной моделью (причем базовую версию бота написала сама Strata) и всеми моими примочками, я сделал отправку картинок прямо в телегу, я общаюсь с ним откуда хочу (где есть интернет конечно), я пробую и тестирую чё она может и че не может. При этом я понимаю что та же GPT намного мощнее и удобнее (и приложение мобильное есть, и функционала до жопы, и комп свой нагружать не надо, и доступен всегда), разве что заморочно ее нынче оплачивать. Но это тем не менее на мой взгляд любопытный эксперимент. Я могу менять модели (выбор небольшой, но он есть), уменьшать уровень цензуры (и просить ту инфу которую GPT откажется обрабатывать, хотя qwen на некоторые вещи тоже ерепенится), прикручивать свой функционал, и не париться с лимитами токенов. И всё это локально. Интернет нужен ток для поиска информации ну и для работы с телеграмм. Круто, не правда ли?

Конечно же вопрос адекватного железа никуда не отпадает. В требованиях указано 12 гигабайт видеопамяти и от 32 гигабайт оперативной, но лучше все же сразу 64. И если с видюхой под это дело пойдет даже 3060 (которую и сейчас можно купить тыщ за 35), то цены на оперативку… вы и сами думаю в курсе скок она нынче стоит…

…мне в этом плане «повезло», ибо свой новый комп я собирал прошлым летом буквально за несколько месяцев до БУМа на память, когда цены были адекватные, и потому решил взять 64 гига. И то понимаю что будь у меня из 96 или вообще 128 - было бы еще круче. Но кто же знал что вон оно как будет…

Так что теперь я счастливый обладатель своего собственного ИИ-чата. Поиграюсь с ним некоторое время, пока не надоест. А дальше может еще чего придумаю. Как-то так)