Человеческая обложка без боли и бесплатно. ч. 3
Автор: Дмитрий Костеников
Ребята, я вообще-то писал статью о том, как сделать обложку достаточно удобным для непрофессионала способом и бесплатными инструментами.
Для примера я использовал Qwen, но пользоваться можно абсолютно любой нейросетью, которая вам удобна.
Однако в комментарии пришли люди и объяснили мне, что Qwen и сам умеет типографику, что пользоваться надо вообще не Qwen, а другими нейросетями, что мои картинки слишком блеклые, а заодно рассказали, как на самом деле работают серьёзные люди.
Отлично)
Значит, сегодня поговорим не об обложках, а о нейросетях.
Какие бывают генераторы, чем они отличаются, что умеют бесплатно, где есть img2img и редактирование, где можно выбирать модель, где за вас всё решает роутер, и почему «лучшая нейросеть» — вообще бессмысленное понятие без конкретной задачи.
Для начала разберёмся с терминами, потому что в комментариях всё это бодро смешалось в одну кастрюлю.
Нейросеть сама по себе — не сайт и не кнопка «Нарисовать».
Грубо говоря, нейросеть — это математическая модель, обученная на огромном количестве данных и умеющая по входному запросу строить результат.
В нашем случае — изображение.
Но и тут важная оговорка: она не «рисует» как человек.
У неё нет руки, кисти, замысла и внутреннего художника, который сидит внутри сервера и старательно выводит вам ведьму.
Она вычисляет изображение.
В одних системах картинка рождается через постепенное уточнение шума, в других — через иные архитектуры, но для нас сейчас достаточно понимать главное:
модель — это движок.
А сайт, приложение или чат, через который мы к нему обращаемся, — это уже интерфейс.
Например, условный сервис может дать вам доступ сразу к нескольким моделям. Сегодня одна лучше рисует людей, другая — архитектуру, третья — хорошо редактирует готовые изображения.
Поэтому фраза «я пользуюсь такой-то нейросетью» часто технически неточна.
Чаще всего человек пользуется сервисом, внутри которого работает одна или несколько моделей.
Модель — собственно генератор.
Это то, что непосредственно создаёт или редактирует изображение.
У разных моделей разный характер: одна лучше понимает сложную композицию, другая лучше держит лица, третья аккуратнее работает с текстом, четвёртая хороша именно в img2img и редактировании.
Сервис — оболочка вокруг модели.
Это сайт или приложение, где есть поле для промпта, кнопки, история генераций, загрузка референсов, иногда редактор.
Агрегатор — сервис, который собирает под одной крышей много разных моделей.
То есть вам не надо отдельно заводить аккаунты у пяти генераторов. Вы заходите в одно место и переключаетесь между ними.
Хаб — примерно то же семейство, но обычно шире.
Там могут быть не только генераторы картинок, но и текстовые модели, видео, музыка, озвучка, апскейл, редактирование, API и прочие инструменты.
Роутер — ещё одна интересная штука.
Вы не выбираете модель сами. Вы даёте задачу, а система решает, какой движок сейчас лучше использовать.
Удобно?
Да.
Контроля меньше?
Тоже да.
Если совсем на пальцах:
модель — двигатель;
сервис — машина;
агрегатор — автопарк;
роутер — диспетчер, который сам решает, какую машину вам подать.
И вот после этого уже становится понятнее, почему спор «Qwen лучше Arena» сам по себе немного странный.
Это всё равно что спорить: что лучше — автомобиль или автопарк?
Где вообще живут модели
Теперь, когда мы примерно поняли, что модель и сервис — не одно и то же, давайте посмотрим, какими способами вообще можно пользоваться генеративными моделями.
Для обычного автора я бы грубо разделил всё на три уровня.
1. Чаты и отдельные сервисы
Это самый простой вариант.
Вы заходите на сайт, пишете запрос, нажимаете кнопку и получаете картинку.
Никаких пайплайнов, API, нод и шаманства.
Плюсы очевидны:
- низкий порог входа;
- ничего не надо устанавливать;
- часто есть бесплатный режим;
- можно начать работать за пять минут.
Минусы тоже понятны:
- вы не всегда знаете, какая именно модель работает внутри;
- часть настроек от вас скрыта;
- сервис может внезапно поменять модель, лимиты или вообще убрать функцию;
- точность контроля обычно ниже.
Именно сюда относятся Qwen, ChatGPT, Gemini, Шедеврум и прочие сервисы, где вы в первую очередь общаетесь с интерфейсом, а не с конкретной моделью.
Для большинства людей, которым надо сделать обложку, а не получить диплом инженера по генеративной графике, этого уровня более чем достаточно.
2. Агрегаторы и хабы
Здесь начинается интереснее.
Вместо одного генератора вам дают доступ сразу к нескольким моделям.
Вы можете:
- выбирать движок сами;
- сравнивать результаты;
- использовать разные модели для генерации и редактирования;
- иногда переключаться между текстом, изображением, видео, музыкой и озвучкой в одном интерфейсе.
Arena AI, о которой мне написали в комментариях, как раз относится к этому семейству.
В некоторых режимах вы выбираете модель сами, в некоторых за вас это делает роутер.
Это уже удобнее для человека, который понимает:
«Вот эту сцену я хочу рисовать здесь, а редактировать — там».
Но тут появляется и обратная сторона: чем больше выбора, тем больше надо понимать, что именно вы выбираете.
3. Локальные пайплайны
А вот это уже следующий этаж.
Модель работает у вас на компьютере.
Вы сами выбираете:
- какую модель запускать;
- какой чекпоинт;
- какие LoRA;
- какой sampler;
- seed;
- ControlNet;
- img2img;
- inpainting;
- апскейл;
- и ещё примерно сто вещей, о которых нормальный писатель до вчерашнего дня совершенно спокойно не знал.
Самый известный пример такого подхода — Stable Diffusion через ComfyUI или похожие интерфейсы.
Плюсы:
- максимальный контроль;
- можно собирать очень сложные пайплайны;
- хорошая воспроизводимость;
- можно работать без постоянной привязки к конкретному онлайн-сервису.
Минусы:
- нужно железо;
- нужно время;
- нужно учиться;
- иногда вместо книги вы внезапно начинаете писать собственный граф из сорока семи нод.
И вот тут проходит довольно простая граница.
Если вам нужна одна приличная обложка раз в полгода — локальная сборка может быть избыточной.
Если вы делаете много иллюстраций, роликов, серий персонажей и хотите жёстко контролировать результат — тогда уже имеет смысл копать глубже.
То есть выбор инструмента зависит не от того, что «профессиональнее».
А от того, какая у вас задача и сколько контроля вам действительно нужно.
Что вообще значит «контроль»
Вот здесь начинается самая полезная часть.
Когда человек говорит: «нейросеть меня не слушается», обычно проблема не в том, что она совсем ничего не понимает.
Проблема в другом: мы хотим контролировать сразу слишком много вещей одним текстовым запросом.
А картинка — это не одна задача.
Это одновременно:
- композиция;
- позы;
- выражения лиц;
- внешность персонажей;
- одежда;
- свет;
- цвет;
- фон;
- стиль;
- детали;
- текст.
И чем больше пунктов вы сваливаете в один промпт, тем выше шанс, что модель часть указаний проигнорирует, часть переосмыслит, а часть выполнит так, что вы пожалеете, что вообще её просили.
Поэтому контроль удобнее рассматривать по уровням.
1. Text-to-image
Самый простой вариант:
написали текст → получили картинку.
Хорошо подходит, когда:
- вы ищете идею;
- вам не критична точная поза;
- персонажи ещё не закреплены;
- вы готовы перебирать варианты.
Плохо подходит, когда вы уже знаете, что хотите почти до сантиметра.
Промпт может быть хоть на страницу, но модель всё равно остаётся соавтором.
Вы попросили:
«девушка слева, мужчина далеко справа, между ними пустота».
Она решила:
«понял: романтическая пара в объятиях».
Бывает.
2. Reference image
Следующий уровень — дать модели картинку-референс.
Это может быть:
- нужная поза;
- лицо;
- одежда;
- композиция;
- цветовая схема;
- атмосфера.
Тут важно понимать: референс — не приказ.
Для одной модели он почти чертёж, для другой — лёгкое пожелание.
Поэтому лучше прямо писать, что именно брать из референса:
«Используй только композицию и позы. Не копируй одежду и внешность».
Или:
«Сохрани лицо персонажа и причёску. Фон и одежду измени полностью».
Чем конкретнее, тем лучше.
3. img2img
Вот это уже серьёзно полезная штука.
Вы даёте готовую картинку и просите её переработать.
Не:
«нарисуй похожее».
А:
«вот исходник, работаем с ним».
Например:
- сделать ночь вместо дня;
- заменить лес на город;
- изменить одежду;
- добавить туман;
- сделать более живописную стилизацию;
- сохранить композицию, но переделать окружение.
Главное преимущество img2img — вы не начинаете каждый раз с нуля.
Именно поэтому перед выбором сервиса полезно заранее выяснить:
умеет ли он вообще работать с исходным изображением?
Если нет, каждое «чуть поправь» может снова превратиться в новый кастинг актёров.
4. Inpainting
Ещё полезнее, если нужно изменить только кусок картинки.
Например:
- поправить руку;
- заменить оружие;
- убрать лишний предмет;
- переделать лицо;
- исправить одежду;
- дорисовать фон.
Вы выделяете область и говорите:
«вот это переделать, всё остальное не трогать».
Это уже сильно ближе к нормальной работе редактора.
Хотя и тут фраза «не трогать» для некоторых моделей носит скорее философский характер.
5. Seed
Seed — это условный стартовый номер генерации.
Если модель и сервис позволяют его фиксировать, можно получать близкие вариации одной и той же композиции вместо полного перезапуска вселенной.
Это особенно полезно, когда:
- картинка почти устраивает;
- нужно перебрать мелкие варианты;
- хочется сохранить общий расклад.
Но не все сервисы показывают seed и не все дают им управлять.
6. Character consistency
Если у вас одна картинка — можно вообще не думать.
Если нужно десять иллюстраций одного героя — начинается боль.
Нейросеть легко нарисует вам:
- сегодня брюнетку;
- завтра шатенку;
- послезавтра совершенно другого человека с тем же именем.
Для серии важны:
- референсы;
- закреплённое описание;
- модели, умеющие работать с identity/reference;
- иногда LoRA или другие способы фиксации персонажа.
Это уже отдельная тема, но главное понимать:
«нарисуй того же человека» — не всегда достаточно.
7. ControlNet, позы и карты
Это уже уровень локальных или более продвинутых инструментов.
Можно отдельно задать:
- позу;
- глубину;
- контуры;
- композицию;
- расположение объектов.
То есть вместо просьбы:
«пусть девушка стоит боком и смотрит через плечо»
вы буквально даёте схему позы.
Вот здесь контроль становится действительно высоким.
Но и порог входа растёт соответственно.
Если всё это свести к одному принципу:
чем важнее вам точность, тем меньше надо надеяться на один хороший промпт и тем больше использовать структурные средства контроля.
Текст — хорошо для идеи.
Референс — лучше для направления.
img2img — для сохранения основы.
inpainting — для локальной правки.
ControlNet и похожие инструменты — для жёсткого управления композицией.
И тогда уже становится понятно, почему вопрос «какая нейросеть лучше?» сам по себе бессмысленный.
Надо спрашивать:
«Какая нейросеть лучше решает именно эту задачу и даёт мне нужный уровень контроля?»
И в итоге всё упирается в очень простой вопрос:
что именно вам сейчас нужно?
Если в данный конкретный момент мне нужны летающие в облаках зефиры, единорожки и феечки, и мне не очень важно, как именно всё это в итоге будет выглядеть, — можно пользоваться вообще любым сервисом, который оказался под рукой.
Написал запрос, получил картинку, понравилось — прекрасно.
Задача решена.
Если же мне нужен почти божественный контроль — чтобы герой был именно тот, стоял именно так, смотрел именно туда, одежда не менялась, композиция не расползалась, а править можно было хоть отдельную пуговицу, — тогда логичнее поставить себе ComfyUI, разобраться с моделями, ControlNet, LoRA, inpainting и прочими радостями и творить со своими героями практически всё что угодно.
Правда, тут есть небольшой нюанс.
Божественный контроль требует божественного железа.
И при нынешних ценах компьютер, на котором всё это будет работать быстро и приятно, вполне способен стоить как чугунный мост.
Поэтому ещё раз:
нет лучшей нейросети вообще.
Есть инструмент, который лучше подходит под конкретную задачу, конкретный бюджет и конкретное количество времени, которое вы готовы на него потратить.
А если вам просто нужна приличная обложка к книге — возможно, всё ещё достаточно пяти кнопок Photoshop)))