Человеческая обложка без боли и бесплатно. ч. 3

Автор: Дмитрий Костеников

Ребята, я вообще-то писал статью о том, как сделать обложку достаточно удобным для непрофессионала способом и бесплатными инструментами.

Для примера я использовал Qwen, но пользоваться можно абсолютно любой нейросетью, которая вам удобна.

Однако в комментарии пришли люди и объяснили мне, что Qwen и сам умеет типографику, что пользоваться надо вообще не Qwen, а другими нейросетями, что мои картинки слишком блеклые, а заодно рассказали, как на самом деле работают серьёзные люди.

Отлично)

Значит, сегодня поговорим не об обложках, а о нейросетях.

Какие бывают генераторы, чем они отличаются, что умеют бесплатно, где есть img2img и редактирование, где можно выбирать модель, где за вас всё решает роутер, и почему «лучшая нейросеть» — вообще бессмысленное понятие без конкретной задачи.

Для начала разберёмся с терминами, потому что в комментариях всё это бодро смешалось в одну кастрюлю.

Нейросеть сама по себе — не сайт и не кнопка «Нарисовать».

Грубо говоря, нейросеть — это математическая модель, обученная на огромном количестве данных и умеющая по входному запросу строить результат.

В нашем случае — изображение.

Но и тут важная оговорка: она не «рисует» как человек.

У неё нет руки, кисти, замысла и внутреннего художника, который сидит внутри сервера и старательно выводит вам ведьму.

Она вычисляет изображение.

В одних системах картинка рождается через постепенное уточнение шума, в других — через иные архитектуры, но для нас сейчас достаточно понимать главное:

модель — это движок.

А сайт, приложение или чат, через который мы к нему обращаемся, — это уже интерфейс.

Например, условный сервис может дать вам доступ сразу к нескольким моделям. Сегодня одна лучше рисует людей, другая — архитектуру, третья — хорошо редактирует готовые изображения.

Поэтому фраза «я пользуюсь такой-то нейросетью» часто технически неточна.

Чаще всего человек пользуется сервисом, внутри которого работает одна или несколько моделей.

Модель — собственно генератор.

Это то, что непосредственно создаёт или редактирует изображение.

У разных моделей разный характер: одна лучше понимает сложную композицию, другая лучше держит лица, третья аккуратнее работает с текстом, четвёртая хороша именно в img2img и редактировании.

Сервис — оболочка вокруг модели.

Это сайт или приложение, где есть поле для промпта, кнопки, история генераций, загрузка референсов, иногда редактор.

Агрегатор — сервис, который собирает под одной крышей много разных моделей.

То есть вам не надо отдельно заводить аккаунты у пяти генераторов. Вы заходите в одно место и переключаетесь между ними.

Хаб — примерно то же семейство, но обычно шире.

Там могут быть не только генераторы картинок, но и текстовые модели, видео, музыка, озвучка, апскейл, редактирование, API и прочие инструменты.

Роутер — ещё одна интересная штука.

Вы не выбираете модель сами. Вы даёте задачу, а система решает, какой движок сейчас лучше использовать.

Удобно?

Да.

Контроля меньше?

Тоже да.

Если совсем на пальцах:

модель — двигатель;
сервис — машина;
агрегатор — автопарк;
роутер — диспетчер, который сам решает, какую машину вам подать.

И вот после этого уже становится понятнее, почему спор «Qwen лучше Arena» сам по себе немного странный.

Это всё равно что спорить: что лучше — автомобиль или автопарк?

Где вообще живут модели

Теперь, когда мы примерно поняли, что модель и сервис — не одно и то же, давайте посмотрим, какими способами вообще можно пользоваться генеративными моделями.

Для обычного автора я бы грубо разделил всё на три уровня.

1. Чаты и отдельные сервисы

Это самый простой вариант.

Вы заходите на сайт, пишете запрос, нажимаете кнопку и получаете картинку.

Никаких пайплайнов, API, нод и шаманства.

Плюсы очевидны:

  • низкий порог входа;
  • ничего не надо устанавливать;
  • часто есть бесплатный режим;
  • можно начать работать за пять минут.

Минусы тоже понятны:

  • вы не всегда знаете, какая именно модель работает внутри;
  • часть настроек от вас скрыта;
  • сервис может внезапно поменять модель, лимиты или вообще убрать функцию;
  • точность контроля обычно ниже.

Именно сюда относятся Qwen, ChatGPT, Gemini, Шедеврум и прочие сервисы, где вы в первую очередь общаетесь с интерфейсом, а не с конкретной моделью.

Для большинства людей, которым надо сделать обложку, а не получить диплом инженера по генеративной графике, этого уровня более чем достаточно.

2. Агрегаторы и хабы

Здесь начинается интереснее.

Вместо одного генератора вам дают доступ сразу к нескольким моделям.

Вы можете:

  • выбирать движок сами;
  • сравнивать результаты;
  • использовать разные модели для генерации и редактирования;
  • иногда переключаться между текстом, изображением, видео, музыкой и озвучкой в одном интерфейсе.

Arena AI, о которой мне написали в комментариях, как раз относится к этому семейству.

В некоторых режимах вы выбираете модель сами, в некоторых за вас это делает роутер.

Это уже удобнее для человека, который понимает:

«Вот эту сцену я хочу рисовать здесь, а редактировать — там».

Но тут появляется и обратная сторона: чем больше выбора, тем больше надо понимать, что именно вы выбираете.

3. Локальные пайплайны

А вот это уже следующий этаж.

Модель работает у вас на компьютере.

Вы сами выбираете:

  • какую модель запускать;
  • какой чекпоинт;
  • какие LoRA;
  • какой sampler;
  • seed;
  • ControlNet;
  • img2img;
  • inpainting;
  • апскейл;
  • и ещё примерно сто вещей, о которых нормальный писатель до вчерашнего дня совершенно спокойно не знал.

Самый известный пример такого подхода — Stable Diffusion через ComfyUI или похожие интерфейсы.

Плюсы:

  • максимальный контроль;
  • можно собирать очень сложные пайплайны;
  • хорошая воспроизводимость;
  • можно работать без постоянной привязки к конкретному онлайн-сервису.

Минусы:

  • нужно железо;
  • нужно время;
  • нужно учиться;
  • иногда вместо книги вы внезапно начинаете писать собственный граф из сорока семи нод.

И вот тут проходит довольно простая граница.

Если вам нужна одна приличная обложка раз в полгода — локальная сборка может быть избыточной.

Если вы делаете много иллюстраций, роликов, серий персонажей и хотите жёстко контролировать результат — тогда уже имеет смысл копать глубже.

То есть выбор инструмента зависит не от того, что «профессиональнее».

А от того, какая у вас задача и сколько контроля вам действительно нужно.

Что вообще значит «контроль»

Вот здесь начинается самая полезная часть.

Когда человек говорит: «нейросеть меня не слушается», обычно проблема не в том, что она совсем ничего не понимает.

Проблема в другом: мы хотим контролировать сразу слишком много вещей одним текстовым запросом.

А картинка — это не одна задача.

Это одновременно:

  • композиция;
  • позы;
  • выражения лиц;
  • внешность персонажей;
  • одежда;
  • свет;
  • цвет;
  • фон;
  • стиль;
  • детали;
  • текст.

И чем больше пунктов вы сваливаете в один промпт, тем выше шанс, что модель часть указаний проигнорирует, часть переосмыслит, а часть выполнит так, что вы пожалеете, что вообще её просили.

Поэтому контроль удобнее рассматривать по уровням.

1. Text-to-image

Самый простой вариант:

написали текст → получили картинку.

Хорошо подходит, когда:

  • вы ищете идею;
  • вам не критична точная поза;
  • персонажи ещё не закреплены;
  • вы готовы перебирать варианты.

Плохо подходит, когда вы уже знаете, что хотите почти до сантиметра.

Промпт может быть хоть на страницу, но модель всё равно остаётся соавтором.

Вы попросили:

«девушка слева, мужчина далеко справа, между ними пустота».

Она решила:

«понял: романтическая пара в объятиях».

Бывает.

2. Reference image

Следующий уровень — дать модели картинку-референс.

Это может быть:

  • нужная поза;
  • лицо;
  • одежда;
  • композиция;
  • цветовая схема;
  • атмосфера.

Тут важно понимать: референс — не приказ.

Для одной модели он почти чертёж, для другой — лёгкое пожелание.

Поэтому лучше прямо писать, что именно брать из референса:

«Используй только композицию и позы. Не копируй одежду и внешность».

Или:

«Сохрани лицо персонажа и причёску. Фон и одежду измени полностью».

Чем конкретнее, тем лучше.

3. img2img

Вот это уже серьёзно полезная штука.

Вы даёте готовую картинку и просите её переработать.

Не:

«нарисуй похожее».

А:

«вот исходник, работаем с ним».

Например:

  • сделать ночь вместо дня;
  • заменить лес на город;
  • изменить одежду;
  • добавить туман;
  • сделать более живописную стилизацию;
  • сохранить композицию, но переделать окружение.

Главное преимущество img2img — вы не начинаете каждый раз с нуля.

Именно поэтому перед выбором сервиса полезно заранее выяснить:

умеет ли он вообще работать с исходным изображением?

Если нет, каждое «чуть поправь» может снова превратиться в новый кастинг актёров.

4. Inpainting

Ещё полезнее, если нужно изменить только кусок картинки.

Например:

  • поправить руку;
  • заменить оружие;
  • убрать лишний предмет;
  • переделать лицо;
  • исправить одежду;
  • дорисовать фон.

Вы выделяете область и говорите:

«вот это переделать, всё остальное не трогать».

Это уже сильно ближе к нормальной работе редактора.

Хотя и тут фраза «не трогать» для некоторых моделей носит скорее философский характер.

5. Seed

Seed — это условный стартовый номер генерации.

Если модель и сервис позволяют его фиксировать, можно получать близкие вариации одной и той же композиции вместо полного перезапуска вселенной.

Это особенно полезно, когда:

  • картинка почти устраивает;
  • нужно перебрать мелкие варианты;
  • хочется сохранить общий расклад.

Но не все сервисы показывают seed и не все дают им управлять.

6. Character consistency

Если у вас одна картинка — можно вообще не думать.

Если нужно десять иллюстраций одного героя — начинается боль.

Нейросеть легко нарисует вам:

  • сегодня брюнетку;
  • завтра шатенку;
  • послезавтра совершенно другого человека с тем же именем.

Для серии важны:

  • референсы;
  • закреплённое описание;
  • модели, умеющие работать с identity/reference;
  • иногда LoRA или другие способы фиксации персонажа.

Это уже отдельная тема, но главное понимать:

«нарисуй того же человека» — не всегда достаточно.

7. ControlNet, позы и карты

Это уже уровень локальных или более продвинутых инструментов.

Можно отдельно задать:

  • позу;
  • глубину;
  • контуры;
  • композицию;
  • расположение объектов.

То есть вместо просьбы:

«пусть девушка стоит боком и смотрит через плечо»

вы буквально даёте схему позы.

Вот здесь контроль становится действительно высоким.

Но и порог входа растёт соответственно.

Если всё это свести к одному принципу:

чем важнее вам точность, тем меньше надо надеяться на один хороший промпт и тем больше использовать структурные средства контроля.

Текст — хорошо для идеи.

Референс — лучше для направления.

img2img — для сохранения основы.

inpainting — для локальной правки.

ControlNet и похожие инструменты — для жёсткого управления композицией.

И тогда уже становится понятно, почему вопрос «какая нейросеть лучше?» сам по себе бессмысленный.

Надо спрашивать:

«Какая нейросеть лучше решает именно эту задачу и даёт мне нужный уровень контроля?»

И в итоге всё упирается в очень простой вопрос:

что именно вам сейчас нужно?

Если в данный конкретный момент мне нужны летающие в облаках зефиры, единорожки и феечки, и мне не очень важно, как именно всё это в итоге будет выглядеть, — можно пользоваться вообще любым сервисом, который оказался под рукой.

Написал запрос, получил картинку, понравилось — прекрасно.

Задача решена.

Если же мне нужен почти божественный контроль — чтобы герой был именно тот, стоял именно так, смотрел именно туда, одежда не менялась, композиция не расползалась, а править можно было хоть отдельную пуговицу, — тогда логичнее поставить себе ComfyUI, разобраться с моделями, ControlNet, LoRA, inpainting и прочими радостями и творить со своими героями практически всё что угодно.

Правда, тут есть небольшой нюанс.

Божественный контроль требует божественного железа.

И при нынешних ценах компьютер, на котором всё это будет работать быстро и приятно, вполне способен стоить как чугунный мост.

Поэтому ещё раз:

нет лучшей нейросети вообще.

Есть инструмент, который лучше подходит под конкретную задачу, конкретный бюджет и конкретное количество времени, которое вы готовы на него потратить.

А если вам просто нужна приличная обложка к книге — возможно, всё ещё достаточно пяти кнопок Photoshop)))

+57
102

0 комментариев, по

15K 0 345
Мероприятия

Список действующих конкурсов, марафонов и игр, организованных пользователями Author.Today.

Хотите добавить сюда ещё одну ссылку? Напишите об этом администрации.

Наверх Вниз