pixvibe
← Все статьи

Нейросеть рисует картинки по описанию или меняет стиль твоего фото: в чем разница и что выбрать

· 20 мин · Артур Лемешев
Нейросеть рисует картинки по описанию или меняет стиль твоего фото: в чем разница и что выбрать

Ты набираешь в нейросети описание: девушка в осеннем парке, мягкий свет, пальто цвета охры. Через несколько секунд картинка готова и выглядит красиво, но на ней незнакомый человек. Потом ты загружаешь свое фото в другой сервис, выбираешь стиль, и на экране появляешься ты сам, только в новом образе. Со стороны кажется, что работает одна нейросеть, хотя перед тобой два способа с разным входом, разным результатом и разными причинами ошибок.

Нейросеть, которая делает картинки по описанию, стартует из случайного шума и строит изображение под слова. Нейросеть, которая меняет стиль фото, стартует из твоего снимка и перерисовывает его под слова. Разница в стартовой точке определяет почти все остальное: похож ли результат на тебя, повторится ли он при следующем запуске, где появятся ошибки и сколько попыток понадобится.

Как нейросеть рисует картинки по описанию

Рисование картинок по описанию технически называется превращением текста в изображение. Нейросеть получает только слова и в большинстве современных генераторов начинает с пустоты, и эта пустота выглядит как случайный шум, похожий на помехи старого телевизора. Стартовые данные берутся из случайного распределения, а если их не задать вручную, их создает генератор случайных чисел.

Основная работа начинается потом. Нейросеть много раз подряд слегка очищает шум, и на каждом шаге слова из описания подсказывают, в какую сторону очищать. Так из хаоса постепенно получаются парк, пальто и мягкий свет. Одному описанию соответствует очень много возможных картинок, а нейросеть выбирает из них одну.

Схема: четыре шага от описания словами до новой картинки
Описание проходит через случайный шум и серию шагов очистки, на каждом из которых слова подсказывают направление

Результат меняется от запуска к запуску. Если не фиксировать зерно шума, то есть стартовую точку, те же самые слова каждый раз дадут новый вариант, ведь шум на старте каждый раз другой.

Послушность тексту можно усиливать, но за нее приходится платить. В параметрах многих генераторов есть настройка, которая определяет, насколько жестко картинка следует описанию. Чем она выше, тем ближе результат к словам и тем ниже качество изображения. В основе лежит прием, где модель считает свою оценку дважды, с текстом и без него, а затем сдвигает результат в сторону текста, и это дает компромисс между качеством и разнообразием.

Описание задает направление, а шум задает конкретную картинку. Составление самих слов разобрано в статье про промпты для фото простыми словами, а общий вход в тему собран в материале про генерацию изображений нейросетью для новичка.

Что писать в описании, когда снимка нет

Раз слова остаются единственной подсказкой, их приходится выбирать аккуратно, ведь нейросеть читает только написанное, и намеки пропадают. Расплывчатое описание вроде красивая девушка в парке оставляет огромное поле для выбора: возраст, прическа, время года, ракурс, цвет, стиль съемки определит случайный шум. Результат может получиться приятным, но с картинкой в голове он совпадает редко.

Чем больше деталей названо, тем меньше вариантов остается нейросети. Рабочее описание обычно складывается из нескольких блоков: кто или что в кадре, где происходит действие, какой свет, какая техника или стиль, какой ракурс. Сравни две формулировки.

  • Расплывчатая: девушка в парке осенью.
  • Собранная: девушка лет двадцати пяти идет по аллее осеннего парка, пальто цвета охры, мягкий рассеянный свет, снято на уровне глаз, пленочная фотография, неглубокая резкость.

Нужного лица вторая формулировка не даст, зато настроение, одежда и свет совпадут с задумкой. Сколько бы деталей ни было в описании, лицо конкретного человека в них не поместится.

Как нейросеть меняет стиль фото

Представь, что к словам у нейросети добавился твой снимок. Способ называют перерисовкой фото нейросетью, а в обиходе еще сменой стиля. Нейросеть по-прежнему очищает шум по шагам, но начинает иначе: вместо чистого шума она берет твое фото и сначала намеренно портит его, добавляя шум поверх, а затем очищает получившееся под описание.

Это похоже на фотографию, на которую капнули водой. Если капля маленькая, контуры чуть смягчатся, а если залить снимок целиком, останется общее пятно. Нейросеть делает то же самое математически: чем больше шума добавлено, тем меньше от оригинала сохранится к концу. На этой идее держатся режимы вроде «сделай в стиле аниме», «сделай как пленочный кадр» или «сделай как постер».

Схема: четыре шага от твоего фото до фото в новом стиле
К снимку добавляется шум, затем нейросеть очищает его под описание, и общая композиция сохраняется

Исходное фото служит точкой старта, поэтому при невысокой силе изменения композиция обычно сохраняется. Поза и расположение предметов чаще всего остаются на местах, а нейросеть меняет фактуру, свет, стиль и детали. Из этого вытекает и ограничение: неудачный фон исходника, вероятно, попадет и в результат, просто в другом оформлении.

Существует и родственный режим, где эталонное фото подается нейросети рядом с текстом как подсказка, а его влияние регулируется коэффициентом. В обоих случаях в запросе есть твоя фотография, и этим такие способы отличаются от описания. Какие варианты обработки бывают без ручной ретуши, разобрано в статье про обработку фото нейросетью без Photoshop.

Главное отличие: что подается на вход

Различие между способами в том, что у способа по описанию на входе слова и шум, а у способа со стилем на входе слова и твое фото. Остальные отличия вытекают из этого.

Схема: что подается на вход при рисовании по описанию и при смене стиля фото
Слова нужны обоим способам, но в одном случае им противостоит случайный шум, а в другом твой снимок
ПараметрКартинка по описаниюСтиль твоего фото
Что подается на входТолько словаСлова и твой снимок
С чего стартует нейросетьСо случайного шумаС твоего фото, к которому добавлен шум
Что получается на выходеНовая сцена и новые лицаТвоя сцена в другом исполнении
Сходство с конкретным человекомНет, лицо придумываетсяЕсть, пока сила изменения невысока
ПовторяемостьНизкая, пока не зафиксировано зерно шумаВыше при невысокой силе, снимок служит отправной точкой
Контроль над композициейТолько словамиСнимком и словами
Типичная задачаИллюстрация, идея, фон, персонажАватар, тренд, образ из своего фото

Способы решают разные задачи и почти не конкурируют друг с другом. Когда нужна картинка без конкретного человека, например обложка, фон для презентации или иллюстрация к идее, лучше работает описание. Когда нужен ты сам или твой питомец в другом образе, описание бессильно, потому что в нем нет информации о том, как ты выглядишь.

Ползунок силы: насколько менять фото

У способа со стилем есть настройка, которую называют силой изменения. Она принимает значение от нуля до единицы и отвечает на простой вопрос: сколько от исходного снимка оставить. Чем ниже значение, тем сильнее результат похож на фото, а чем выше, тем больше свободы у нейросети. На значении единица исходный снимок практически игнорируется, и способ сводится к обычному рисованию по описанию.

Сила связана с числом шагов очистки. Допустим, в одной из популярных реализаций задано пятьдесят шагов, а сила равна 0,8: тогда к снимку добавляется шум примерно на сорок шагов, и столько же шагов уходит на его очистку. Чем меньше шума, тем короче путь и тем меньше места для перерисовки. В готовых шаблонах этот ползунок может быть спрятан внутри и тебе не виден.

Схема: шкала силы изменения от близкого к фото до близкого к описанию
Слева результат почти повторяет снимок, справа от снимка остается только общее настроение

Для ориентира шкалу можно разделить на три зоны. Это условное деление для понимания, у каждого сервиса границы проходят по-своему.

  • Низкая сила: меняются цвет и свет. Снимок остается почти прежним, а фото получает другое настроение.
  • Средняя сила: меняются стиль и фон. Заметно меняется оформление, мелкие черты лица уже могут слегка сместиться. Стили вроде аниме или ретро обычно лежат в этой зоне.
  • Высокая сила: от фото остается общее впечатление. Нейросеть почти не опирается на снимок, и на сходство лица рассчитывать не стоит.

Примеры средней зоны есть в материалах про аниме-аватар из фото и про мультяшный аватар: там показано, как выглядят такие стили на практике.

Какие еще настройки встречаются рядом с ползунком

Сила изменения живет не одна, у нее есть соседи, и в разных сервисах их набор различается. Названия бывают другими, но смысл у большинства настроек одинаков, и знать его полезно, даже если ручек перед глазами нет. Что будет, если покрутить каждую из них?

НастройкаЗа что отвечаетЧто происходит при увеличенииГде встречается
Зерно шумаСтартовая точка генерацииМеняется сам вариант картинки, одинаковое зерно возвращает тот же стартОба способа
Число шаговСколько раз шум очищаетсяКачество обычно растет, но генерация идет дольшеОба способа
Послушность текстуНасколько жестко картинка следует описаниюКартинка ближе к словам, качество изображения снижаетсяОба способа
Сила измененияСколько шума добавляется к снимкуОт фото остается меньше, при единице снимок почти игнорируетсяТолько смена стиля

Таблица подсказывает порядок действий, если результат не нравится. Сначала стоит поменять зерно, ведь это самый дешевый способ получить другой вариант. Затем можно подправить описание. Силу изменения трогают в последнюю очередь и только при смене стиля, потому что она сильнее остальных влияет на сходство с исходником. Конечно, в готовых шаблонах эти ручки спрятаны, и тогда вся работа сводится к выбору шаблона и исходного снимка.

Почему по описанию не нарисовать именно тебя

Можно ли описать себя словами и получить похожую картинку? Нет, и причина кроется в устройстве способа. Слова вроде светлые волосы, зеленые глаза, родинка у губы подходят тысячам людей. Нейросеть получает общую подсказку и придумывает лицо, которое под нее подходит. Оно может оказаться красивым, но оно будет новым.

Чтобы лицо узнавалось, нейросети нужна информация о нем, а эта информация содержится в фотографии. Поэтому снимок передают нейросети в режиме смены стиля или в режиме с эталонным фото рядом с текстом.

Но даже со снимком сходство не гарантировано. Чем сильнее изменение, тем больше шансов, что лицо слегка уйдет в сторону. Нейросеть перерисовывает черты, и мелкие детали вроде формы губ или линии бровей могут смениться на более типичные для выбранного стиля. Так работает сам механизм, и сервис при этом исправен. Если узнаваемость важнее эффектности, силу изменения лучше держать низкой или средней и брать исходник, где лицо видно целиком, в фокусе и при мягком свете.

Какой снимок взять за основу для смены стиля

Исходник определяет композицию и лицо, поэтому качество результата во многом решается еще до загрузки. Если на снимке лицо закрыто, размыто или обрезано, нейросети приходится достраивать его самой, то есть угадывать, а угаданное лицо уже не твое.

Перед загрузкой снимок можно проверить по короткому списку.

  1. Лицо видно целиком. Волосы, очки и ладонь не перекрывают черты, голова целиком помещается в кадр.
  2. Свет мягкий и ровный. Резкие тени скрывают часть черт, а скрытое приходится угадывать.
  3. Камера на уровне глаз. Снимок снизу или сверху искажает пропорции, и искажение легко переносится в новый стиль.
  4. На кадре один человек. Так проще проверить сходство и точнее подобрать стиль под одно лицо.
  5. Фон простой. Композиция исходника сохраняется, поэтому лишний предмет за спиной переедет в результат.

Фильтры красоты и сильное сглаживание кожи на исходнике тоже мешают, потому что гладкая кожа на снимке при стилизации легко становится еще более гладкой. Подготовка снимков подробнее разобрана в статье про фото на аватарку.

Где ошибается каждый подход

Ошибки обоих способов следуют из их устройства, поэтому многие из них можно предсказать заранее. Рисование по описанию начинает с шума и не привязано к реальному человеку, поэтому проблемы связаны со свободой нейросети. Смена стиля привязана к снимку, поэтому проблемы связаны с тем, что нейросеть заново рисует уже существующее.

Схема: типичные ошибки способа по описанию и способа со сменой стиля
У каждого способа свой набор типичных ошибок, и они вытекают из того, что подается на вход
СпособТипичная ошибкаПочему возникаетЧто с этим делать
По описаниюНезнакомое лицо вместо нужногоВ запросе нет снимка, лицо придумываетсяВзять способ со сменой стиля
По описаниюЛишние пальцы, странные детали, сбитые надписиМелкие и сложные детали нейросеть рисует приблизительноГенерировать несколько вариантов и выбирать
По описаниюКаждый раз другой результатСтартовый шум случайныйФиксировать зерно или брать шаблон
Стиль фотоЛицо стало чуть другимСлишком высокая сила измененияСнизить силу или взять другой исходник
Стиль фотоКожа выглядит как пластикНейросеть сглаживает мелкие детали при перерисовкеВыбрать более мягкий стиль
Стиль фотоФон перетянул на себя вниманиеКомпозиция исходника сохраняется целикомВзять снимок с простым фоном

Лишние пальцы и сбитые надписи бывают у разных генераторов, и сервис при этом может быть вполне исправным. Руки и текст состоят из мелких деталей, а на мелких деталях нейросеть ошибается заметнее. Эти места нужно проверять глазами в полном размере кадра.

Пластиковая кожа встречается у обоих способов, но заметнее при смене стиля. Стилизация упрощает мелкие детали, поэтому поры и волоски могут слиться в гладкую поверхность. Для живого результата лучше выбирать стили с зерном и естественным светом, чем глянцевые. Если кадр получился мягким, а нужна резкость, поможет разбор про улучшение качества фото.

Одна идея в двух режимах: пример по шагам

Разницу хорошо видно на одной задаче. Допустим, нужна осенняя картинка для ленты, и героиня на ней должна быть похожа на тебя. Сначала выбери режим по описанию и напиши, что видишь в голове: девушка в пальто цвета охры идет по аллее, мягкий свет. Нейросеть выдаст несколько вариантов. Атмосфера, скорее всего, совпадет и одежда тоже, но лицо окажется чужим, и новые попытки этого не исправят, потому что в запросе нет информации о тебе.

Теперь повтори задачу вторым способом. Загрузи свое фото с четким лицом при мягком свете и напиши короткое описание, где задан только стиль: осенний парк, пальто цвета охры, пленочная фотография. Нейросеть возьмет твой снимок как основу, добавит шум, затем очистит его под слова. Шанс сохранить узнаваемое лицо здесь заметно выше, поза в основном сохранится, а фон и одежда могут поменяться на осенние. Результат ближе к цели, хотя фон может получиться менее фантазийным, чем в первом варианте, ведь композиция унаследована от исходника.

Из примера видно три вещи.

  1. Идея и настроение приходят из слов в обоих режимах. Описание нужно обоим способам.
  2. Сходство лица берется из снимка. Без снимка лицо придумывается заново.
  3. Свобода сцены растет вместе с силой изменения. Чем выше сила, тем ближе вторая картинка к первой и тем меньше в ней тебя.

Если нужна и свобода сцены, и твое лицо, придется искать баланс на ползунке или обращаться к готовому шаблону, где баланс уже задан.

Как проверить сходство лица на готовом кадре

Глаз быстро привыкает к картинке, и первое впечатление оказывается ненадежным, поэтому проверку лучше вести по схеме.

  1. Положи рядом исходник и результат. Сравнивать нужно в одном масштабе, иначе разница форм теряется.
  2. Сверь глаза и брови. Это самое узнаваемое в лице: расстояние между глазами, линия бровей, разрез.
  3. Проверь нос и губы. Форма губ и ширина носа чаще всего смещаются при перерисовке.
  4. Посмотри на овал лица и прическу. Если линия подбородка стала другой, узнаваемость уже падает.
  5. Сравни выражение. Улыбка могла стать шире или исчезнуть, а вместе с ней изменился характер кадра.

Если несколько пунктов не совпали, кадр лучше перегенерировать, снизив силу изменения или поменяв исходник. Один несовпавший пункт в стилизованном образе допустим, ведь аниме или мультфильм упрощают черты по самой природе стиля.

Как получить серию кадров в одном образе

Блогеру или автору аватарок редко хватает одной картинки, ему нужна серия, где человек и стиль совпадают от кадра к кадру. Как с этим справляется каждый способ? При рисовании по описанию каждый запуск стартует из нового шума, поэтому даже идентичный текст дает разных героев. Добиться повторения можно, зафиксировав зерно шума, но тогда зафиксируется и композиция, а героя из текста по-прежнему придется угадывать.

Со сменой стиля серию собрать проще, потому что композицию и черты задает исходник, и близкие результаты получаются от кадра к кадру. Для серии достаточно менять либо снимок, либо стиль, оставляя второе постоянным. Так получаются подборки из нескольких образов одного человека, например портрет в аниме, ретро и журнальном стиле, и для них стоит заранее подобрать несколько удачных исходников с разных ракурсов.

Но если исходник неудачный, ошибка размножится по всей серии. Поэтому перед десятью кадрами стоит сделать один и сравнить лицо с оригиналом: проверка занимает считанные минуты, а правки всей серии намного дольше.

Когда что выбирать

Выбор между способами сводится к вопросу, нужен ли на картинке конкретный человек: если нужен, берется смена стиля, а если нет, берется описание.

Схема: когда рисовать по описанию и когда менять стиль фото
Рисовать по описанию стоит там, где человека на картинке нет или он выдуманный, а менять стиль фото там, где нужен ты сам

Рисовать по описанию подходит в таких случаях.

  • Нужна иллюстрация без людей. Обложка, фон, предмет, пейзаж, абстракция.
  • Нужен эскиз или мудборд. Интерьер, настроение кадра, образ героя, которого не существует.
  • Нужен нестандартный сюжет. Сцена, которую невозможно снять, например город на облаках.

Менять стиль фото подходит в таких случаях.

  • Нужен ты сам или близкий человек в новом образе. Аватар, трендовая картинка для ленты, подарок.
  • Важна узнаваемость. Сходство берется из снимка, потому что слова подходят многим лицам.
  • Нужна повторяемая серия. Один человек в нескольких стилях с общей основой.

Бывают и смешанные задачи. Допустим, нужен персонаж с твоим лицом на выдуманном фоне. Тогда логично сначала получить фон по описанию, а потом совместить его с портретом, либо взять режим, где эталонное фото подается рядом с текстом. Какие бесплатные сервисы умеют эти режимы и в чем их ограничения, собрано в обзоре про бесплатные нейросети для фото и видео.

Как меняются формулировки в двух режимах

Слова нужны обоим способам, но писать их приходится по-разному. Когда снимка нет, описание несет всю нагрузку и должно содержать героя, место, свет и стиль. Когда снимок есть, героя и композицию уже показала фотография, и в описании остается то, что нужно изменить. Сравни, как выглядит одна и та же идея в обоих режимах.

РежимЧто обязательно назватьПример формулировки
По описаниюГероя, место, свет, стиль, ракурсДевушка идет по аллее осеннего парка, пальто цвета охры, мягкий свет, пленочная фотография
Стиль фотоТолько стиль, свет и настроениеОсенний парк, мягкий свет, пленочная фотография

Во втором случае формулировка короче, и это удобно, потому что лишние слова про героя могут конфликтовать с тем, что уже видно на снимке. Если в описании написана блондинка, а на фото брюнетка, нейросеть получит два противоречивых сигнала и ответит на них непредсказуемо. Поэтому при смене стиля о внешности лучше молчать и оставлять ее снимку.

Соседние задачи: оживление и улучшение

Рядом с этими двумя способами есть еще два, и их легко перепутать. Оживление фото превращает неподвижный снимок в короткое видео, где человек моргает, поворачивает голову или улыбается. Улучшение качества поднимает резкость и убирает шум без изменения содержания кадра. Новую сцену они не рисуют и стиль не меняют, потому что решают другую задачу.

Отличить задачи можно по вопросу «что должно измениться». Другая картинка по смыслу означает рисование по описанию, а тот же человек в другом образе означает смену стиля. Тот же кадр, но живой, получается через оживление, о нем рассказано в статье про то, как оживить фото, а тот же кадр, но чище и резче, дает улучшение. Правильно выбранная задача сберегает попытки, которые иначе уходят на неподходящий режим.

Чьи фото можно загружать

Способ со сменой стиля работает с лицом, поэтому у него есть дополнительное правило: загружать стоит свои снимки либо снимки людей, которые согласны на такую обработку. Нейросеть технически перерисует любое лицо на фото, и результат легко распространить дальше, а вот вернуть его уже не получится. Если на кадре друг, ребенок или коллега, спросить разрешения проще, чем потом объясняться.

Тот же принцип касается публикации. Перерисованный портрет остается портретом конкретного человека, и его появление в ленте затрагивает этого человека.

Шаблон вместо описания: третий путь

Есть третий вариант. В описании приходится подбирать слова, в смене стиля подбирать силу изменения и формулировку. В шаблоне эти настройки заданы заранее, поэтому тебе остается загрузить фото.

Снимок в таком случае задает человека и композицию, готовое описание задает стиль, а настройки уже выставлены. Шаблон подходит, когда нужна трендовая картинка из своего фото, а изучать промпты не хочется. Стили ограничены набором шаблонов, и нестандартную сцену из слов он не нарисует, для такой задачи понадобится первый способ.

pixvibe сейчас работает в режиме предзапуска, генерация открыта по вейтлисту. Посмотреть, как выглядят шаблоны, и встать в лист можно на странице трендовых фото-шаблонов. О том, какие тренды сейчас залетают в лентах, рассказано в статье про фото-тренды соцсетей.

Частые вопросы про нейросеть, которая делает картинки

Дает ли нейросеть для картинок по описанию одно изображение на один текст? Нет, если не фиксировать зерно шума. Стартовая точка случайная, поэтому тот же текст дает разные картинки.

Можно ли нарисовать картинку по описанию так, чтобы человек был похож на меня? По одному описанию нельзя: слова подходят многим людям, а нейросеть придумывает лицо под них. Для сходства нужен снимок, поэтому используется режим со сменой стиля или режим с эталонным фото рядом с текстом.

Чем перерисовка фото нейросетью лучше обычного фильтра? Нейросеть добавляет шум и заново рисует изображение под описание, поэтому она способна менять форму, фактуру и фон.

Можно ли сохранить лицо на фото при смене стиля? Шансы выше, если держать силу изменения низкой или средней и брать исходник с четким лицом. Гарантии нет, мелкие черты могут сместиться, особенно в сильно стилизованных образах.

Что значит, что нейросеть превращает текст в изображение? Так называется способ рисования по описанию: на вход подается текст, на выходе получается картинка.

Нужно ли писать длинное описание для смены стиля фото? Обычно хватает короткого. Композицию и человека уже задает снимок, а описание отвечает за стиль, свет и настроение. Длинные описания нужны там, где снимка нет.

Нужен ли мощный компьютер для обоих способов? Для онлайн-сервисов нет, тяжелые вычисления идут на их серверах, и достаточно браузера или приложения.

Почему иногда результат выглядит хуже исходного фото? Нейросеть заново рисует изображение и пиксели исходника не улучшает. На сложных деталях она может ошибиться, поэтому результат нужно проверять и, если нужно, запускать заново с другим исходником или стилем.

Коротко: как сделать картинку по описанию или по своему фото

Нужна картинка без конкретного человека? Опиши ее словами по блокам, сгенерируй несколько вариантов и выбери лучший. Нужен ты в новом образе? Загрузи четкое фото лица при мягком свете и выбери стиль, не поднимая силу изменения выше средней. Не хочется настраивать ни слова, ни силу? Возьми готовый шаблон.

Перед публикацией открой кадр в полном размере и проверь руки, надписи, фон и сходство лица с оригиналом. Последнее слово остается за твоим глазом. Если хочешь попробовать третий путь, шаблоны pixvibe доступны через вейтлист на странице трендовых фото, а для самостоятельных экспериментов с описанием пригодится шаблон «Генерация картинок».

Хочешь так же — из своего фото?

Выбери шаблон, загрузи фото — остальное pixvibe сделает сам.

Смотреть шаблоны