Ты набираешь в нейросети описание: девушка в осеннем парке, мягкий свет, пальто цвета охры. Через несколько секунд картинка готова и выглядит красиво, но на ней незнакомый человек. Потом ты загружаешь свое фото в другой сервис, выбираешь стиль, и на экране появляешься ты сам, только в новом образе. Со стороны кажется, что работает одна нейросеть, хотя перед тобой два способа с разным входом, разным результатом и разными причинами ошибок.
Нейросеть, которая делает картинки по описанию, стартует из случайного шума и строит изображение под слова. Нейросеть, которая меняет стиль фото, стартует из твоего снимка и перерисовывает его под слова. Разница в стартовой точке определяет почти все остальное: похож ли результат на тебя, повторится ли он при следующем запуске, где появятся ошибки и сколько попыток понадобится.
Как нейросеть рисует картинки по описанию
Рисование картинок по описанию технически называется превращением текста в изображение. Нейросеть получает только слова и в большинстве современных генераторов начинает с пустоты, и эта пустота выглядит как случайный шум, похожий на помехи старого телевизора. Стартовые данные берутся из случайного распределения, а если их не задать вручную, их создает генератор случайных чисел.
Основная работа начинается потом. Нейросеть много раз подряд слегка очищает шум, и на каждом шаге слова из описания подсказывают, в какую сторону очищать. Так из хаоса постепенно получаются парк, пальто и мягкий свет. Одному описанию соответствует очень много возможных картинок, а нейросеть выбирает из них одну.

Результат меняется от запуска к запуску. Если не фиксировать зерно шума, то есть стартовую точку, те же самые слова каждый раз дадут новый вариант, ведь шум на старте каждый раз другой.
Послушность тексту можно усиливать, но за нее приходится платить. В параметрах многих генераторов есть настройка, которая определяет, насколько жестко картинка следует описанию. Чем она выше, тем ближе результат к словам и тем ниже качество изображения. В основе лежит прием, где модель считает свою оценку дважды, с текстом и без него, а затем сдвигает результат в сторону текста, и это дает компромисс между качеством и разнообразием.
Описание задает направление, а шум задает конкретную картинку. Составление самих слов разобрано в статье про промпты для фото простыми словами, а общий вход в тему собран в материале про генерацию изображений нейросетью для новичка.
Что писать в описании, когда снимка нет
Раз слова остаются единственной подсказкой, их приходится выбирать аккуратно, ведь нейросеть читает только написанное, и намеки пропадают. Расплывчатое описание вроде красивая девушка в парке оставляет огромное поле для выбора: возраст, прическа, время года, ракурс, цвет, стиль съемки определит случайный шум. Результат может получиться приятным, но с картинкой в голове он совпадает редко.
Чем больше деталей названо, тем меньше вариантов остается нейросети. Рабочее описание обычно складывается из нескольких блоков: кто или что в кадре, где происходит действие, какой свет, какая техника или стиль, какой ракурс. Сравни две формулировки.
- Расплывчатая: девушка в парке осенью.
- Собранная: девушка лет двадцати пяти идет по аллее осеннего парка, пальто цвета охры, мягкий рассеянный свет, снято на уровне глаз, пленочная фотография, неглубокая резкость.
Нужного лица вторая формулировка не даст, зато настроение, одежда и свет совпадут с задумкой. Сколько бы деталей ни было в описании, лицо конкретного человека в них не поместится.
Как нейросеть меняет стиль фото
Представь, что к словам у нейросети добавился твой снимок. Способ называют перерисовкой фото нейросетью, а в обиходе еще сменой стиля. Нейросеть по-прежнему очищает шум по шагам, но начинает иначе: вместо чистого шума она берет твое фото и сначала намеренно портит его, добавляя шум поверх, а затем очищает получившееся под описание.
Это похоже на фотографию, на которую капнули водой. Если капля маленькая, контуры чуть смягчатся, а если залить снимок целиком, останется общее пятно. Нейросеть делает то же самое математически: чем больше шума добавлено, тем меньше от оригинала сохранится к концу. На этой идее держатся режимы вроде «сделай в стиле аниме», «сделай как пленочный кадр» или «сделай как постер».

Исходное фото служит точкой старта, поэтому при невысокой силе изменения композиция обычно сохраняется. Поза и расположение предметов чаще всего остаются на местах, а нейросеть меняет фактуру, свет, стиль и детали. Из этого вытекает и ограничение: неудачный фон исходника, вероятно, попадет и в результат, просто в другом оформлении.
Существует и родственный режим, где эталонное фото подается нейросети рядом с текстом как подсказка, а его влияние регулируется коэффициентом. В обоих случаях в запросе есть твоя фотография, и этим такие способы отличаются от описания. Какие варианты обработки бывают без ручной ретуши, разобрано в статье про обработку фото нейросетью без Photoshop.
Главное отличие: что подается на вход
Различие между способами в том, что у способа по описанию на входе слова и шум, а у способа со стилем на входе слова и твое фото. Остальные отличия вытекают из этого.

| Параметр | Картинка по описанию | Стиль твоего фото |
|---|---|---|
| Что подается на вход | Только слова | Слова и твой снимок |
| С чего стартует нейросеть | Со случайного шума | С твоего фото, к которому добавлен шум |
| Что получается на выходе | Новая сцена и новые лица | Твоя сцена в другом исполнении |
| Сходство с конкретным человеком | Нет, лицо придумывается | Есть, пока сила изменения невысока |
| Повторяемость | Низкая, пока не зафиксировано зерно шума | Выше при невысокой силе, снимок служит отправной точкой |
| Контроль над композицией | Только словами | Снимком и словами |
| Типичная задача | Иллюстрация, идея, фон, персонаж | Аватар, тренд, образ из своего фото |
Способы решают разные задачи и почти не конкурируют друг с другом. Когда нужна картинка без конкретного человека, например обложка, фон для презентации или иллюстрация к идее, лучше работает описание. Когда нужен ты сам или твой питомец в другом образе, описание бессильно, потому что в нем нет информации о том, как ты выглядишь.
Ползунок силы: насколько менять фото
У способа со стилем есть настройка, которую называют силой изменения. Она принимает значение от нуля до единицы и отвечает на простой вопрос: сколько от исходного снимка оставить. Чем ниже значение, тем сильнее результат похож на фото, а чем выше, тем больше свободы у нейросети. На значении единица исходный снимок практически игнорируется, и способ сводится к обычному рисованию по описанию.
Сила связана с числом шагов очистки. Допустим, в одной из популярных реализаций задано пятьдесят шагов, а сила равна 0,8: тогда к снимку добавляется шум примерно на сорок шагов, и столько же шагов уходит на его очистку. Чем меньше шума, тем короче путь и тем меньше места для перерисовки. В готовых шаблонах этот ползунок может быть спрятан внутри и тебе не виден.

Для ориентира шкалу можно разделить на три зоны. Это условное деление для понимания, у каждого сервиса границы проходят по-своему.
- Низкая сила: меняются цвет и свет. Снимок остается почти прежним, а фото получает другое настроение.
- Средняя сила: меняются стиль и фон. Заметно меняется оформление, мелкие черты лица уже могут слегка сместиться. Стили вроде аниме или ретро обычно лежат в этой зоне.
- Высокая сила: от фото остается общее впечатление. Нейросеть почти не опирается на снимок, и на сходство лица рассчитывать не стоит.
Примеры средней зоны есть в материалах про аниме-аватар из фото и про мультяшный аватар: там показано, как выглядят такие стили на практике.
Какие еще настройки встречаются рядом с ползунком
Сила изменения живет не одна, у нее есть соседи, и в разных сервисах их набор различается. Названия бывают другими, но смысл у большинства настроек одинаков, и знать его полезно, даже если ручек перед глазами нет. Что будет, если покрутить каждую из них?
| Настройка | За что отвечает | Что происходит при увеличении | Где встречается |
|---|---|---|---|
| Зерно шума | Стартовая точка генерации | Меняется сам вариант картинки, одинаковое зерно возвращает тот же старт | Оба способа |
| Число шагов | Сколько раз шум очищается | Качество обычно растет, но генерация идет дольше | Оба способа |
| Послушность тексту | Насколько жестко картинка следует описанию | Картинка ближе к словам, качество изображения снижается | Оба способа |
| Сила изменения | Сколько шума добавляется к снимку | От фото остается меньше, при единице снимок почти игнорируется | Только смена стиля |
Таблица подсказывает порядок действий, если результат не нравится. Сначала стоит поменять зерно, ведь это самый дешевый способ получить другой вариант. Затем можно подправить описание. Силу изменения трогают в последнюю очередь и только при смене стиля, потому что она сильнее остальных влияет на сходство с исходником. Конечно, в готовых шаблонах эти ручки спрятаны, и тогда вся работа сводится к выбору шаблона и исходного снимка.
Почему по описанию не нарисовать именно тебя
Можно ли описать себя словами и получить похожую картинку? Нет, и причина кроется в устройстве способа. Слова вроде светлые волосы, зеленые глаза, родинка у губы подходят тысячам людей. Нейросеть получает общую подсказку и придумывает лицо, которое под нее подходит. Оно может оказаться красивым, но оно будет новым.
Чтобы лицо узнавалось, нейросети нужна информация о нем, а эта информация содержится в фотографии. Поэтому снимок передают нейросети в режиме смены стиля или в режиме с эталонным фото рядом с текстом.
Но даже со снимком сходство не гарантировано. Чем сильнее изменение, тем больше шансов, что лицо слегка уйдет в сторону. Нейросеть перерисовывает черты, и мелкие детали вроде формы губ или линии бровей могут смениться на более типичные для выбранного стиля. Так работает сам механизм, и сервис при этом исправен. Если узнаваемость важнее эффектности, силу изменения лучше держать низкой или средней и брать исходник, где лицо видно целиком, в фокусе и при мягком свете.
Какой снимок взять за основу для смены стиля
Исходник определяет композицию и лицо, поэтому качество результата во многом решается еще до загрузки. Если на снимке лицо закрыто, размыто или обрезано, нейросети приходится достраивать его самой, то есть угадывать, а угаданное лицо уже не твое.
Перед загрузкой снимок можно проверить по короткому списку.
- Лицо видно целиком. Волосы, очки и ладонь не перекрывают черты, голова целиком помещается в кадр.
- Свет мягкий и ровный. Резкие тени скрывают часть черт, а скрытое приходится угадывать.
- Камера на уровне глаз. Снимок снизу или сверху искажает пропорции, и искажение легко переносится в новый стиль.
- На кадре один человек. Так проще проверить сходство и точнее подобрать стиль под одно лицо.
- Фон простой. Композиция исходника сохраняется, поэтому лишний предмет за спиной переедет в результат.
Фильтры красоты и сильное сглаживание кожи на исходнике тоже мешают, потому что гладкая кожа на снимке при стилизации легко становится еще более гладкой. Подготовка снимков подробнее разобрана в статье про фото на аватарку.
Где ошибается каждый подход
Ошибки обоих способов следуют из их устройства, поэтому многие из них можно предсказать заранее. Рисование по описанию начинает с шума и не привязано к реальному человеку, поэтому проблемы связаны со свободой нейросети. Смена стиля привязана к снимку, поэтому проблемы связаны с тем, что нейросеть заново рисует уже существующее.

| Способ | Типичная ошибка | Почему возникает | Что с этим делать |
|---|---|---|---|
| По описанию | Незнакомое лицо вместо нужного | В запросе нет снимка, лицо придумывается | Взять способ со сменой стиля |
| По описанию | Лишние пальцы, странные детали, сбитые надписи | Мелкие и сложные детали нейросеть рисует приблизительно | Генерировать несколько вариантов и выбирать |
| По описанию | Каждый раз другой результат | Стартовый шум случайный | Фиксировать зерно или брать шаблон |
| Стиль фото | Лицо стало чуть другим | Слишком высокая сила изменения | Снизить силу или взять другой исходник |
| Стиль фото | Кожа выглядит как пластик | Нейросеть сглаживает мелкие детали при перерисовке | Выбрать более мягкий стиль |
| Стиль фото | Фон перетянул на себя внимание | Композиция исходника сохраняется целиком | Взять снимок с простым фоном |
Лишние пальцы и сбитые надписи бывают у разных генераторов, и сервис при этом может быть вполне исправным. Руки и текст состоят из мелких деталей, а на мелких деталях нейросеть ошибается заметнее. Эти места нужно проверять глазами в полном размере кадра.
Пластиковая кожа встречается у обоих способов, но заметнее при смене стиля. Стилизация упрощает мелкие детали, поэтому поры и волоски могут слиться в гладкую поверхность. Для живого результата лучше выбирать стили с зерном и естественным светом, чем глянцевые. Если кадр получился мягким, а нужна резкость, поможет разбор про улучшение качества фото.
Одна идея в двух режимах: пример по шагам
Разницу хорошо видно на одной задаче. Допустим, нужна осенняя картинка для ленты, и героиня на ней должна быть похожа на тебя. Сначала выбери режим по описанию и напиши, что видишь в голове: девушка в пальто цвета охры идет по аллее, мягкий свет. Нейросеть выдаст несколько вариантов. Атмосфера, скорее всего, совпадет и одежда тоже, но лицо окажется чужим, и новые попытки этого не исправят, потому что в запросе нет информации о тебе.
Теперь повтори задачу вторым способом. Загрузи свое фото с четким лицом при мягком свете и напиши короткое описание, где задан только стиль: осенний парк, пальто цвета охры, пленочная фотография. Нейросеть возьмет твой снимок как основу, добавит шум, затем очистит его под слова. Шанс сохранить узнаваемое лицо здесь заметно выше, поза в основном сохранится, а фон и одежда могут поменяться на осенние. Результат ближе к цели, хотя фон может получиться менее фантазийным, чем в первом варианте, ведь композиция унаследована от исходника.
Из примера видно три вещи.
- Идея и настроение приходят из слов в обоих режимах. Описание нужно обоим способам.
- Сходство лица берется из снимка. Без снимка лицо придумывается заново.
- Свобода сцены растет вместе с силой изменения. Чем выше сила, тем ближе вторая картинка к первой и тем меньше в ней тебя.
Если нужна и свобода сцены, и твое лицо, придется искать баланс на ползунке или обращаться к готовому шаблону, где баланс уже задан.
Как проверить сходство лица на готовом кадре
Глаз быстро привыкает к картинке, и первое впечатление оказывается ненадежным, поэтому проверку лучше вести по схеме.
- Положи рядом исходник и результат. Сравнивать нужно в одном масштабе, иначе разница форм теряется.
- Сверь глаза и брови. Это самое узнаваемое в лице: расстояние между глазами, линия бровей, разрез.
- Проверь нос и губы. Форма губ и ширина носа чаще всего смещаются при перерисовке.
- Посмотри на овал лица и прическу. Если линия подбородка стала другой, узнаваемость уже падает.
- Сравни выражение. Улыбка могла стать шире или исчезнуть, а вместе с ней изменился характер кадра.
Если несколько пунктов не совпали, кадр лучше перегенерировать, снизив силу изменения или поменяв исходник. Один несовпавший пункт в стилизованном образе допустим, ведь аниме или мультфильм упрощают черты по самой природе стиля.
Как получить серию кадров в одном образе
Блогеру или автору аватарок редко хватает одной картинки, ему нужна серия, где человек и стиль совпадают от кадра к кадру. Как с этим справляется каждый способ? При рисовании по описанию каждый запуск стартует из нового шума, поэтому даже идентичный текст дает разных героев. Добиться повторения можно, зафиксировав зерно шума, но тогда зафиксируется и композиция, а героя из текста по-прежнему придется угадывать.
Со сменой стиля серию собрать проще, потому что композицию и черты задает исходник, и близкие результаты получаются от кадра к кадру. Для серии достаточно менять либо снимок, либо стиль, оставляя второе постоянным. Так получаются подборки из нескольких образов одного человека, например портрет в аниме, ретро и журнальном стиле, и для них стоит заранее подобрать несколько удачных исходников с разных ракурсов.
Но если исходник неудачный, ошибка размножится по всей серии. Поэтому перед десятью кадрами стоит сделать один и сравнить лицо с оригиналом: проверка занимает считанные минуты, а правки всей серии намного дольше.
Когда что выбирать
Выбор между способами сводится к вопросу, нужен ли на картинке конкретный человек: если нужен, берется смена стиля, а если нет, берется описание.

Рисовать по описанию подходит в таких случаях.
- Нужна иллюстрация без людей. Обложка, фон, предмет, пейзаж, абстракция.
- Нужен эскиз или мудборд. Интерьер, настроение кадра, образ героя, которого не существует.
- Нужен нестандартный сюжет. Сцена, которую невозможно снять, например город на облаках.
Менять стиль фото подходит в таких случаях.
- Нужен ты сам или близкий человек в новом образе. Аватар, трендовая картинка для ленты, подарок.
- Важна узнаваемость. Сходство берется из снимка, потому что слова подходят многим лицам.
- Нужна повторяемая серия. Один человек в нескольких стилях с общей основой.
Бывают и смешанные задачи. Допустим, нужен персонаж с твоим лицом на выдуманном фоне. Тогда логично сначала получить фон по описанию, а потом совместить его с портретом, либо взять режим, где эталонное фото подается рядом с текстом. Какие бесплатные сервисы умеют эти режимы и в чем их ограничения, собрано в обзоре про бесплатные нейросети для фото и видео.
Как меняются формулировки в двух режимах
Слова нужны обоим способам, но писать их приходится по-разному. Когда снимка нет, описание несет всю нагрузку и должно содержать героя, место, свет и стиль. Когда снимок есть, героя и композицию уже показала фотография, и в описании остается то, что нужно изменить. Сравни, как выглядит одна и та же идея в обоих режимах.
| Режим | Что обязательно назвать | Пример формулировки |
|---|---|---|
| По описанию | Героя, место, свет, стиль, ракурс | Девушка идет по аллее осеннего парка, пальто цвета охры, мягкий свет, пленочная фотография |
| Стиль фото | Только стиль, свет и настроение | Осенний парк, мягкий свет, пленочная фотография |
Во втором случае формулировка короче, и это удобно, потому что лишние слова про героя могут конфликтовать с тем, что уже видно на снимке. Если в описании написана блондинка, а на фото брюнетка, нейросеть получит два противоречивых сигнала и ответит на них непредсказуемо. Поэтому при смене стиля о внешности лучше молчать и оставлять ее снимку.
Соседние задачи: оживление и улучшение
Рядом с этими двумя способами есть еще два, и их легко перепутать. Оживление фото превращает неподвижный снимок в короткое видео, где человек моргает, поворачивает голову или улыбается. Улучшение качества поднимает резкость и убирает шум без изменения содержания кадра. Новую сцену они не рисуют и стиль не меняют, потому что решают другую задачу.
Отличить задачи можно по вопросу «что должно измениться». Другая картинка по смыслу означает рисование по описанию, а тот же человек в другом образе означает смену стиля. Тот же кадр, но живой, получается через оживление, о нем рассказано в статье про то, как оживить фото, а тот же кадр, но чище и резче, дает улучшение. Правильно выбранная задача сберегает попытки, которые иначе уходят на неподходящий режим.
Чьи фото можно загружать
Способ со сменой стиля работает с лицом, поэтому у него есть дополнительное правило: загружать стоит свои снимки либо снимки людей, которые согласны на такую обработку. Нейросеть технически перерисует любое лицо на фото, и результат легко распространить дальше, а вот вернуть его уже не получится. Если на кадре друг, ребенок или коллега, спросить разрешения проще, чем потом объясняться.
Тот же принцип касается публикации. Перерисованный портрет остается портретом конкретного человека, и его появление в ленте затрагивает этого человека.
Шаблон вместо описания: третий путь
Есть третий вариант. В описании приходится подбирать слова, в смене стиля подбирать силу изменения и формулировку. В шаблоне эти настройки заданы заранее, поэтому тебе остается загрузить фото.
Снимок в таком случае задает человека и композицию, готовое описание задает стиль, а настройки уже выставлены. Шаблон подходит, когда нужна трендовая картинка из своего фото, а изучать промпты не хочется. Стили ограничены набором шаблонов, и нестандартную сцену из слов он не нарисует, для такой задачи понадобится первый способ.
pixvibe сейчас работает в режиме предзапуска, генерация открыта по вейтлисту. Посмотреть, как выглядят шаблоны, и встать в лист можно на странице трендовых фото-шаблонов. О том, какие тренды сейчас залетают в лентах, рассказано в статье про фото-тренды соцсетей.
Частые вопросы про нейросеть, которая делает картинки
Дает ли нейросеть для картинок по описанию одно изображение на один текст? Нет, если не фиксировать зерно шума. Стартовая точка случайная, поэтому тот же текст дает разные картинки.
Можно ли нарисовать картинку по описанию так, чтобы человек был похож на меня? По одному описанию нельзя: слова подходят многим людям, а нейросеть придумывает лицо под них. Для сходства нужен снимок, поэтому используется режим со сменой стиля или режим с эталонным фото рядом с текстом.
Чем перерисовка фото нейросетью лучше обычного фильтра? Нейросеть добавляет шум и заново рисует изображение под описание, поэтому она способна менять форму, фактуру и фон.
Можно ли сохранить лицо на фото при смене стиля? Шансы выше, если держать силу изменения низкой или средней и брать исходник с четким лицом. Гарантии нет, мелкие черты могут сместиться, особенно в сильно стилизованных образах.
Что значит, что нейросеть превращает текст в изображение? Так называется способ рисования по описанию: на вход подается текст, на выходе получается картинка.
Нужно ли писать длинное описание для смены стиля фото? Обычно хватает короткого. Композицию и человека уже задает снимок, а описание отвечает за стиль, свет и настроение. Длинные описания нужны там, где снимка нет.
Нужен ли мощный компьютер для обоих способов? Для онлайн-сервисов нет, тяжелые вычисления идут на их серверах, и достаточно браузера или приложения.
Почему иногда результат выглядит хуже исходного фото? Нейросеть заново рисует изображение и пиксели исходника не улучшает. На сложных деталях она может ошибиться, поэтому результат нужно проверять и, если нужно, запускать заново с другим исходником или стилем.
Коротко: как сделать картинку по описанию или по своему фото
Нужна картинка без конкретного человека? Опиши ее словами по блокам, сгенерируй несколько вариантов и выбери лучший. Нужен ты в новом образе? Загрузи четкое фото лица при мягком свете и выбери стиль, не поднимая силу изменения выше средней. Не хочется настраивать ни слова, ни силу? Возьми готовый шаблон.
Перед публикацией открой кадр в полном размере и проверь руки, надписи, фон и сходство лица с оригиналом. Последнее слово остается за твоим глазом. Если хочешь попробовать третий путь, шаблоны pixvibe доступны через вейтлист на странице трендовых фото, а для самостоятельных экспериментов с описанием пригодится шаблон «Генерация картинок».
