Генерация картинок по тексту

Скажу сразу, если вы уже генерируете, у вас есть платные подписки, то эта статья не будет для вас интересна. А вот если вы ни разу не пользовались нейросетью и хотите попробовать сделать что-то свое и бесплатно, то эта статья для вас.

Начнем.

Чтобы сгенерировать нормальную картинку, нейросети нужно правильно объяснить задачу. Она не угадывает, что именно вы считаете красивым, стильным или подходящим для поста: ей нужен понятный промт, формат, описание сцены, стиль и ограничения.

Как работает генерация картинок нейросетью

Генерация изображений нейросетью — это создание картинки на основе текстового описания, фото или референса. Пользователь пишет промт: что должно быть в кадре, какой стиль нужен, где происходит сцена, какой свет, ракурс и настроение.

Например, запрос «обложка про нейросети» слишком широкий. А вот такой уже дает хороший результат:

Горизонтальная обложка 16:9 для статьи о генерации картинок нейросетью: человек пишет текстовый промт на ноутбуке, рядом появляются готовые изображения в разных стилях, современный рабочий стол, мягкий свет, реалистичная редакционная фотография, без надписей и логотипов.
Генерация изображения в ChatGPT
Генерация изображения в ChatGPT

Но есть мнение, что промт только мешает, выходят посредственные изображения от которых веет иишностью.

А вот это уже сгенерировано через бота Studio Sofia Élysée:

Фотосессия девушки: просто скинуть свою фотку боту и он сам сгенерирует — и не надо париться на счет промтов. Но можно скинуть референс, например с Пинтерест, и тогда бот повторит. 
Фотосессия девушки: просто скинуть свою фотку боту и он сам сгенерирует — и не надо париться на счет промтов. Но можно скинуть референс, например с Пинтерест, и тогда бот повторит. 

Почему результат получается плохим

Самая частая причина — короткий и размытый запрос. Если написать «сделай красивую картинку», нейросеть сама решит, что такое «красивая». Обычно это приводит к шаблонному визуалу: неон, 3D-мозг, робот, абстрактные линии.

Вторая причина — слишком много требований в одном промте. Пользователь просит сразу реализм, аниме, логотип, текст, портрет, инфографику, премиальный стиль и «чтобы было как у Apple». Модель начинает смешивать несовместимые признаки.

Третья причина — попытка заставить нейросеть идеально писать текст внутри изображения. Многие современные модели уже лучше работают с буквами, но для обложек и баннеров надежнее генерировать картинку без текста, а заголовок добавлять отдельно в Canva, Figma, Photoshop или любом редакторе.

Как писать промт для картинки

Хороший промт обычно состоит из нескольких частей:

  • главный объект;
  • действие или сцена;
  • окружение;
  • стиль;
  • свет;
  • ракурс;
  • формат;
  • ограничения.

Пример для статьи:

Редакционная иллюстрация для статьи о нейросетях: экран ноутбука, из которого появляются сгенерированные изображения — портрет, пейзаж, товарная карточка и постер. Чистая современная композиция, светлый фон, мягкий дневной свет, high detail, без текста.

Пример для рекламного креатива:

Фотореалистичный рекламный баннер: косметический продукт на минималистичном столе, рядом мягкие тени, натуральные материалы, премиальный стиль, студийный свет, формат 16:9, без текста и логотипов.

Что касается креативов.

Если у вас нет опыта, то сделать хорошее изображение вряд ли получится. А вот если скинуть в бота, то можно получить хороший результат:

Креатив для тех, кто продает что-то в интернете через бота @Studio Sofia Élysée 
Креатив для тех, кто продает что-то в интернете через бота @Studio Sofia Élysée 

Пример для аватара, сгенерированого через бота Studio Sofia Élysée:

Фотосессия в боте @Studio Sofia Élysée
Фотосессия в боте @Studio Sofia Élysée
Бот @Studio Sofia Élysée для генерации фотосессий
Бот @Studio Sofia Élysée для генерации фотосессий
Брутальный мужчина  — все через бота @Studio Sofia Élysée
Брутальный мужчина  — все через бота @Studio Sofia Élysée

Нейросети для рекламы

Генерация рекламных постеров в боте @Studio Sofia Élysée
Генерация рекламных постеров в боте @Studio Sofia Élysée
Бот @Studio Sofia Élysée для ресторанов, баров, кафе
Бот @Studio Sofia Élysée для ресторанов, баров, кафе
Генерируйте меню в боте @Studio Sofia Élysée
Генерируйте меню в боте @Studio Sofia Élysée

Какие нейросети использовать

Если нужна красивая художественная картинка, часто выбирают Midjourney. Она хорошо справляется с атмосферой, стилем, постерами, концепт-артом и необычными визуальными идеями.

Если нужен простой диалоговый сценарий, удобно использовать генерацию изображений в ChatGPT: можно попросить изменить фон, убрать лишний объект, сделать вариант для статьи или адаптировать картинку под другой формат.

Для русскоязычных запросов подойдут Kandinsky и похожие сервисы, которые проще воспринимают промты на русском. Для тех, кому нужен максимальный контроль, есть Stable Diffusion: можно запускать локально, подключать модели, стили и дополнительные настройки.

Для дизайна, иконок и брендовых иллюстраций стоит смотреть в сторону Recraft. А если на изображении нужен читаемый текст, можно попробовать Ideogram, потому что он лучше многих моделей справляется с типографикой.

Как улучшить картинку после первой генерации

Не стоит ждать идеального результата с первой попытки. Генерация картинок — это итерационный процесс.

Сначала сделайте общий вариант. Потом уточняйте:

  • «сделай фон чище»;
  • «убери текст»;
  • «добавь больше свободного места справа»;
  • «сделай стиль менее мультяшным»;
  • «сделай изображение более реалистичным»;
  • «сохрани композицию, но измени цветовую палитру»;
  • «сделай вариант для обложки 16:9».

Такой подход обычно работает лучше, чем один огромный промт на десять строк.

Частые ошибки в генерации изображений

Первая ошибка — просить слишком абстрактно: «сделай красиво», «нарисуй будущее», «картинка про бизнес». Лучше описывать конкретную сцену.

Вторая ошибка — не указывать формат. Для статьи нужен горизонтальный 16:9, для Telegram — квадрат 1:1, для Reels или Shorts — вертикальный 9:16.

Третья ошибка — добавлять текст прямо в изображение. Если это не специальная модель для типографики, результат может быть кривым.

Четвертая ошибка — копировать чужой стиль или бренд. Лучше описывать визуальные признаки: «минималистичный», «редакционный», «премиальный», «фотореалистичный», «мягкий свет», «чистая композиция».

Можно ли использовать изображения из нейросети в коммерции

Да, но условия зависят от конкретного сервиса. Перед использованием в рекламе, на сайте, в книге, упаковке или карточке товара нужно посмотреть лицензию платформы. У некоторых сервисов коммерческое использование доступно только на платном тарифе.

Для блога риски меньше, но все равно лучше избегать известных персонажей, чужих логотипов, реальных людей и прямого копирования узнаваемого авторского стиля.

Итог

Более менее показывают результат Nano Banana и ChatGPT с его Imagegen2. Но эти нейросети платные и оплатить их из России проблематично.

К тому же, если вам нужно всего пару фото, не выгодно отдавать 2000 руб в месяц.

Есть бот, в котором вы платите только за количество сгенерированных фото — Studio Sofia Élysée

1