Промт для карточки товара: почему нейросеть портит текст

Вы просите нейросеть нарисовать карточку с названием товара и характеристиками. Получаете красивый кадр, на котором вместо «Шуруповёрт аккумуляторный» написано что-то похожее на буквы: половина символов слиплась, одна перевёрнута, в слове лишняя «н». Переписываете промт, добавляете «текст должен быть чётким и читаемым» — и получаете тот же результат другими буквами.

Дело не в формулировке. Ниже — что происходит на самом деле и что с этим делать.

Что происходит, когда просишь нейросеть написать текст

Модель, рисующая изображение, не набирает текст. Она рисует пятна, похожие на буквы, — так же, как рисует листву или фактуру металла: по образцу, а не по смыслу. У неё нет шрифта, нет понятия «строка» и нет проверки орфографии.

Отсюда три беды, знакомые каждому, кто пробовал:

  • Буквы плывут. Символы разной высоты, межбуквенные просветы гуляют, край строки заваливается.
  • Кириллица ломается сильнее латиницы. Русских надписей в обучающих данных меньше, и модель хуже «помнит», как выглядят «д», «ж», «щ».
  • Правка невозможна. Опечатку нельзя исправить: чтобы поменять одну букву, нужна новая генерация всего кадра — а вместе с текстом изменится и картинка.

Последнее дороже всего. Карточку правят не один раз: поменялась цена, добавилась характеристика, маркетплейс попросил убрать слово. Каждая такая мелочь означает новый кадр и новую оплату.

Почему это не лечится промтом

Промт управляет тем, что нарисовано, а не тем, как устроен инструмент. Просьба «сделай текст чётким» для модели выглядит как просьба «нарисуй буквы поаккуратнее» — она и рисует аккуратнее, но всё так же по образцу.

Приёмы, которые обычно советуют, дают лишь частичное улучшение:

  • «крупный шрифт, простые буквы» — символов меньше, ошибок меньше, но они есть;
  • «english text only» — латиница выходит ровнее, только карточка нужна русская;
  • «negative prompt: gibberish, misspelled» — модель не понимает, что она ошиблась: для неё это не ошибка, а рисунок.

Проверить это можно за минуту: сгенерируйте один и тот же промт пять раз. Картинка каждый раз похожая, надпись — каждый раз другая и каждый раз неверная.

Что делать вместо

Разделить работу. Нейросеть хорошо делает то, что ей действительно даётся: фон и предметную съёмку без единой надписи. Текст на карточку кладётся отдельным слоем — тем же способом, каким его кладёт дизайнер в редакторе.

Тогда:

  • буквы всегда ровные: это настоящий шрифт, а не рисунок;
  • опечатка исправляется за секунду, кадр остаётся прежним;
  • один фон работает на всю серию слайдов.

Именно так устроен наш сервис: нейросеть рисует только фон без надписей, а заголовок, характеристики и плашки ложатся сверху отдельным слоем. Поэтому правка текста стоит 0 ₽ и не требует перегенерации кадра — сколько угодно раз. Фон — 15 ₽ за кадр, первая карточка бесплатно: стартовых кредитов хватает.

Промты, которые действительно работают

Это для фона без текста — то, что нейросети удаётся. Возьмите и пользуйтесь, даже если ничего у нас не купите.

Предметная съёмка на светлом фоне:

``` studio product photography of <товар>, seamless light grey background, soft diffused light from top-left, subtle contact shadow, centered composition, no text, no logo, no watermark, 3:4 vertical ```

Товар в рабочем окружении:

``` <товар> on a workbench, shallow depth of field, warm side light, blurred workshop background, no text, no labels, no packaging text, vertical 3:4 composition ```

Что здесь важно и почему:

  • `no text, no logo, no watermark` — прямой запрет на надписи. Без него модель дорисует «бренд» на упаковке, и его придётся закрывать плашкой.
  • 3:4 вертикаль — общий формат для Вайлдберриз, Озона и Яндекс.Маркета. Мы отдаём 1200×1600: рекомендация Маркета — от 1080×1440.
  • Описание света («soft diffused», «warm side light») меняет кадр сильнее, чем перечисление прилагательных вроде «beautiful, professional, high quality».

Одного не сделает ни один промт: не напишет на кадре читаемое русское название. Для этого нужен текстовый слой.

Коротко

Нейросеть не набирает текст — она его рисует, и поэтому ошибается всегда. Формулировка промта этого не меняет. Работающая схема одна: кадр от нейросети, текст отдельно.

Посмотрите, сколько это стоит, или соберите первую карточку — она бесплатна.

Загрузите фото товара и соберите карточку на своём же снимке. Текст правится бесплатно, кадр при этом остаётся прежним.

Собрать первую карточку