ИИ для работы с изображениями в бизнесе закрывает четыре задачи — генерирует картинки для карточек товаров и баннеров, обрабатывает фото (фон, ретушь, масштаб под формат площадки), распознаёт документы и товары на снимках и подписывает изображения текстом для каталога. Сотрудник маркетинга видит десяток сервисов сразу и теряется, с какого начать. Правило простое для всех четырёх задач: модель готовит черновик картинки или подписи, а публикацию под брендом подтверждает человек, который знает стиль-гайд компании.

Четыре задачи

TL;DR

ИИ для работы с изображениями закрывает четыре задачи бизнеса — генерацию картинок, обработку фото, распознавание объектов на снимках и подпись изображений текстом, — под каждую есть отдельный инструмент и разбор на сайте.

Четыре задачи редко идут по отдельности — карточка товара для маркетплейса требует и генерации фона, и обработки самого фото продукта, и подписи для карточки.

Отдельная линия задач — работа с моделью на своём сервере вместо облачного сервиса: открытые веса и локальный запуск разобраны в статье Stable Diffusion локально: установить на свой компьютер.

Где модель ошибается

Модель для изображений уверенно рисует картинку целиком, и ошибку в деталях сотрудник замечает только при внимательном просмотре перед публикацией.

  • Руки и мелкие детали — лишний палец, странная поза, сбитая перспектива предмета на витрине
  • Текст на самой картинке — логотип, надпись на упаковке или ценник модель рисует как абракадабру, читаемый текст на изображении встраивают отдельно, поверх готовой картинки
  • Бренд-стиль — фирменный цвет, шрифт и композиция карточки товара модель без брифа держит слабо, результат съезжает к среднему по рынку
  • Права на изображение — лицензию конкретного сервиса на коммерческое использование сгенерированной картинки сверяют перед публикацией по условиям самого сервиса — общее представление о том, как это работает у других, тут ненадёжно

Три из четырёх пунктов решает один и тот же шаг — просмотр картинки крупным планом перед публикацией: беглого взгляда на миниатюре в галерее сервиса для этого недостаточно.

Четвёртый пункт, права на изображение, отдельная история: условия лицензии у каждого сервиса свои, и сверять их полезно на странице тарифов самого сервиса — опыт работы с другим инструментом тут неинформативен.

Отдельный вопрос — авторство самой картинки и её использование в товарном знаке или логотипе компании; для витрины маркетплейса или поста в соцсети обычно хватает лицензии сервиса, а для регистрации бренда стоит свериться с условиями отдельно и заранее.

Как встроить в процесс

Одна картинка от модели без брифа и проверки — эксперимент сотрудника вместо рабочего процесса компании; встраивание начинается с трёх элементов.

  1. Бриф на задачу — что за товар или тема, какое настроение и формат площадки, какие детали запрещено менять (логотип, фирменный цвет)
  2. Стиль-гайд компании — три-пять референсов уже опубликованных карточек или баннеров как эталон тона и композиции для каждого нового запроса
  3. Проверка перед публикацией — просмотр крупным планом на предмет рук, текста на картинке и соответствия бренд-стилю, отдельно от общей вычитки текста подписи
  4. Архив принятых промптов — успешные формулировки сохраняют и переиспользуют, повторный подбор с нуля на каждой задаче только отнимает время

Стиль-гайд решает задачу быстрее любой инструкции текстом: модель точнее держит композицию и цвет, когда на входе есть готовый визуальный пример — одного описания словами для этого недостаточно.

Регламент такого процесса под конкретный отдел маркетинга собирают вместе с остальной автоматизацией — разбор на странице автоматизации бизнес-процессов.

● Discovery · 1 час · бесплатно

Какую задачу с изображениями стоит автоматизировать первой?

Прийти на Discovery →

Модели без фаворитов

Российские сервисы для изображений — Kandinsky и Шедеврум — компания подключает без вопроса про оплату из-за рубежа: деньги списываются рублями внутри страны.

Доступ к зарубежным сервисам для изображений устроен ровно двумя путями. Первый — сервис вендора напрямую, и здесь оплата российскими картами недоступна, без обходных схем. Второй — открытые веса на своём или арендованном сервере: контур ставит компания сама, готового решения у стороннего провайдера тут нет.

Третьего канала доступа для изображений в этой связке нет так же, как для текстовых моделей: выбор идёт между прямой оплатой вендору и собственным сервером.

Сравнивать сервисы по бренду вместо задачи — привычка, которая подводит на практике: для карточки товара с чётким брендом важнее контроль над композицией, а для быстрого черновика идеи — скорость генерации и цена запроса.

С чего начать

// с чего начать

Одна повторяющаяся задача — карточка товара или баннер для рассылки, — стиль-гайд из трёх референсов и правило «крупным планом перед публикацией»: остальные три задачи из карты добавляют по очереди.

Первую задачу выбирают по частоте — сложность здесь второстепенна: карточка товара для нового ассортимента повторяется каждую неделю, и на ней проще всего увидеть, сколько времени экономит готовый бриф с сохранённым промптом.

Распознавание фото документов и товаров на снимках — отдельная линия задач, устройство инструмента и разбор ошибок модели на этом направлении — в статье Qwen VL: распознавание документов и фото.

Вторая частая задача для старта — баннер для рассылки или соцсети: формат меняется чаще, чем карточка товара, и на нём быстро видно, насколько стиль-гайд экономит круги правок с дизайнером.

Обучение команды маркетинга брифу, стиль-гайду и проверке результата перед публикацией разбирают на курсе обучения сотрудников работе с ИИ — там же собирают архив промптов под задачи конкретной компании.

Частые вопросы

Какой ии для работы с изображениями выбрать бизнесу?
Выбор идёт от задачи — бренд сервиса тут второстепенен: для карточки товара с жёстким брендом важнее контроль над композицией и стиль-гайд, для быстрого черновика идеи — скорость и цена запроса конкретного сервиса.
Можно ли использовать сгенерированную картинку в рекламе без ограничений?
Условия коммерческого использования свои у каждого сервиса — лицензию сверяют на странице тарифов конкретного сервиса перед публикацией, общее представление о том, как это работает у других, здесь неприменимо.
Почему модель рисует неправильные руки и текст на картинке?
Мелкие детали и читаемый текст на изображении — слабое место любой модели генерации; текст поверх картинки лучше добавлять отдельным слоем, а руки и мелкие предметы проверять крупным планом перед публикацией.
Нужна ли команда сотруднику, чтобы распознать фото документа моделью?
Нет — распознавание фото и сканов устроено как обычный запрос модели с приложенной картинкой, разбор на примере Qwen VL — в отдельной статье про распознавание документов и фото.