ИИ для работы с изображениями в бизнесе закрывает четыре задачи — генерирует картинки для карточек товаров и баннеров, обрабатывает фото (фон, ретушь, масштаб под формат площадки), распознаёт документы и товары на снимках и подписывает изображения текстом для каталога. Сотрудник маркетинга видит десяток сервисов сразу и теряется, с какого начать. Правило простое для всех четырёх задач: модель готовит черновик картинки или подписи, а публикацию под брендом подтверждает человек, который знает стиль-гайд компании.
Четыре задачи
ИИ для работы с изображениями закрывает четыре задачи бизнеса — генерацию картинок, обработку фото, распознавание объектов на снимках и подпись изображений текстом, — под каждую есть отдельный инструмент и разбор на сайте.
Четыре задачи редко идут по отдельности — карточка товара для маркетплейса требует и генерации фона, и обработки самого фото продукта, и подписи для карточки.
- Генерация — карточки товаров, баннеры для сайта и соцсетей, обложка поста; пошагово под Wildberries разобрано в статье генерация изображений для карточек Wildberries нейросетью, общий процесс для маркетплейса — в статье генерация изображений товаров для маркетплейса нейросетью
- Генерация в Midjourney и Kandinsky — два разных инструмента с разной логикой промпта: пошаговый разбор Midjourney — в статье как генерировать картинки в Midjourney пошагово, российский сервис — в статье генерация изображений в Kandinsky для бизнеса
- Обработка и дизайн баннера — фон, ретушь, масштаб под формат площадки; устройство брифа для дизайнера разобрано в статье нейросеть для дизайна баннеров для сайта
- Распознавание — фото документов, чеков, товара на полке склада; на примере Qwen VL — в статье Qwen VL: распознавание документов и фото
- Описание текстом — подпись для карточки каталога и альт-текст для сайта, чтобы товар находили и по картинке, и по тексту
Отдельная линия задач — работа с моделью на своём сервере вместо облачного сервиса: открытые веса и локальный запуск разобраны в статье Stable Diffusion локально: установить на свой компьютер.
Где модель ошибается
Модель для изображений уверенно рисует картинку целиком, и ошибку в деталях сотрудник замечает только при внимательном просмотре перед публикацией.
- Руки и мелкие детали — лишний палец, странная поза, сбитая перспектива предмета на витрине
- Текст на самой картинке — логотип, надпись на упаковке или ценник модель рисует как абракадабру, читаемый текст на изображении встраивают отдельно, поверх готовой картинки
- Бренд-стиль — фирменный цвет, шрифт и композиция карточки товара модель без брифа держит слабо, результат съезжает к среднему по рынку
- Права на изображение — лицензию конкретного сервиса на коммерческое использование сгенерированной картинки сверяют перед публикацией по условиям самого сервиса — общее представление о том, как это работает у других, тут ненадёжно
Три из четырёх пунктов решает один и тот же шаг — просмотр картинки крупным планом перед публикацией: беглого взгляда на миниатюре в галерее сервиса для этого недостаточно.
Четвёртый пункт, права на изображение, отдельная история: условия лицензии у каждого сервиса свои, и сверять их полезно на странице тарифов самого сервиса — опыт работы с другим инструментом тут неинформативен.
Отдельный вопрос — авторство самой картинки и её использование в товарном знаке или логотипе компании; для витрины маркетплейса или поста в соцсети обычно хватает лицензии сервиса, а для регистрации бренда стоит свериться с условиями отдельно и заранее.
Как встроить в процесс
Одна картинка от модели без брифа и проверки — эксперимент сотрудника вместо рабочего процесса компании; встраивание начинается с трёх элементов.
- Бриф на задачу — что за товар или тема, какое настроение и формат площадки, какие детали запрещено менять (логотип, фирменный цвет)
- Стиль-гайд компании — три-пять референсов уже опубликованных карточек или баннеров как эталон тона и композиции для каждого нового запроса
- Проверка перед публикацией — просмотр крупным планом на предмет рук, текста на картинке и соответствия бренд-стилю, отдельно от общей вычитки текста подписи
- Архив принятых промптов — успешные формулировки сохраняют и переиспользуют, повторный подбор с нуля на каждой задаче только отнимает время
Стиль-гайд решает задачу быстрее любой инструкции текстом: модель точнее держит композицию и цвет, когда на входе есть готовый визуальный пример — одного описания словами для этого недостаточно.
Регламент такого процесса под конкретный отдел маркетинга собирают вместе с остальной автоматизацией — разбор на странице автоматизации бизнес-процессов.
Какую задачу с изображениями стоит автоматизировать первой?
Модели без фаворитов
Российские сервисы для изображений — Kandinsky и Шедеврум — компания подключает без вопроса про оплату из-за рубежа: деньги списываются рублями внутри страны.
Доступ к зарубежным сервисам для изображений устроен ровно двумя путями. Первый — сервис вендора напрямую, и здесь оплата российскими картами недоступна, без обходных схем. Второй — открытые веса на своём или арендованном сервере: контур ставит компания сама, готового решения у стороннего провайдера тут нет.
Третьего канала доступа для изображений в этой связке нет так же, как для текстовых моделей: выбор идёт между прямой оплатой вендору и собственным сервером.
Сравнивать сервисы по бренду вместо задачи — привычка, которая подводит на практике: для карточки товара с чётким брендом важнее контроль над композицией, а для быстрого черновика идеи — скорость генерации и цена запроса.
С чего начать
Одна повторяющаяся задача — карточка товара или баннер для рассылки, — стиль-гайд из трёх референсов и правило «крупным планом перед публикацией»: остальные три задачи из карты добавляют по очереди.
Первую задачу выбирают по частоте — сложность здесь второстепенна: карточка товара для нового ассортимента повторяется каждую неделю, и на ней проще всего увидеть, сколько времени экономит готовый бриф с сохранённым промптом.
Распознавание фото документов и товаров на снимках — отдельная линия задач, устройство инструмента и разбор ошибок модели на этом направлении — в статье Qwen VL: распознавание документов и фото.
Вторая частая задача для старта — баннер для рассылки или соцсети: формат меняется чаще, чем карточка товара, и на нём быстро видно, насколько стиль-гайд экономит круги правок с дизайнером.
Обучение команды маркетинга брифу, стиль-гайду и проверке результата перед публикацией разбирают на курсе обучения сотрудников работе с ИИ — там же собирают архив промптов под задачи конкретной компании.