01 Простыми словами
Как модель узнаёт, какой ответ на конкретном примере считается верным? Сама по себе — никак: сначала кто-то ставит метку или категорию, и только потом пример годится для обучения или проверки. Разметка — это и есть тот шаг простановки метки: у каждого примера появляется категория, тег или оценка, по которым его в дальнейшем использует модель при обучении или проверке.
Без разметки у модели нет способа понять, какой ответ на конкретном примере считается верным, — она видит поток текста без явной оценки, что в нём хорошо, а что плохо.
02 Как это работает
Разметку данных на практике организуют одним из трёх основных способов.
- Ручная разметка — человек читает пример и присваивает метку вручную, обычно по чёткой инструкции с образцами.
- Автоматическая разметка — модель сама присваивает метки по заданным критериям, что быстрее, но менее надёжно на неоднозначных случаях.
- Смешанная разметка — модель предлагает метку, а человек подтверждает или исправляет её, что ускоряет процесс без полной потери контроля.
Качество разметки решает почти всё: противоречивые метки от разных людей на похожих примерах путают модель при обучении сильнее, чем небольшой объём самих данных. Поэтому опытные команды сначала размечают небольшую пилотную партию силами двух-трёх человек и сверяют результат между собой, прежде чем передавать инструкцию в работу основной команде разметчиков. Для снижения такого разброса инструкцию для разметчиков обычно дополняют десятком уже размеченных эталонных примеров, похожих на те, что используют при построении evals для проверки модели.
03 Где применяется
- Маркетплейсы. Модератор или модель помечает отзыв как настоящий или накрученный перед публикацией.
- Юристы. Пункты договора размечают по типу риска — платёжный, репутационный, регуляторный — для последующего анализа моделью.
- Поддержка клиентов. Обращения размечают темой и итоговым решением, собирая базу примеров для будущего бота.
- Логистика. Фотографии груза размечают по типу повреждения для обучения модели контроля приёмки.
- Медицина. Снимки размечают по типу находки для обучения модели предварительного анализа изображений.
- Финансы. Транзакции размечают по признаку подозрительности для обучения модели предварительного скоринга риска.
04 Делегировать модели или нет
Руководитель модерации маркетплейса вспоминает решение трёхмесячной давности: тогда он передал разметку большей части новых отзывов модели, оставив живому модератору только случаи с низкой уверенностью.
Довод в пользу решения был предельно простым по цифрам: команда из десяти модераторов физически справлялась лишь с частью потока в несколько тысяч отзывов в день, и очередь на проверку росла быстрее, чем её разбирали. Модель отвечала на любой объём мгновенно и одинаково применяла одни критерии в любое время суток.
Сомнение, из-за которого решение отложили на неделю: цена ошибки на спорных случаях выше цены задержки в очереди. Отзыв на грани между эмоциональной реакцией и накруткой модель порой размечает неуверенно, а ошибочная метка на таком отзыве бьёт по репутации продавца сильнее, чем лишний час ожидания.
Решение приняли с оговоркой: модель размечает поток целиком, а отзывы с низкой уверенностью автоматически уходят живому модератору, минуя публикацию по умолчанию. Через три месяца порог уверенности, при котором отзыв уходит к человеку, подняли дважды — по мере того как накопилась статистика, на каких формулировках модель чаще ошибается. Очередь для модератора осталась на прежнем уровне, а доля спорных отзывов, доходящих до него, сократилась вдвое.
05 Ограничения
- Инструкцию для разметчиков стоит пересматривать регулярно вместо разового пересмотра на старте проекта — она быстро устаревает по мере появления новых типов примеров.
- Разные разметчики иногда расходятся в оценке одного и того же спорного примера — расхождение стоит замерять отдельной метрикой согласия между разметчиками.
- Экономия на разметке в начале проекта часто оборачивается переплатой позже — переразметка большого датасета задним числом обходится дороже, чем аккуратная инструкция с самого начала.
- Модель, обученная на разметке с систематической ошибкой, воспроизводит эту ошибку в масштабе — проверка качества самой разметки важна наравне с проверкой самой модели.
Как автоответы на отзывы Wildberries настраивают на практике — в статье про автоответы на отзывы Wildberries. Как встроить такую разметку в процесс компании — в разделе про ИИ-консалтинг.