● Методология / Уровень: базовый / Q2 · 2026 / 121 из 147

Разметка данных.

присвоение меток примерам, на которых учится или проверяется модель
Короткий
ответ
↳
Разметка данных — процесс присвоения текстам, изображениям или другим примерам меток и категорий, по которым модель потом обучается или проверяется. Разметку делают вручную люди, автоматически модель, либо сочетанием того и другого через HITL.

01 Простыми словами

Как модель узнаёт, какой ответ на конкретном примере считается верным? Сама по себе — никак: сначала кто-то ставит метку или категорию, и только потом пример годится для обучения или проверки. Разметка — это и есть тот шаг простановки метки: у каждого примера появляется категория, тег или оценка, по которым его в дальнейшем использует модель при обучении или проверке.

В одной фразе — разметка превращает сырые примеры в размеченный материал, на котором модель учится или который проверяет её работу.

Без разметки у модели нет способа понять, какой ответ на конкретном примере считается верным, — она видит поток текста без явной оценки, что в нём хорошо, а что плохо.

02 Как это работает

Разметку данных на практике организуют одним из трёх основных способов.

  1. Ручная разметка — человек читает пример и присваивает метку вручную, обычно по чёткой инструкции с образцами.
  2. Автоматическая разметка — модель сама присваивает метки по заданным критериям, что быстрее, но менее надёжно на неоднозначных случаях.
  3. Смешанная разметка — модель предлагает метку, а человек подтверждает или исправляет её, что ускоряет процесс без полной потери контроля.

Качество разметки решает почти всё: противоречивые метки от разных людей на похожих примерах путают модель при обучении сильнее, чем небольшой объём самих данных. Поэтому опытные команды сначала размечают небольшую пилотную партию силами двух-трёх человек и сверяют результат между собой, прежде чем передавать инструкцию в работу основной команде разметчиков. Для снижения такого разброса инструкцию для разметчиков обычно дополняют десятком уже размеченных эталонных примеров, похожих на те, что используют при построении evals для проверки модели.

03 Где применяется

  • Маркетплейсы. Модератор или модель помечает отзыв как настоящий или накрученный перед публикацией.
  • Юристы. Пункты договора размечают по типу риска — платёжный, репутационный, регуляторный — для последующего анализа моделью.
  • Поддержка клиентов. Обращения размечают темой и итоговым решением, собирая базу примеров для будущего бота.
  • Логистика. Фотографии груза размечают по типу повреждения для обучения модели контроля приёмки.
  • Медицина. Снимки размечают по типу находки для обучения модели предварительного анализа изображений.
  • Финансы. Транзакции размечают по признаку подозрительности для обучения модели предварительного скоринга риска.

04 Делегировать модели или нет

Руководитель модерации маркетплейса вспоминает решение трёхмесячной давности: тогда он передал разметку большей части новых отзывов модели, оставив живому модератору только случаи с низкой уверенностью.

Довод в пользу решения был предельно простым по цифрам: команда из десяти модераторов физически справлялась лишь с частью потока в несколько тысяч отзывов в день, и очередь на проверку росла быстрее, чем её разбирали. Модель отвечала на любой объём мгновенно и одинаково применяла одни критерии в любое время суток.

Сомнение, из-за которого решение отложили на неделю: цена ошибки на спорных случаях выше цены задержки в очереди. Отзыв на грани между эмоциональной реакцией и накруткой модель порой размечает неуверенно, а ошибочная метка на таком отзыве бьёт по репутации продавца сильнее, чем лишний час ожидания.

Решение приняли с оговоркой: модель размечает поток целиком, а отзывы с низкой уверенностью автоматически уходят живому модератору, минуя публикацию по умолчанию. Через три месяца порог уверенности, при котором отзыв уходит к человеку, подняли дважды — по мере того как накопилась статистика, на каких формулировках модель чаще ошибается. Очередь для модератора осталась на прежнем уровне, а доля спорных отзывов, доходящих до него, сократилась вдвое.

05 Ограничения

  • Инструкцию для разметчиков стоит пересматривать регулярно вместо разового пересмотра на старте проекта — она быстро устаревает по мере появления новых типов примеров.
  • Разные разметчики иногда расходятся в оценке одного и того же спорного примера — расхождение стоит замерять отдельной метрикой согласия между разметчиками.
  • Экономия на разметке в начале проекта часто оборачивается переплатой позже — переразметка большого датасета задним числом обходится дороже, чем аккуратная инструкция с самого начала.
  • Модель, обученная на разметке с систематической ошибкой, воспроизводит эту ошибку в масштабе — проверка качества самой разметки важна наравне с проверкой самой модели.
Правило — держите под рукой небольшой набор эталонных примеров с заведомо верной меткой и периодически сверяйте по нему и разметчиков, и модель — расхождение с эталоном раньше всего покажет, где именно накопился систематический перекос.

Как автоответы на отзывы Wildberries настраивают на практике — в статье про автоответы на отзывы Wildberries. Как встроить такую разметку в процесс компании — в разделе про ИИ-консалтинг.

// 06 · от практики

Как мы применяем Разметка данных в работе с клиентами

В практике «Зинин × Штурбин» мы внедряем Разметка данных в рабочие процессы команды — это часть формата программа для команды. На реальных задачах это разметка отзыва: настоящий или накрученный, разметка риска в пункте договора и подобное. Рядом разбираем Синтетические данные — термины в словаре связаны так же, как в работе.

Не консультируем абстрактно: команда уходит с навыком и рабочим процессом, который применяет сама. Посмотреть программы и цены →

// 08

Частые вопросы

01 Кто размечает данные — человек или модель?

Оба варианта встречаются и часто комбинируются: модель предлагает метку, а человек подтверждает или исправляет её на спорных случаях — это быстрее чистой ручной разметки и надёжнее чистой автоматической.

02 Сколько человек нужно для качественной разметки одного датасета?

Зависит от объёма и сложности примеров — для простых категорий хватает одного разметчика с понятной инструкцией, для спорных тем лучше два-три человека с последующей сверкой расхождений.

03 Что делать, если разметчики расходятся в оценке одного примера?

Такой пример стоит вынести в инструкцию как эталонный спорный случай с объяснением правильного решения — это снижает вероятность повторного расхождения на похожих примерах в будущем.

04 Чем разметка отличается от синтетических данных?

Синтетические данные создают новые примеры целиком. Разметка присваивает метку уже существующим реальным или синтетическим примерам — это разные, но часто соседние шаги подготовки датасета.

05 Нужна ли разметка данных небольшой компании?

Да, даже небольшой набор из нескольких сотен размеченных примеров ощутимо улучшает точность промпта или модели под конкретную задачу компании.

Понимаем — учим
работать с Разметка данных
внутри команды.

Час бесплатной диагностики: разбираем 2–3 ваших процесса и говорим прямо, где AI окупится за квартал, а где брать рано. Знания остаются у вашей команды.

Готовы поговорить?
@Aleksei_Shturbin Бот →