01 Простыми словами
NER (Named Entity Recognition) — задача, при которой модель читает текст и находит внутри него конкретные объекты определённого типа: суммы, даты, названия компаний, имена людей. Текст превращается в размеченный список объектов вместо сплошной строки без структуры.
NER часто становится первым шагом в более сложной цепочке: сначала из текста достают конкретные факты, а уже потом эти факты передают в CRM, базу данных или следующий модуль автоматизации.
02 Как это работает
Задача извлечения сущностей решается в несколько шагов.
- Заранее определяется список типов сущностей, которые нужно находить, — например, «номер заказа», «телефон», «адрес», «сумма».
- Модель читает текст и для каждого найденного фрагмента присваивает один из заданных типов.
- Найденные сущности собираются в структурированный список или таблицу с полями по типам.
- Результат передаётся дальше — в CRM, базу данных или следующий шаг автоматизации.
Для простых и предсказуемых форматов — например, извлечения номера заказа из письма по шаблону — обычно достаточно недорогой модели вроде GigaChat или YandexGPT. Для сложных случаев, где формат сильно различается от письма к письму и данные легко перепутать, нужна модель с более развитым рассуждением, способная разобраться в неоднозначных формулировках. До появления языковых моделей извлечение сущностей делали в основном через регулярные выражения и словари ключевых слов — быстрый и дешёвый подход, но требующий отдельной настройки под каждый новый формат письма или документа. Модель справляется с разнообразием форматов гибче, потому что опирается на смысл текста вместо жёсткого шаблона. Готовый список сущностей часто дополнительно проверяют простыми правилами — например, что номер телефона состоит из ожидаемого количества цифр, — это ловит часть ошибок ещё до того, как результат уйдёт в CRM.
03 Где применяется
- Логистика. Из письма перевозчика извлекается номер отслеживания, дата отправки и адрес получателя.
- HR. Из резюме вытаскиваются даты работы, должности и названия компаний для быстрого сравнения кандидатов.
- Финансы. Из счёта или накладной распознаются сумма, номер документа и реквизиты контрагента.
- Недвижимость. Из объявления об аренде вытаскиваются площадь, район, стоимость и контакт собственника для базы объектов.
- Поддержка клиентов. Из обращения выделяются номер заказа и контактные данные для автоматической маршрутизации тикета.
- Госзакупки. Из объявления о тендере извлекаются номер лота, сумма контракта и срок подачи заявки.
04 Три вопроса руководителя логистики
Руководитель логистического отдела перед подключением извлечения сущностей к потоку писем от перевозчиков задаёт интегратору три вопроса — и получает три развёрнутых ответа.
Сколько ошибок допустимо на старте? Реалистичный ориентир для старта — примерно одна ошибка на два-три десятка писем; команды обычно закладывают время на выборочную проверку первых недель вместо ожидания сразу идеального результата.
Какие поля важнее всего проверять вручную? Поля с прямыми финансовыми и логистическими последствиями — номер отслеживания, сумма — стоит проверять чаще прочих: ошибка здесь стоит часов работы бухгалтерии, тогда как ошибка в дате обычно уточняется письмом за минуту.
Кто отвечает за проверку после запуска? Обычно тот же сотрудник, который раньше вносил данные вручную, — только теперь его роль смещается в сторону выборочного контроля вместо полного ввода каждого письма самостоятельно.
05 Ограничения
- Модель хуже справляется с редкими или новыми форматами номеров и идентификаторов, отсутствовавшими в примерах.
- Похожие по виду сущности легко перепутать — например, номер заказа и номер накладной одинаковой длины.
- При работе с рукописными или отсканированными документами точность распознавания сущностей дополнительно зависит от качества распознавания самого текста на этапе OCR, а найденные сущности дальше обычно уходят в структурированный вывод для передачи в другую систему.
- Извлечённые персональные данные вроде телефона или адреса стоит обрабатывать с той же осторожностью, что и в задаче удаления персональных данных.
Как выглядит похожая разметка данных на практике — в статье про few-shot примеры для разметки заявок. Как встроить извлечение данных в чат-бота для бизнеса — в разделе чат-ботов под ключ.