● Концепция / Уровень: средний / Q2 · 2026 / 114 из 147

Извлечение сущностей (NER).

находит в тексте номера, даты, суммы и имена и размечает их
Короткий
ответ
↳
Извлечение сущностей (NER) — задача, в которой модель находит в тексте конкретные объекты вроде имён, дат, сумм и номеров документов и размечает каждый по типу. Результат обычно сразу оформляют в виде структурированного вывода — готовых полей для CRM или базы данных вместо сплошного текста.

01 Простыми словами

NER (Named Entity Recognition) — задача, при которой модель читает текст и находит внутри него конкретные объекты определённого типа: суммы, даты, названия компаний, имена людей. Текст превращается в размеченный список объектов вместо сплошной строки без структуры.

В одной фразе — NER превращает сплошной текст в размеченный список конкретных объектов вместо строки без структуры.

NER часто становится первым шагом в более сложной цепочке: сначала из текста достают конкретные факты, а уже потом эти факты передают в CRM, базу данных или следующий модуль автоматизации.

02 Как это работает

Задача извлечения сущностей решается в несколько шагов.

  1. Заранее определяется список типов сущностей, которые нужно находить, — например, «номер заказа», «телефон», «адрес», «сумма».
  2. Модель читает текст и для каждого найденного фрагмента присваивает один из заданных типов.
  3. Найденные сущности собираются в структурированный список или таблицу с полями по типам.
  4. Результат передаётся дальше — в CRM, базу данных или следующий шаг автоматизации.

Для простых и предсказуемых форматов — например, извлечения номера заказа из письма по шаблону — обычно достаточно недорогой модели вроде GigaChat или YandexGPT. Для сложных случаев, где формат сильно различается от письма к письму и данные легко перепутать, нужна модель с более развитым рассуждением, способная разобраться в неоднозначных формулировках. До появления языковых моделей извлечение сущностей делали в основном через регулярные выражения и словари ключевых слов — быстрый и дешёвый подход, но требующий отдельной настройки под каждый новый формат письма или документа. Модель справляется с разнообразием форматов гибче, потому что опирается на смысл текста вместо жёсткого шаблона. Готовый список сущностей часто дополнительно проверяют простыми правилами — например, что номер телефона состоит из ожидаемого количества цифр, — это ловит часть ошибок ещё до того, как результат уйдёт в CRM.

03 Где применяется

  • Логистика. Из письма перевозчика извлекается номер отслеживания, дата отправки и адрес получателя.
  • HR. Из резюме вытаскиваются даты работы, должности и названия компаний для быстрого сравнения кандидатов.
  • Финансы. Из счёта или накладной распознаются сумма, номер документа и реквизиты контрагента.
  • Недвижимость. Из объявления об аренде вытаскиваются площадь, район, стоимость и контакт собственника для базы объектов.
  • Поддержка клиентов. Из обращения выделяются номер заказа и контактные данные для автоматической маршрутизации тикета.
  • Госзакупки. Из объявления о тендере извлекаются номер лота, сумма контракта и срок подачи заявки.

04 Три вопроса руководителя логистики

Руководитель логистического отдела перед подключением извлечения сущностей к потоку писем от перевозчиков задаёт интегратору три вопроса — и получает три развёрнутых ответа.

Сколько ошибок допустимо на старте? Реалистичный ориентир для старта — примерно одна ошибка на два-три десятка писем; команды обычно закладывают время на выборочную проверку первых недель вместо ожидания сразу идеального результата.

Какие поля важнее всего проверять вручную? Поля с прямыми финансовыми и логистическими последствиями — номер отслеживания, сумма — стоит проверять чаще прочих: ошибка здесь стоит часов работы бухгалтерии, тогда как ошибка в дате обычно уточняется письмом за минуту.

Кто отвечает за проверку после запуска? Обычно тот же сотрудник, который раньше вносил данные вручную, — только теперь его роль смещается в сторону выборочного контроля вместо полного ввода каждого письма самостоятельно.

05 Ограничения

  • Модель хуже справляется с редкими или новыми форматами номеров и идентификаторов, отсутствовавшими в примерах.
  • Похожие по виду сущности легко перепутать — например, номер заказа и номер накладной одинаковой длины.
  • При работе с рукописными или отсканированными документами точность распознавания сущностей дополнительно зависит от качества распознавания самого текста на этапе OCR, а найденные сущности дальше обычно уходят в структурированный вывод для передачи в другую систему.
  • Извлечённые персональные данные вроде телефона или адреса стоит обрабатывать с той же осторожностью, что и в задаче удаления персональных данных.
Правило — возьмите двадцать последних документов нужного формата, разметьте ожидаемые поля вручную и сравните с результатом модели: если промах случается больше чем в одном документе из двадцати, промпт лучше доработать именно под этот формат.

Как выглядит похожая разметка данных на практике — в статье про few-shot примеры для разметки заявок. Как встроить извлечение данных в чат-бота для бизнеса — в разделе чат-ботов под ключ.

// 06 · от практики

Как мы применяем Извлечение сущностей (NER) в работе с клиентами

В практике «Зинин × Штурбин» мы разбираем Извлечение сущностей (NER) на практике вашего бизнеса — это часть формата личное обучение фаундера. На реальных задачах это письмо → номер заказа и телефон, резюме → даты работы и должности и подобное. Рядом разбираем Structured output — термины в словаре связаны так же, как в работе.

Не консультируем абстрактно: команда уходит с навыком и рабочим процессом, который применяет сама. Посмотреть программы и цены →

// 08

Частые вопросы

01 Чем NER отличается от обычной суммаризации?

Суммаризация сокращает весь текст до краткого пересказа. NER, наоборот, вытаскивает из текста конкретные точные объекты — номера, даты, суммы, — оставляя остальной текст без изменений.

02 Какие типы сущностей чаще всего извлекают в бизнес-задачах?

Номера заказов и документов, даты, суммы, контактные данные, названия компаний и должности — набор обычно подбирают под конкретный процесс.

03 Можно ли настроить извлечение под нестандартный формат номеров?

Да, обычно достаточно добавить в промпт несколько примеров нужного формата — модель довольно быстро подхватывает новый шаблон по образцу.

04 Нужно ли отдельно защищать извлечённые персональные данные?

Да, телефон, адрес и другие личные данные стоит обрабатывать так же аккуратно, как в задаче удаления персональных данных, — ограничивать доступ и хранение.

05 Как проверить точность извлечения на своих данных?

Практичный способ — специально взять несколько самых странных писем с нестандартным форматом номеров за последний месяц и посмотреть, справится ли модель именно с ними: обычные случаи почти всегда работают, проблема прячется в исключениях.

06 Чем NER отличается от классификации текста?

Классификация текста присваивает метку всему документу целиком — например, «жалоба» или «вопрос». NER работает внутри текста и находит отдельные фрагменты определённого типа, оставляя остальной документ без изменений.

Понимаем — учим
работать с Извлечение сущностей (NER)
внутри команды.

Час бесплатной диагностики: разбираем 2–3 ваших процесса и говорим прямо, где AI окупится за квартал, а где брать рано. Знания остаются у вашей команды.

Готовы поговорить?
@Aleksei_Shturbin Бот →