01 Простыми словами
Скан документа или фото чека — для компьютера это лишь картинка, набор цветных точек без всякого понятия о буквах. OCR анализирует форму этих точек, распознаёт в них буквы и цифры и превращает картинку в обычный текстовый файл, который можно скопировать, найти по ключевому слову или передать дальше в другую систему.
02 Как это работает
Технически OCR — отдельная модель или сервис, который принимает изображение и отдаёт текст на выходе.
- Изображение сначала готовят к распознаванию: выравнивают перекос страницы, убирают шум и тени со скана или фото.
- Модель находит на странице области с текстом и построчно распознаёт символы внутри каждой области.
- Результат собирают в цельный текст с сохранением примерной структуры страницы — абзацев, таблиц, подписей.
03 Где применяется
- Бухгалтерия. Счета и акты от поставщиков переводят в текст для последующей передачи в IDP-конвейер и учётную систему.
- HR. Скан паспорта или трудовой книжки нового сотрудника распознаётся для личного дела без ручного перепечатывания.
- Юристы. Старые бумажные договоры и архивные дела переводят в текстовый вид для поиска по содержанию.
- Логистика. Фото накладной, сделанное водителем на телефон, распознаётся прямо на месте вместо ожидания бумажного оригинала в офисе.
- Медицина. Рукописные назначения врача переводят в текст для электронной карты пациента.
- Розница. Фото чека сотрудника для отчёта о командировочных расходах распознаётся автоматически вместо ручного ввода суммы.
04 Сколько сканов у бухгалтерии
Бухгалтерия компании среднего размера получает за месяц около 400 счетов и актов от постоянных поставщиков: примерно 250 в виде PDF с готовым текстовым слоем, остальные 150 — сканы или фото без текстового слоя, которым и требуется OCR.
Из этих 150 документов около 120 распознаются с первого раза без правок — это ровные сканы с хорошим освещением. Оставшиеся примерно 30 документов в месяц дают ошибки распознавания: это в основном фото, сделанные под углом на телефон в плохо освещённом складе, и документы с рукописными пометками поверх печатного текста.
На разбор этих проблемных 30 документов у бухгалтера уходит по несколько минут на каждый — свериться с оригиналом и вручную поправить неверно распознанную цифру или дату.
При таком объёме месячная нагрузка на ручную правку остаётся небольшой, но при росте потока документов в несколько раз именно доля плохих фото решает, окупится ли переход на OCR быстрым потоком или потребует сначала навести порядок с качеством самих сканов на складе.05 Ограничения и ошибки
- Плохое освещение, перекос страницы и блики от вспышки телефона портят точность распознавания сильнее, чем качество самой модели OCR.
- Рукописный текст распознаётся ощутимо хуже печатного — для документов с ручными пометками стоит закладывать больше времени на проверку человеком.
- Похожие по начертанию символы — например, цифра «0» и буква «О», цифра «1» и буква «I» — модель иногда путает, особенно на мелком или размытом шрифте.
- Таблицы и многоколоночные документы OCR распознаёт сложнее сплошного текста — структура страницы может съехать при сборке результата.
- Результат распознавания стоит проверять выборочно даже на потоке с хорошим качеством сканов — редкая ошибка на важной цифре обходится дороже времени на проверку.
- Раз в несколько месяцев стоит пересматривать настройки распознавания заново — качество сканов у постоянных поставщиков со временем меняется в обе стороны.
- Готовый PDF с уже встроенным текстовым слоем распознавать заново обычно бессмысленно — экономичнее сначала проверить документ на наличие такого слоя.
Как выстроить полный разбор входящих счетов — в статье про распознавание счетов и актов. Как оценить архитектуру документооборота под масштаб компании — в разделе про нейросети для документов.