Распознавание документов: как это устроено, где ломается и как считать точность
Распознавание документов — это превращение скана, фото или PDF в структурированные данные: не «текст со страницы», а конкретные поля — номер, дата, ИНН контрагента, сумма, НДС, строки номенклатуры. Ниже разберу, из чего собирается такая система, где она предсказуемо ломается, как мерить её качество по полям и когда её не стоит делать вообще.
Что такое распознавание документов и из чего оно собирается
Система решает три разные задачи, и путать их дорого. Прочитать символы на картинке — это OCR. Понять, что за документ перед нами — накладная, акт, счёт-фактура, договор — это классификация. Достать нужные поля и увязать их между собой — это извлечение атрибутов. Чистый OCR отдаёт вам простыню текста; в учётную систему такое не загрузишь.
Подготовка изображения — недооценённый этап. Выравнивание наклона, удаление теней от сгиба, повышение контраста, разрез многостраничного PDF на отдельные документы. Наклон скана всего в 5 градусов без предобработки увеличивает долю ошибок в словах на 15 % и больше — то есть половина брака лечится не моделью, а нормальной подачей в сканер.
Второй приём, который сильно поднимает качество, — локализованное распознавание. Движку не дают читать всё подряд, а говорят заранее: в этой зоне ожидается дата, здесь ИНН из 10 или 12 цифр, здесь денежная сумма. Ошибок в разы меньше, чем при разборе сплошного текста регулярками.
Где ломается OCR: сканы, печати, рукописный текст, таблицы
По печатному тексту на ровном чистом скане зрелые движки дают 98–99 % точности по символам. Рукописный текст — другая история: лучшие системы упираются примерно в 90 %, мультимодальные модели подтягивают это к 95 % на тестовых наборах, но на реальных каракулях с накладной результат всегда ниже. Вот основные источники брака и что с ними делать.
| Что на документе | Что происходит | Что помогает |
|---|---|---|
| Печать или штамп поверх текста | Символы под оттиском теряются или читаются как соседние | Предобработка по цветовому каналу, повторный проход по зоне |
| Рукописные правки, даты, подписи | Точность падает до 80–90 %, курсив и слитное письмо — хуже всего | Не пытаться автоматизировать: поле уходит человеку сразу |
| Фото с телефона | Перспектива, блики, тень от руки | Выравнивание по углам листа, требование к качеству съёмки |
| Таблица без линий, объединённые ячейки | Строки склеиваются, количество уезжает в соседнюю колонку | Разбор структуры, а не текста; проверка «сумма строк = итог» |
| Таблица, разорванная на две страницы | Вторая часть номенклатуры теряется молча | Склейка многостраничных документов до распознавания |
| Чек на термобумаге, копия копии | Текст выцвел, распознавать нечего | Отсечь на входе по оценке качества, а не тащить мусор в учёт |
Худший сценарий — не ошибка, а тихая ошибка: система не упала, документ создался, а в сумме вместо 12 400 стоит 124 000. Поэтому проверки важнее модели: об этом ниже.
Чем распознавание первичных документов отличается от паспортов
Это два разных класса задач, и решения для них строятся по-разному. Паспорт, права, свидетельство — жёсткая форма: поля всегда на одном месте, машиночитаемая зона внизу проверяется контрольными суммами. Накладная, акт или счёт-фактура — полуструктурированный документ: набор реквизитов задан законом, а вёрстка у каждого поставщика своя и меняется от версии к версии его 1С.
Практический вывод. Если вам обещают закрыть распознавание первичных документов «шаблонами под каждого поставщика» — уточните, кто будет заводить сто первый шаблон. Работающий подход другой: обучаемая модель тянет поля независимо от вёрстки, а система запоминает поправки оператора по конкретному контрагенту и в следующий раз применяет их сама.
1С: распознавание первичных документов встроенным сервисом или отдельным
Чаще всего задача звучит как «1С 8.3, распознавание документов, чтобы сразу создавался документ поступления». Тут есть три пути, и начинать почти всегда стоит с самого дешёвого.
| Вариант | Что даёт | Где упирается |
|---|---|---|
| Сервис 1С:Распознавание первичных документов | Загрузка и создание документа в интерфейсе самой 1С, поддержка PDF, JPEG, PNG, TIFF, BMP, Word, Excel и архивов | Типовые виды первички, оплата по страницам, логика в рамках сервиса |
| Внешний сервис распознавания первичных документов | Постраничная оплата без лицензии, обучение на ваших контрагентах, пакетная загрузка | Документы уходят на чужую сторону, интеграция через обработку |
| Своё решение | Любые типы документов, свои проверки, данные не покидают контур | Дороже на старте, нужен владелец у системы |
Тарифы у 1С считаются страницами: младший пакет — около 600 ₽ в год за 100 страниц, дальше линейка растёт до десятков тысяч страниц. Это отличный способ проверить гипотезу: возьмите минимальный пакет, прогоните месячную пачку и посмотрите на реальную долю документов, где пришлось править руками. Своё решение имеет смысл, когда типовой сервис не берёт ваши документы (отраслевые формы, спецификации, ТТН с приложениями), нужны проверки по вашим правилам или данные нельзя выпускать наружу.
Проверьте на своих документах до оплаты годового тарифа. Демонстрация на эталонной накладной поставщика ничего не говорит о том, как сервис справится с вашей пачкой сканов с печатями и рукописными отметками кладовщика.
Пока читаете — можно сразу проверить свою задачу. Опишите процесс, и я скажу, решается ли он и во сколько обойдётся.
Как мерить качество: точность по полям, а не «в среднем»
«Точность 98 %» — бесполезная цифра, потому что непонятно, 98 % чего. Считать нужно три разные вещи.
- Точность по символам. Метрика движка OCR. Красивая и почти не связанная с вашей болью.
- Точность по каждому полю отдельно. Номер, дата, ИНН, сумма, ставка НДС, каждая строка номенклатуры. Именно здесь видно, что всё хорошо, кроме номенклатуры, — а она и есть основная работа.
- Доля документов, прошедших без правки. Главная метрика для экономики: только она превращается в сэкономленные часы. Один кривой символ в одном поле портит весь документ.
- Отберите 100 документов так, как они приходят на самом деле: с печатями, фотографиями, копиями, а не отобранные красивые.
- Разметьте эталон руками — это два-три часа и единственный способ получить честную базу сравнения.
- Прогоните через сервис и посчитайте ошибки по каждому полю, а не суммарно.
- Отдельно посчитайте долю документов, прошедших полностью без правки.
- Повторяйте замер раз в квартал: контрагенты меняют формы, и качество плывёт незаметно.
Что делать с ошибками и где нужен человек-контролёр
Стопроцентного распознавания не бывает, и система должна проектироваться из этого допущения. Задача не в том, чтобы убрать человека, а в том, чтобы он смотрел не все документы, а только спорные. Разделение делают автопроверки — они дешёвые и ловят большую часть брака без участия людей.
- Арифметика. Сумма строк равна итогу, НДС равен базе на ставку, количество на цену равно сумме строки. Не сошлось — документ на ручной разбор.
- Контрольная сумма ИНН и сверка контрагента со справочником или ЕГРЮЛ. Это ловит подмену цифр практически полностью.
- Уверенность модели по полю. Ниже порога — поле подсвечивается оператору, остальные не трогаем.
- Дубли. Связка «ИНН поставщика + номер + дата» защищает от повторной загрузки одной и той же пачки.
- Сверка с заказом или договором. Если позиции и цены расходятся с тем, что заказывали, — это не ошибка распознавания, а повод для претензии поставщику.
Интерфейс контролёра решает больше, чем лишний процент точности модели: скан слева, поля справа, курсор сам прыгает в подозрительное поле, подсказка выбирается из справочника, а не набирается руками. И обязательно — исходник хранится рядом с проведённым документом, чтобы через полгода можно было открыть и посмотреть, что было на бумаге.
Сколько стоит и когда распознавание документов не нужно
Окупаемость считается на объёме, и формула простая: число документов в месяц × минут на ручной ввод × стоимость минуты сотрудника. Замерьте первый множитель по своей выгрузке за прошлый месяц, второй — секундомером на двадцати документах, а не по ощущениям. Дальше сравните с суммой «тариф сервиса + время верификации». Если экономия меньше пары рабочих дней в месяц, проект не нужен — и это нормальный результат расчёта.
Честная часть: распознавание документов не нужно, если верно хотя бы одно из этого.
- Документов мало. До сотни-двух в месяц ручной ввод дешевле любого внедрения и не требует поддержки.
- Контрагент уже в ЭДО. Электронный УПД приходит готовым XML со всеми реквизитами — распознавать там нечего, документ создаётся сразу. Дешевле уговорить крупных поставщиков перейти на обмен, чем сканировать их бумагу.
- Есть выгрузка или EDI. Excel-прайс, файл обмена, API поставщика — это точные данные без единой ошибки распознавания. Забирать поля с картинки, когда рядом лежит источник, — заведомо худший путь.
- Задача разовая. Оцифровать архив за пять лет — это разовый прогон через сервис, а не постоянная система в контуре.
- Процесс не описан. Если непонятно, кто проверяет и кто отвечает за проведённый документ, автоматизация просто ускорит появление ошибок в учёте.
Разумный порядок действий такой: сначала переводите поток на автоматизацию электронного документооборота с теми контрагентами, кто на это готов, а распознавание оставляете для оставшейся бумаги. Если поверх распознанных данных нужны ещё и решения — сверка с заказом, запрос недостающего у поставщика, маршрут согласования, — это уже задача для ИИ-агента, а не для OCR.
Частые вопросы
Какая точность распознавания документов реально достижима?
По печатному тексту на ровном скане движки дают 98–99 % по символам, по рукописному — около 90 %. Но для учёта важна другая цифра: доля документов, прошедших без единой правки. Она всегда ниже, потому что один неверный символ в номенклатуре портит весь документ.
Сколько стоит сервис распознавания первичных документов?
Встроенный сервис 1С тарифицируется страницами: младший пакет — около 600 ₽ в год за 100 страниц, дальше линейка растёт до десятков тысяч страниц. Внешние сервисы обычно берут постранично без покупки лицензии. Своя разработка оправдана, когда типовые сервисы не берут ваши формы или данные нельзя отдавать наружу.
Как настроить распознавание первичных документов в 1С 8.3?
Проще всего через встроенный сервис: файлы загружаются прямо из интерфейса 1С в форматах PDF, JPEG, PNG, TIFF, BMP, Word, Excel и архивов, после проверки из них создаются документы поступления. Начните с минимального тарифа и прогоните месячную пачку — так вы увидите реальную долю ручных правок до крупных вложений.
Распознаёт ли система рукописный текст и печати?
Печатный текст под печатью частично восстанавливается предобработкой. Рукописный текст остаётся слабым местом: около 90 % даже у лучших систем, а на курсиве и слитном письме — заметно хуже. Правильная стратегия — не автоматизировать рукописные поля, а отправлять их человеку сразу.
Что делать с ошибками распознавания?
Ловить их автопроверками до человека: сумма строк равна итогу, НДС сходится со ставкой, ИНН проходит контрольную сумму и есть в справочнике, документ не дубль. Человек смотрит только те документы, где проверка не сошлась или уверенность модели по полю ниже порога.
Когда распознавание документов не окупится?
При потоке до сотни-двух документов в месяц, при наличии обмена по ЭДО или готовой выгрузки от поставщика и при разовой задаче вроде оцифровки архива. Считайте по формуле: число документов × минуты ручного ввода × стоимость минуты, и сравнивайте с тарифом плюс временем на верификацию.
Читайте дальше
Посчитать ваш поток документов
Пришлите десяток типовых сканов и объём в месяц — скажу, хватит ли готового сервиса, какая доля уйдёт на ручную проверку и есть ли тут вообще экономия.
Обсудить задачу