Распознавание документов: как работает и где ломается
← Все материалы
Разбор

Распознавание документов: как это устроено, где ломается и как считать точность

Распознавание документов — это превращение скана, фото или PDF в структурированные данные: не «текст со страницы», а конкретные поля — номер, дата, ИНН контрагента, сумма, НДС, строки номенклатуры. Ниже разберу, из чего собирается такая система, где она предсказуемо ломается, как мерить её качество по полям и когда её не стоит делать вообще.

98–99 %точность OCR по печатному тексту на чистом скане
≈ 90 %потолок по рукописному тексту у лучших систем
от 600 ₽/годтариф 1С на 100 страниц распознавания

Что такое распознавание документов и из чего оно собирается

Система решает три разные задачи, и путать их дорого. Прочитать символы на картинке — это OCR. Понять, что за документ перед нами — накладная, акт, счёт-фактура, договор — это классификация. Достать нужные поля и увязать их между собой — это извлечение атрибутов. Чистый OCR отдаёт вам простыню текста; в учётную систему такое не загрузишь.

Скан или фотоПодготовкаизображенияТип документаИзвлечениеполейАвтопроверкиДокумент вучёте
Путь одной страницы. Человек участвует только на входе и на разборе спорных случаев

Подготовка изображения — недооценённый этап. Выравнивание наклона, удаление теней от сгиба, повышение контраста, разрез многостраничного PDF на отдельные документы. Наклон скана всего в 5 градусов без предобработки увеличивает долю ошибок в словах на 15 % и больше — то есть половина брака лечится не моделью, а нормальной подачей в сканер.

Второй приём, который сильно поднимает качество, — локализованное распознавание. Движку не дают читать всё подряд, а говорят заранее: в этой зоне ожидается дата, здесь ИНН из 10 или 12 цифр, здесь денежная сумма. Ошибок в разы меньше, чем при разборе сплошного текста регулярками.

Где ломается OCR: сканы, печати, рукописный текст, таблицы

По печатному тексту на ровном чистом скане зрелые движки дают 98–99 % точности по символам. Рукописный текст — другая история: лучшие системы упираются примерно в 90 %, мультимодальные модели подтягивают это к 95 % на тестовых наборах, но на реальных каракулях с накладной результат всегда ниже. Вот основные источники брака и что с ними делать.

Что на документеЧто происходитЧто помогает
Печать или штамп поверх текстаСимволы под оттиском теряются или читаются как соседниеПредобработка по цветовому каналу, повторный проход по зоне
Рукописные правки, даты, подписиТочность падает до 80–90 %, курсив и слитное письмо — хуже всегоНе пытаться автоматизировать: поле уходит человеку сразу
Фото с телефонаПерспектива, блики, тень от рукиВыравнивание по углам листа, требование к качеству съёмки
Таблица без линий, объединённые ячейкиСтроки склеиваются, количество уезжает в соседнюю колонкуРазбор структуры, а не текста; проверка «сумма строк = итог»
Таблица, разорванная на две страницыВторая часть номенклатуры теряется молчаСклейка многостраничных документов до распознавания
Чек на термобумаге, копия копииТекст выцвел, распознавать нечегоОтсечь на входе по оценке качества, а не тащить мусор в учёт

Худший сценарий — не ошибка, а тихая ошибка: система не упала, документ создался, а в сумме вместо 12 400 стоит 124 000. Поэтому проверки важнее модели: об этом ниже.

Чем распознавание первичных документов отличается от паспортов

Это два разных класса задач, и решения для них строятся по-разному. Паспорт, права, свидетельство — жёсткая форма: поля всегда на одном месте, машиночитаемая зона внизу проверяется контрольными суммами. Накладная, акт или счёт-фактура — полуструктурированный документ: набор реквизитов задан законом, а вёрстка у каждого поставщика своя и меняется от версии к версии его 1С.

ПАСПОРТ, БЛАНК, АНКЕТАНАКЛАДНАЯ, АКТ, СЧЁТ-ФАКТУРАПоля на фиксированных координатахОдин шаблон закрывает почти всёЕсть машиночитаемая зона для сверкиПерсональные данные — 152-ФЗ и вопрос, где …Ошибка видна сразу: ФИО либо верное, либо н…Вёрстка своя у каждого контрагентаШаблоны не масштабируются: поставщиков сотниСверять надо арифметикой и справочникамиДанные коммерческие, но уходят в бухучёт и …Ошибка в одной строке из ста всплывает при …
Отсюда разные архитектуры: для документов личности — шаблон, для первички — модель плюс правила

Практический вывод. Если вам обещают закрыть распознавание первичных документов «шаблонами под каждого поставщика» — уточните, кто будет заводить сто первый шаблон. Работающий подход другой: обучаемая модель тянет поля независимо от вёрстки, а система запоминает поправки оператора по конкретному контрагенту и в следующий раз применяет их сама.

1С: распознавание первичных документов встроенным сервисом или отдельным

Чаще всего задача звучит как «1С 8.3, распознавание документов, чтобы сразу создавался документ поступления». Тут есть три пути, и начинать почти всегда стоит с самого дешёвого.

ВариантЧто даётГде упирается
Сервис 1С:Распознавание первичных документовЗагрузка и создание документа в интерфейсе самой 1С, поддержка PDF, JPEG, PNG, TIFF, BMP, Word, Excel и архивовТиповые виды первички, оплата по страницам, логика в рамках сервиса
Внешний сервис распознавания первичных документовПостраничная оплата без лицензии, обучение на ваших контрагентах, пакетная загрузкаДокументы уходят на чужую сторону, интеграция через обработку
Своё решениеЛюбые типы документов, свои проверки, данные не покидают контурДороже на старте, нужен владелец у системы

Тарифы у 1С считаются страницами: младший пакет — около 600 ₽ в год за 100 страниц, дальше линейка растёт до десятков тысяч страниц. Это отличный способ проверить гипотезу: возьмите минимальный пакет, прогоните месячную пачку и посмотрите на реальную долю документов, где пришлось править руками. Своё решение имеет смысл, когда типовой сервис не берёт ваши документы (отраслевые формы, спецификации, ТТН с приложениями), нужны проверки по вашим правилам или данные нельзя выпускать наружу.

Проверьте на своих документах до оплаты годового тарифа. Демонстрация на эталонной накладной поставщика ничего не говорит о том, как сервис справится с вашей пачкой сканов с печатями и рукописными отметками кладовщика.

Пока читаете — можно сразу проверить свою задачу. Опишите процесс, и я скажу, решается ли он и во сколько обойдётся.

Как мерить качество: точность по полям, а не «в среднем»

«Точность 98 %» — бесполезная цифра, потому что непонятно, 98 % чего. Считать нужно три разные вещи.

Номер и датаправок малоИНН, КППспасают контрол…Суммы и НДСловится арифмет…Строки номенклатурысопоставление с…
Форма распределения важнее абсолютных чисел: сводная цифра прячет провал по номенклатуре. Свои значения замеряйте на своей пачке
  1. Отберите 100 документов так, как они приходят на самом деле: с печатями, фотографиями, копиями, а не отобранные красивые.
  2. Разметьте эталон руками — это два-три часа и единственный способ получить честную базу сравнения.
  3. Прогоните через сервис и посчитайте ошибки по каждому полю, а не суммарно.
  4. Отдельно посчитайте долю документов, прошедших полностью без правки.
  5. Повторяйте замер раз в квартал: контрагенты меняют формы, и качество плывёт незаметно.

Что делать с ошибками и где нужен человек-контролёр

Стопроцентного распознавания не бывает, и система должна проектироваться из этого допущения. Задача не в том, чтобы убрать человека, а в том, чтобы он смотрел не все документы, а только спорные. Разделение делают автопроверки — они дешёвые и ловят большую часть брака без участия людей.

Приём: сканер, почта, папка, телефонПодготовка: выравнивание, разрез, оценка качестваРаспознавание: тип документа и поляПроверки: арифметика, справочники, дублиВерификация: человек видит только спорноеВыгрузка: 1С, ERP, база, архив с исходником
Уберите слой проверок — и вместо экономии получите ошибки в учёте, которые всплывут на сверке

Интерфейс контролёра решает больше, чем лишний процент точности модели: скан слева, поля справа, курсор сам прыгает в подозрительное поле, подсказка выбирается из справочника, а не набирается руками. И обязательно — исходник хранится рядом с проведённым документом, чтобы через полгода можно было открыть и посмотреть, что было на бумаге.

Сколько стоит и когда распознавание документов не нужно

Окупаемость считается на объёме, и формула простая: число документов в месяц × минут на ручной ввод × стоимость минуты сотрудника. Замерьте первый множитель по своей выгрузке за прошлый месяц, второй — секундомером на двадцати документах, а не по ощущениям. Дальше сравните с суммой «тариф сервиса + время верификации». Если экономия меньше пары рабочих дней в месяц, проект не нужен — и это нормальный результат расчёта.

Честная часть: распознавание документов не нужно, если верно хотя бы одно из этого.

Разумный порядок действий такой: сначала переводите поток на автоматизацию электронного документооборота с теми контрагентами, кто на это готов, а распознавание оставляете для оставшейся бумаги. Если поверх распознанных данных нужны ещё и решения — сверка с заказом, запрос недостающего у поставщика, маршрут согласования, — это уже задача для ИИ-агента, а не для OCR.

Частые вопросы

Какая точность распознавания документов реально достижима?

По печатному тексту на ровном скане движки дают 98–99 % по символам, по рукописному — около 90 %. Но для учёта важна другая цифра: доля документов, прошедших без единой правки. Она всегда ниже, потому что один неверный символ в номенклатуре портит весь документ.

Сколько стоит сервис распознавания первичных документов?

Встроенный сервис 1С тарифицируется страницами: младший пакет — около 600 ₽ в год за 100 страниц, дальше линейка растёт до десятков тысяч страниц. Внешние сервисы обычно берут постранично без покупки лицензии. Своя разработка оправдана, когда типовые сервисы не берут ваши формы или данные нельзя отдавать наружу.

Как настроить распознавание первичных документов в 1С 8.3?

Проще всего через встроенный сервис: файлы загружаются прямо из интерфейса 1С в форматах PDF, JPEG, PNG, TIFF, BMP, Word, Excel и архивов, после проверки из них создаются документы поступления. Начните с минимального тарифа и прогоните месячную пачку — так вы увидите реальную долю ручных правок до крупных вложений.

Распознаёт ли система рукописный текст и печати?

Печатный текст под печатью частично восстанавливается предобработкой. Рукописный текст остаётся слабым местом: около 90 % даже у лучших систем, а на курсиве и слитном письме — заметно хуже. Правильная стратегия — не автоматизировать рукописные поля, а отправлять их человеку сразу.

Что делать с ошибками распознавания?

Ловить их автопроверками до человека: сумма строк равна итогу, НДС сходится со ставкой, ИНН проходит контрольную сумму и есть в справочнике, документ не дубль. Человек смотрит только те документы, где проверка не сошлась или уверенность модели по полю ниже порога.

Когда распознавание документов не окупится?

При потоке до сотни-двух документов в месяц, при наличии обмена по ЭДО или готовой выгрузки от поставщика и при разовой задаче вроде оцифровки архива. Считайте по формуле: число документов × минуты ручного ввода × стоимость минуты, и сравнивайте с тарифом плюс временем на верификацию.

распознавание документов1с распознавание первичных документовсервис распознавания первичных документов1с 8.3 распознавание документовраспознавание накладных и счетов-фактур

Читайте дальше

Посчитать ваш поток документов

Пришлите десяток типовых сканов и объём в месяц — скажу, хватит ли готового сервиса, какая доля уйдёт на ручную проверку и есть ли тут вообще экономия.

Обсудить задачу