Электронный архив документов: с чего начать
Главная ошибка: сканировать всё подряд
Типичный проект электронного архива начинается с закупки сканеров и заканчивается сотней тысяч файлов с именами вида scan_0421.pdf. Формально архив есть, практически им не пользуются: найти нужный документ по-прежнему можно только через того сотрудника, который помнит, в какой папке он лежит.
Причина простая: ценность архива не в наличии образов, а в возможности найти документ по содержимому. Значит начинать нужно не со сканирования, а с ответа на вопрос, по каким признакам документы будут искать.
Какие поля нужны почти всегда
Для казахстанской практики базовый набор такой: вид документа, номер, дата, контрагент с БИН, суммы, ИИН физического лица, период, к которому документ относится, и ссылка на связанный документ (договор для счёта, договор для акта).
Этого набора достаточно, чтобы закрыть большинство запросов: найти все документы по контрагенту, собрать комплект по договору, поднять первичку за период для проверки.
Порядок работы, который себя оправдывает
Первое. Выбрать один вид документов, который чаще всего ищут, и оцифровать его целиком. Обычно это договоры или первичка за последние два-три года.
Второе. Настроить извлечение полей и проверить его на выборке. Здесь важно измерить не «точность распознавания текста», а долю документов, где ключевые поля извлечены верно.
Третье. Дать людям поиск и посмотреть, что они ищут в реальности. Часто выясняется, что нужен ещё один признак, о котором никто не думал.
Четвёртое. Только потом расширять объёмы и глубину архива.
Двуязычность и рукописный ввод
Два обстоятельства, которые в Казахстане отличают архив от учебного примера. Первое: документы бывают на казахском и русском, иногда в одном файле двумя колонками, и поля нужно брать из правильной. Второе: часть значений вписана от руки, и рукописный ввод распознаётся заметно хуже печатного.
Практический вывод: для рукописных полей нужно предусматривать подтверждение человеком, а не полагаться на автоматику. Это дешевле, чем разбираться с последствиями неверного значения в архиве.
Проверка при загрузке, а не после
Архив это хороший момент, чтобы заодно проверять комплектность и корректность: контрольный разряд ИИН и БИН, контрольную сумму IBAN, совпадение номера договора в счёте и акте. Если это делать на входе, архив становится не складом образов, а инструментом контроля.
Наш сервис проверки документов закрывает именно эту часть: комплект проверяется целиком, документы сверяются между собой, история дел остаётся в кабинете. Компания регистрируется в сервисе сама: DocVision Ai, первые 50 дел в месяц бесплатно. Если нужен полноценный архив с хранением и поиском по вашему контуру, это проектная работа: смотрите внедрение OCR.
Частые вопросы
Сколько времени занимает оцифровка архива?
Зависит от объёма и качества бумаг. Разумный порядок: начать с одного вида документов за последние два-три года, получить работающий поиск и расширять объём дальше.
Нужно ли распознавать весь текст документа?
Обычно нет. Для поиска и контроля достаточно извлекать ключевые поля: вид, номер, дату, контрагента, суммы и связи с другими документами.
Что делать с рукописными полями?
Ставить подтверждение человеком. Рукописный ввод распознаётся хуже печатного, и слепо доверять автоматике в архиве дороже, чем проверить.
Что с этим делать дальше
Если документы идут потоком, проверку стоит отдать сервису: DocVision Ai сверяет комплект между собой, ведёт историю дел и подключается к вашей системе по токену, первые 50 дел в месяц бесплатно. Нужна своя система под процесс с вводом в 1С или CRM: смотрите внедрение OCR. Один комплект можно проверить без регистрации в бесплатном инструменте.