Проектирование процесса автоматизированного ввода бумажных документов

⇐ Предыдущая 12 13 14 15 161718 19 20 21 Следующая ⇒

Одной из основных задач, связанных с сокращением затрат на обработку данных, является автоматизация массового ввода бумажных первичных документов. Основное отличие массового ввода документов от простого сканирования состоит в том, что обрабатывается большое количество однотипных документов.

В качестве примеров приложений данной технологии в конкретных предметных областях можно привести систему ввода и обработки «Платежных поручений» в банке, систему ввода «Налоговых деклараций» и т.д.

При проектировании системы ввода бумажных документов выполняется следующая совокупность операций:

· определение состава операций, которая должна выполнять система;

· выбор технических средств реализации выполнения этих операций;

· выбор и настройка программного обеспечения;

· разработка технологической документации.

Автоматизированное чтение и ввод документов включают в себя операции, которые можно объединить в несколько стадий:

1. Подготовка документов к сканированию.

2. Получение изображения документа.

3. Распознавание и ввод данных, содержащихся в документе.

1. Подготовка документов к сканированию включает в себя две операции: непосредственную подготовку документов для сканирования и выполнение описания настройки системы на конкретную форму документа.

Подготовка документов для сканирования предполагает выполнение следующих шагов:

· определение самого документа для сканирования;

· выбор конкретных областей документа для сканирования;

· непосредственная подготовка документов для сканирования: открытие конвертов, удаление скрепок или других предметов, мешающих сканированию;

· подготовка пакетов документов для сканирования.

Составление описания каждого документа предполагает выполнение трех операций:

· составление настройки формы документа;

· настройка модели ввода;

· настройка полей формы документа.

В основе выполнения этих операций лежит понятие форматированного (структурированного) документа. К таким документам относятся «Платежные поручения», «Прайс-листы» т.д.

Основной структурной единицей форматируемого документа является поле документа. Каждое поле описывается в двух аспектах: визуально, в частности геометрически, и содержательно. С изобразительной точки зрения каждое поле должно быть явно обособлено: пустыми промежутками, разделительными линиями, оригинальным типом шрифта, уровнем фона, цветом и т.д.

Содержательная часть характеризуется назначением поля, словарным и алфавитным составом, а также некоторыми законами построения текста, например, в поле почтового адреса должны быть сведения о городе, улице, доме и проч.

Документы, которые подлежат сканированию, могут быть объединены в группы по нескольким признакам.

По способу нанесения информации можно выделить документы, в которых используются метки, печатный или рукописный текст. Так, например, Избирательные бюллетени используют меточный способ, в то время как Прайс-листы - печатный, а первичные бухгалтерские документы - в основном рукописные.

По геометрической вариантности полей различают документы, в которых расположение всех полей и записей строго фиксировано относительно опорных элементов: рамок, линий, постоянных напечатанных записей, специальных маркеров. Все специально подготовленные для машинной обработки документы обладают этим качеством. Другим типом являются документы, которые имеют произвольное расположение полей.

Кроме того, можно разделять документы по наличию явных разделителей полей, которые часто присутствуют в таблицах, бухгалтерских документах или их отсутствию.

2. Получение изображения документа включает в себя выполнение таких операций, как сканирование, контроль качества отсканированных изображений и возможное повторное сканирование.

Контроль качества отсканированных изображений необходим для того, чтобы все нужные документы были отсканированы и легко читаемы. Для повышения эффективности и надежности системы следует иметь возможность выборочной проверки качества отсканированных изображений, а при сканировании многостраничных документов - возможность отслеживать порядок сканируемых страниц.

Повторное сканирование проводится в случае неудовлетворительного качества изображения или из-за проблем, связанных с неправильным порядком страниц в документе.

3. Распознавание и ввод данных, содержащихся в документе, в информационную базу предполагают выполнение следующих основных операций:

· предварительной обработки изображений;

· нахождения полей (сегментация документа и чтение текста);

· проверки распознанной информации;

· ввода данных в информационную базу.

Распознавание документа, анализ содержания документа и извлечение данных осуществляются в настоящее время с помощью следующих систем распознавания текстов, отличающихся по стоимости, качеству и скорости работы:

· технология оптического распознавания печатных символов OCR (Optical Character Recognition), т.е. перевода сканированного изображения печатных символов в их текстовое представление;

· технология распознавания раздельных печатных символов, написанных от руки ICR (Intelligent Character Recognition);

· технология распознавания отметок (обычно перечеркнутые крест-накрест либо галочками квадраты или круги) OMR (Optical Mark Recognition);

· технология распознавания стилизованных цифр – распознавание рукописных цифр, написанных от руки по шаблону, как на почтовых конвертах.

⇐ Предыдущая 12 13 14 15 161718 19 20 21 Следующая ⇒

Дата добавления: 2014-12-06; просмотров: 1876. Нарушение авторских прав; Мы поможем в написании вашей работы!

Аальтернативная стоимость. Кривая производственных возможностей В экономике Буридании есть 100 ед. труда с производительностью 4 м ткани или 2 кг мяса...

Вычисление основной дактилоскопической формулы Вычислением основной дактоформулы обычно занимается следователь. Для этого все десять пальцев разбиваются на пять пар...

Расчетные и графические задания Равновесный объем - это объем, определяемый равенством спроса и предложения...

Кардиналистский и ординалистский подходы Кардиналистский (количественный подход) к анализу полезности основан на представлении о возможности измерения различных благ в условных единицах полезности...

Неисправности автосцепки, с которыми запрещается постановка вагонов в поезд. Причины саморасцепов ЗАПРЕЩАЕТСЯ: постановка в поезда и следование в них вагонов, у которых автосцепное устройство имеет хотя бы одну из следующих неисправностей: - трещину в корпусе автосцепки, излом деталей механизма...

Понятие метода в психологии. Классификация методов психологии и их характеристика Метод – это путь, способ познания, посредством которого познается предмет науки (С...

ЛЕКАРСТВЕННЫЕ ФОРМЫ ДЛЯ ИНЪЕКЦИЙ К лекарственным формам для инъекций относятся водные, спиртовые и масляные растворы, суспензии, эмульсии, новогаленовые препараты, жидкие органопрепараты и жидкие экстракты, а также порошки и таблетки для имплантации...

Пункты решения командира взвода на организацию боя. уяснение полученной задачи; оценка обстановки; принятие решения; проведение рекогносцировки; отдача боевого приказа; организация взаимодействия...

Что такое пропорции? Это соотношение частей целого между собой. Что может являться частями в образе или в луке...

Растягивание костей и хрящей. Данные способы применимы в случае закрытых зон роста. Врачи-хирурги выяснили...

Studopedia.info - Студопедия - 2014-2026 год . (0.011 сек.) русская версия | украинская версия