Dmitriy Kononov.
Обсудим задачуСвязаться

ПРОЕКТ

PDF-документы в структурированные данные

Проект OCR для сканов и текстовых PDF: таблицы, пакетная обработка и выгрузка для базы данных.

Документы и данные

PDF → распознавание → структура

Концептуальная иллюстрация процесса

Прочитать документ и использовать данные дальше

Задание разбора PDF охватывало сканированные страницы и документы со встроенным текстом. Нужно было извлекать таблицы, текстовые блоки, заголовки и метаданные в структуру для следующих этапов процесса. Многостраничные файлы, разные языки и неодинаковая вёрстка делали задачу сложнее обычного экспорта текста.

Цепочка обработки

В схеме реализации использовались Python, pdf2image, Tesseract через pytesseract и OpenCV. При необходимости страницы преобразовывались в изображения; перед распознаванием предусматривались перевод в оттенки серого, удаление шума и адаптивная бинаризация. Текст и таблицы обрабатывались отдельно, а Pandas помогал организовать и очистить результат.

Для выгрузки перечислялись JSON, CSV и MariaDB. Пакетный режим включал правила именования, отображение прогресса и управление ресурсами для больших файлов. Командная строка или графический интерфейс рассматривались как вход для оператора. Google Drive либо Dropbox могли предоставлять исходные документы; REST API позволял внешним приложениям отправлять PDF и получать извлечённые данные.

Ошибки распознавания и ручная проверка

В задании были журналы ошибок, отчёты по проблемным страницам и ручная проверка неудачного извлечения. Результат OCR нужно проверять: распознанные символы ещё необходимо сопоставить с количеством, датой или связями между ячейками. Источник предусматривал тесты на разных типах документов и оптимизацию точности и скорости, но не публиковал процент распознавания, эталонный набор или итоговую пропускную способность.

Для нового процесса нужны характерные образцы и список полей, важных следующей системе. Исключения должны возвращаться проверяющему, а не незаметно попадать в базу.

Смотрите обработку на Python, AI-процессы и заказы производства из документов. Обсудить ваши документы.

Статус проекта в архиве

В прежнем портфолио сохранились требования и схема обработки PDF. Источник не уточняет окончательный запуск, текущую эксплуатацию и измеренные результаты.