OCR-конвеєр: скани рахунків перетворити на структуровані дані

Andriy
Роботодавець

Andriy

> 10 проєктів
Параметри проєкту
Варіант співпраціОдноразовий проєкт
Передоплатабез передоплат
Способи оплатиГотівка, Банківський переказ
Прийом заявоквід до 30.08.2026
Опис проєкту
У нашій компанії накопичилися десятки тисяч паперових рахунків і сканів документів, які зараз лежать у теках і PDF-архівах без жодної можливості пошуку та аналізу. Нам потрібен робочий конвеєр OCR-оцифрування: він бере партію сканів, розпізнає текст на кожній сторінці й перетворює неструктуровані зображення на чисті структуровані записи, за якими можна будувати запити. Обсяг зростає щотижня, тому рішення має працювати автоматично за розкладом, забирати нові файли з вхідної теки й обробляти їх надійно, без ручного нагляду за чергою. Точність для нас важливіша за швидкість: неправильна сума чи хибно прочитана дата спричиняють реальні проблеми в бухгалтерії, тож конвеєр має діяти обережно й позначати все, у чому він не впевнений.

Конкретно за кожним документом система має видобувати потрібні нам поля: назву постачальника, номер рахунку, дату виставлення, позиції (де вони є), валюту, суму без податку, податок і підсумкову суму. Після видобування значення потрібно перевіряти, дати приводити до єдиного канонічного формату, числа звіряти так, щоб позиції сходилися з указаним підсумком, а результати з низькою впевненістю спрямовувати в чергу на ручну перевірку, а не записувати мовчки. Чисті записи слід вивантажувати і в нашу базу даних, і в таблицю, щоб фінансовий відділ міг одразу з ними працювати. Бажана реалізація на Python з відомим OCR-рушієм, зрозумілим логуванням і простим способом повторно обробити збійні документи.

Просимо ставитися до цього як до бойового інструмента, а не до прототипу. Ми надамо репрезентативний набір реальних сканів (різної якості, з поворотами й різними мовами) для налаштування й очікуємо в результаті вихідний код, інструкцію зі встановлення та коротку передачу справ, щоб наші співробітники могли експлуатувати й розвивати систему.

— Забір сканів і PDF з відстежуваної теки, вирівнювання та очищення зображень перед розпізнаванням
— Видобування постачальника, номера рахунку, дат, сум, податку й позицій з оцінкою впевненості
— Перевірка й нормалізація полів; звірка позицій з підсумком; відправлення сумнівних результатів на ручну перевірку
— Вивантаження структурованих записів у базу і в таблицю; логи та можливість повторного запуску
Автор проєкту: Andriy