Як ШІ читає документи: OCR, структуровані дані й перевірка
Між знімком накладної та готовим рядком обліку — чотири окремі етапи. Помилки на кожному виглядають однаково, а виправляються по-різному.
«ШІ розпізнає документи» — це насправді конвеєр із кількох незалежних кроків. Розуміти, з яких саме, корисно з практичної причини: коли результат виявляється неправильним, ви одразу знаєте, який етап дивитися.
Етап 1. Зображення
Спочатку документ треба привести до придатного вигляду. Знімок під кутом випрямляється, нерівномірне освітлення вирівнюється, сторінки багатосторінкового PDF розділяються, визначається орієнтація.
Це нудна частина, яка дає непропорційно великий вплив на кінцевий результат. Половина скарг на «погане розпізнавання» — це насправді фото з відблиском від лампи або сфотографована під кутом сорок п'ять градусів сторінка.
Етап 2. Текст
Далі зображення стає текстом. Сучасні системи роблять це добре, але є місця, де вони стабільно спотикаються, і українські документи потрапляють у більшість із них.
Рукописні позначки й підписи. Печатки, що перекривають текст. Таблиці зі складною версткою й об'єднаними комірками. Дрібний шрифт у примітках. Символи, що легко плутаються: О і 0, І і 1, З і 3 — а в номерах документів і сумах саме ця плутанина найдорожча.
Окремо — багатоколонкова верстка. Наївний витяг тексту читає рядок через усю сторінку, змішуючи дві колонки в одне речення. Для договору, зверстаного у дві колонки, це руйнує сенс повністю.
Етап 3. Поля
Тут з'являється власне ШІ. Задача — не просто мати текст, а знати, що номер документа — це АА-1234, дата — 19.08.2026, а 12 480,00 у цьому місці означає суму без ПДВ.
Раніше це робили шаблонами: «номер лежить у правому верхньому куті». Працювало, доки постачальник не змінював форму. Мовна модель натомість орієнтується на зміст: вона розуміє, що поруч зі словом «Разом» стоїть підсумок, навіть якщо таблиця виглядає інакше, ніж учора.
Саме на цьому етапі мова має значення. Українські формати дат, скорочення «грн», «шт.», «ТОВ», позначення ПДВ, назви організацій у лапках — усе це модель має впізнавати як формати, а не як випадковий текст.
Етап 4. Перевірка
Останній етап найважливіший і найчастіше пропускається.
Система має не просто видати результат, а показати, наскільки вона в ньому впевнена — і підсвітити місця, які варто підтвердити людині. Різниця між «ось дані, перевірте все» і «ось дані, гляньте на ці два поля» — це різниця між економією часу та її відсутністю.
Корисно також, щоб кожне поле мало покликання на місце в документі, звідки воно взяте. Тоді перевірка — це погляд на підсвічений фрагмент, а не пошук по сторінці.
І окремо — арифметичні перевірки. Сума позицій має збігатися з підсумком, ПДВ — з розрахунком за ставкою. Такі правила ловлять більшу частину помилок розпізнавання автоматично, без участі людини.
Де це справді окупається
Розпізнавання дає найбільший ефект там, де документів багато й вони однотипні: первинка в бухгалтерії, заявки, які клієнти надсилають фото, паперовий архів, у якому має запрацювати пошук.
Там, де документів десяток на місяць, вигода сумнівна: налаштування й перевірка з'їдять зекономлений час. Груба орієнтація — від кількох десятків документів на тиждень.
Що робити з результатом
Розпізнаний документ — це ще не результат, а сировина. Цінність з'являється на наступному кроці: рядок потрапляє в облік без перенабору, договір стає доступним для пошуку разом із рештою бази, дані заявки одразу йдуть у процес.
Тому обирати систему розпізнавання варто не лише за точністю, а й за тим, куди вона вміє віддавати результат. Ідеально розпізнаний документ, який далі треба копіювати руками, економить рівно нічого.
Читайте також
RAG простими словами: як зробити, щоб ШІ відповідав з ваших джерел
Модель не знає ваших документів і не зізнається в цьому. Розбираємо механізм, який змушує її відповідати з ваших матеріалів — і що псує його якість.
ШІ українською: чому мова моделі має значення для роботи
Різниця між «підтримує українську» і «працює українською» проявляється не в перекладі кнопок, а на відмінках, іменах і документах.