Wyodrębnianie danych z PDF za pomocą AI: jak weryfikować to, co zostało odczytane
Przekształcenie zmiennych dokumentów w dane możliwe do skontrolowania, zanim trafią do systemów.
Zespół redakcyjny SqualiOnline · 2026-09-07
System, który czyta fakturę i zwraca dziesięć wypełnionych pól, robi dobre wrażenie. Problem pojawia się później: przy dwóch tysiącach dokumentów, jak dowiedzieć się, które dziesięć pól jest błędnych? Automatycznego wyodrębniania nie ocenia się na podstawie udanego pokazu, lecz na podstawie tego, co się dzieje, gdy myli się po cichu. Ten poradnik służy do zaprojektowania kontroli, zanim te dane zostaną gdziekolwiek zapisane.
Najpierw pola, potem narzędzie
Pierwsza decyzja nie jest technologiczna: to lista potrzebnych Państwu pól, z formatem i regułą każdego z nich, spisana przed wypróbowaniem jakiegokolwiek narzędzia.
- Jakie pola. Nie „wszystko, co jest w dokumencie”: tylko pola, których ktoś użyje. Każde wyodrębnione pole to pole do skontrolowania.
- Jaki format. Data to konkretny dzień, a nie linijka tekstu; kwota ma walutę i miejsca dziesiętne; kod ma określoną długość. Bez formatu nie istnieje kontrola automatyczna.
- Jakie dokumenty są dopuszczone. Plik wygenerowany przez inny system czyta się w jeden sposób, krzywy skan ostemplowanej kartki to zupełnie inny problem. Powiedzenie „przyjmujemy wszystko” oznacza brak progu jakości.
- Co zrobić, gdy pola nie ma. To najczęstszy i najsłabiej zaprojektowany przypadek: dokument jest ważny, ale danej nie ma. Odpowiedzią nie może być wartość odtworzona na wyczucie.
Jeśli tej listy nie da się spisać, problemem nie jest sztuczna inteligencja: jest nim to, że proces po stronie odbiorczej nie jest zdefiniowany i nikt nie wie, co zrobi się z tymi danymi.
Trzy różne operacje nazywane „odczytem”
W tym samym zdaniu myli się trzy rzeczy, które mylą się w różny sposób i trzeba je weryfikować w różny sposób.
- Rozpoznawanie tekstu: zamiana obrazu na znaki. Tu błędy są materialne — ósemka odczytana jako trójka, linijka przecięta zagięciem kartki, fragment poza kadrem. Dokument powstały cyfrowo pomija ten krok i jest znacznie bardziej wiarygodny.
- Wyodrębnianie: decyzja, która spośród obecnych liczb jest sumą całkowitą, i która z trzech dat jest datą wystawienia. Tu błędy mają charakter interpretacyjny i są najgroźniejsze, ponieważ wynik zawsze wygląda wiarygodnie.
- Kontrola: ustalenie, czy wyodrębniona dana jest spójna z resztą. To jedyny z trzech kroków, który może zauważyć, że coś się nie zgadza, i to ten, którego prawie nikt nie projektuje.
System, który pomija trzeci krok, nie jest zautomatyzowany: po prostu przeniósł kontrolę na osobę odbierającą dane, nie mówiąc jej o tym.
Tabela pól
Najbardziej użytecznym dokumentem projektowym jest tabela z jednym wierszem na pole. Przykład, na fakturze otrzymanej od dostawcy.
| Pole | Gdzie się znajduje | Kontrola | Jeśli kontrola się nie powiedzie |
|---|---|---|---|
| Dostawca | Nagłówek | Numer VAT istnieje w bazie kontrahentów | Do weryfikacji, z propozycją nowego dostawcy |
| Numer dokumentu | Nagłówek | Nie występuje już dla tego samego dostawcy | Zablokowane: możliwy duplikat |
| Data | Nagłówek | Jest ważną datą i nie jest przyszła | Do weryfikacji |
| Kwota netto | Podsumowanie | Suma pozycji, z tolerancją zaokrąglenia | Do weryfikacji, z uwypukloną różnicą |
| Podatek | Podsumowanie | Zgodny z kwotą netto i wskazanymi stawkami | Do weryfikacji |
| Suma całkowita | Podsumowanie | Równa kwocie netto powiększonej o podatek | Zablokowane: dokument się nie zgadza |
| Numer referencyjny zamówienia | Treść lub uwagi | Odpowiada otwartemu zamówieniu | Przechodzi z oznaczeniem, bez numeru referencyjnego |
Ostatnie dwie kolumny są prawdziwym przewodnikiem. Pole bez kontroli i bez miejsca docelowego w razie błędu to pole, którego nikt nigdy nie zweryfikuje.
Kontrole, które spisuje się ręcznie
Użyteczne kontrole nie są statystyczne: są arytmetyczne i oparte na danych rejestrowych, i właśnie dlatego są wiarygodne.
- Spójność wewnętrzna: sumy się zgadzają, pozycje się sumują, procenty dają się przeliczyć.
- Spójność z tym, co już Państwo wiedzą: dostawca istnieje, numer zamówienia istnieje, dany klient rzeczywiście ma tę siedzibę.
- Wiarygodność: data z ubiegłego wieku, kwota odbiegająca o trzy rzędy wielkości, ujemna ilość tam, gdzie być jej nie może.
- Duplikaty: ten sam dokument wgrany dwukrotnie to błąd częstszy niż źle odczytane pole, i bardziej kosztowny.
Gdy kontrola się nie powiedzie, nie poprawia się niczego automatycznie. Wysyła się to do weryfikacji: samodzielne poprawienie danej, co do której system już okazał niepewność, to najprostszy sposób na stworzenie niewidocznych błędów.
Gdzie przechodzi ludzka weryfikacja
Realistycznym celem nie jest wyeliminowanie człowieka: jest sprawienie, żeby patrzył na niewiele dokumentów zamiast na wszystkie, i wiedział, na które.
- Dokumenty, które przechodzą wszystkie kontrole, idą dalej, wraz ze swoim śladem.
- Dokumenty z niepowodzeniem kontroli trafiają do kolejki weryfikacji, z podświetlonym problematycznym polem i oryginalnym dokumentem obok: osoba poprawiająca nie musi niczego szukać.
- Dokumenty blokujące — niezgadzająca się suma całkowita, możliwy duplikat — w żadnym wypadku nie idą dalej, nawet gdy się spieszy.
Kolejkę weryfikacji trzeba odczytywać jako wskaźnik. Jeśli stale rośnie przy tym samym typie dokumentu albo tym samym dostawcy, rozwiązaniem niemal nigdy nie jest ulepszenie wyodrębniania: jest nim poproszenie o ten dokument w innym formacie.
Zachowanie pochodzenia
Dla każdej danej zapisanej w systemie musi być możliwość ustalenia, skąd została wzięta. To nie biurokracja: to warunek, żeby móc zakwestionować, poprawić i zrozumieć.
- Oryginalny dokument, zachowany i powiązany z daną.
- Miejsce w dokumencie, z którego wartość została wyodrębniona, żeby móc ją odnaleźć bez ponownego czytania wszystkiego.
- Jeśli wartość została poprawiona ręcznie: przez kogo, kiedy i jaka była poprzednia wartość.
- Jakie kontrole zostały wykonane i z jakim wynikiem.
Bez tych czterech informacji, gdy za rok jakaś liczba okaże się błędna, nie będzie wiadomo, czy błąd tkwi w odczycie, w poprawce czy w dokumencie wyjściowym.
Czego nie obejmuje ten poradnik
Tutaj omawiane jest wspomagane wyodrębnianie: co można odczytać z dokumentu i jak to weryfikować. Nie istnieje konfiguracja gwarantująca całkowitą dokładność, a żadna wyodrębniona dana nie powinna trafiać do księgowości bez opisanych kontroli. Przypadek systemu, który nie ogranicza się do odczytu, lecz zapisuje lub zmienia dane w systemie do zarządzania firmą, to inny problem, dotyczący uprawnień i dozwolonych działań, z własnym poradnikiem; również jednorazowe przeniesienie danych z arkuszy kalkulacyjnych albo starego systemu ma swoją własną metodę.
Najpopularniejsze pytania
Od jakich dokumentów warto zacząć?
Od tych, których jest wiele, są powtarzalne i pozwalają na kontrole arytmetyczne, jak otrzymane faktury czy dokumenty przewozowe. To przypadki, w których błąd można wykryć samodzielnie. Umowy i dokumenty techniczne, gdzie dana ma charakter opisowy i nie da się jej zweryfikować sumą, są punktem docelowym, a nie startowym.
Jaka jest różnica między systemem opartym na regułach a systemem opartym na modelach?
System oparty na regułach szuka danej w stałym miejscu: jest precyzyjny, dopóki dokument nie zmieni układu. Model toleruje zmienność, ale gdy się myli, tworzy wiarygodnie wyglądający wynik. W praktyce się je łączy, a w obu przypadkach potrzebne są te same kontrole po stronie odbiorczej.
Kto odpowiada, jeśli źle wyodrębniona dana spowoduje błąd?
Osoba, która używa danej, a nie ta, która ją odczytała. To powód, dla którego automatyczne kontrole, kolejka weryfikacji i identyfikowalność źródła nie są dodatkiem: to sposób, w jaki firma zachowuje kontrolę nad tym, co trafia do jej systemów.
Ocenimy, które dokumenty mogą Państwo przetwarzać w sposób wspomagany.
Jeśli chcą Państwo o tym porozmawiać, zajmuje się tym usługa Sztuczna inteligencja.

