System sprawdza każdą stronę PDF i płaci za OCR tylko wtedy, gdy strona jest skanem.
Do jednej skrzynki mogą trafiać zwykłe PDF-y, skany i dokumenty mieszane. Brama wybiera sposób odczytu osobno dla każdej strony. Przy pliku zapisuje decyzję, powód i koszt.
Co zmierzyliśmy
Demonstracja nie zawiera danych ani poświadczeń klienta. Przetwarza dokumenty publiczne i przygotowane pliki testowe. Wyniki na dokumentach klienta trzeba zmierzyć osobno.
- Zapisany pomiar
- Co zmierzyliśmy
- 181 PDF · 496 stron · 11 kontroli strukturalnych
- OCR tylko dla stron, które go potrzebują
- Zweryfikowano
- korpus mieszany
Problem, rozwiązanie i wynik
Problem
Do jednego procesu trafiają PDF-y tekstowe, skany i dokumenty mieszane. Gdy każdy plik idzie do OCR, firma płaci również za strony, które komputer mógł odczytać bez niego. OCR może też pogorszyć tekst zapisany poprawnie w oryginale.
Jak to działa
System sprawdza każdą stronę przed odczytem. Poprawny tekst odczytuje lokalnie. Do OCR wysyła tylko strony rozpoznane jako skany. Jeśli warstwa tekstowa jest uszkodzona, zatrzymuje dokument i pokazuje pracownikowi powód.
432 z 496 stron obyły się bez OCR
Demonstracja nie zawiera danych ani poświadczeń klienta. Przetwarza dokumenty publiczne i przygotowane pliki testowe. Wyniki na dokumentach klienta trzeba zmierzyć osobno.
Dla kogo
Ten system ma sens, jeśli do jednego procesu trafiają PDF-y tekstowe, skany i dokumenty mieszane, a dziś wszystkie strony są wysyłane do płatnego OCR.
Plik → inspekcja → trasa → rachunek
- 01Każda strona dostaje własną decyzję, zanim popłynie jakikolwiek koszt
- 02Strona z zaufanym tekstem przechodzi lokalnie, taryfa liczy wyłącznie strony OCR
- 03Uszkodzony tekst zatrzymuje dokument w kolejce przeglądu u operatora
- Typ firmy
- Firmy przetwarzające duże wolumeny skanowanych i mieszanych PDF-ów
- Wejście
- Jeden strumień PDF: natywne, skany i hybrydy; w próbie 181 plików i 496 stron
- Granica
- Uszkodzona warstwa tekstowa zatrzymuje dokument w przeglądzie człowieka
- Koszt
- 5,12 zł za OCR w pełnym przebiegu 181 plików oraz około 0,0035 zł za osobny odczyt dokumentu.
- Bezpieczeństwo
- Uszkodzony lub nieczytelny dokument trafia do człowieka zamiast przejść dalej jako poprawny.
- Ślad
- Historia pokazuje źródło pliku, wybraną metodę odczytu, wynik kontroli i decyzję człowieka.
- Budowa podobnego systemu
- od 15 000 zł netto · 2–6 tygodni
Granica bramy
Wątpliwy dokument czeka na człowieka
Dokument z uszkodzoną warstwą tekstową zatrzymuje się w kolejce przeglądu z powodem zapisanym przy pliku i o jego dalszej drodze decyduje operator dokumentów. Plik, który nie jest poprawnym PDF-em, w ogóle nie wchodzi do procesu; w przebiegu zapisano jedno takie kontrolowane odrzucenie. Drogę każdego dokumentu można sprawdzić w publicznym audycie, bez dostępu do bazy.
- Granica
- Uszkodzona warstwa tekstowa zatrzymuje dokument w przeglądzie człowieka
- Koszt
- 5,12 zł za OCR w pełnym przebiegu 181 plików oraz około 0,0035 zł za osobny odczyt dokumentu.
- Bezpieczeństwo
- Uszkodzony lub nieczytelny dokument trafia do człowieka zamiast przejść dalej jako poprawny.
Plik, który oszukał bramę
Publikujemy też granicę, którą znaleźliśmy. Archiwalne akty z lat dziewięćdziesiątych potrafią nieść warstwę tekstową w porzuconym kodowaniu: poprawne „określony” ekstrahuje się jako „okreÊlony” i przechodzi jako czytelne. Człowiek widzi zniekształcenie od razu, brama na dziś go nie wykrywa. Druga słabość leży w korpusie: żaden pobrany dokument publiczny nie był czystym skanem, więc trasę bez warstwy tekstowej sprawdza 6 odbitek wykonanych ze stron archiwalnych. W produkcji obserwowalibyśmy błędy OCR i prowadzili ręczną kolejkę dla niepewnych ekstrakcji.
Szacowany efekt
Policz efekt na swoim wolumenie
To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Wynik potwierdzamy dopiero podczas pilotażu.
Dziś
Założenie dziś: 245 h/mies.
Po uruchomieniu
Scenariusz po: 56 h/mies.
Oszczędność czasu lub kosztu
Scenariusz modelowany: 145-230 h/mies., baza 189 h
- Wolumen
- Scenariusz modelowany: 4 200 PDF/mies.
- Formuła
- 4200 x 2,7 min / 60
- Status wyliczenia
- średnia
Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są syntetyczne. Dane klientów pozostają prywatne. Pomiary dotyczą opisanej wersji demonstracyjnej i są wyraźnie oddzielone od wyników produkcyjnych.
Powierzchnie pracy
Operator nie otwiera już każdego pliku: do decyzji dostaje tylko dokumenty, którym brama przestała ufać.
Przy każdym pliku widać sposób odczytu, czas i naliczony koszt. Zespół może sprawdzić, które strony odczytano lokalnie, które wysłano do OCR i które czekają na decyzję. Rachunek wynika z listy stron i stawki za każdą z nich. Czasy oraz pełny koszt obsługi trzeba jeszcze zmierzyć na dokumentach klienta przed ustaleniem SLA.
Brama PDF: strumień, rachunek, ślad.
Strumień dokumentów
Każdy plik z typem, trasą, czasem odczytu i kosztem w jednej tabeli, od natywnych po eskalacje.
Rachunek
Koszt OCR zliczony ze zdarzeń, pozycja po pozycji, obok stron odczytanych lokalnie.
Ślad
Publiczny audyt JSON z trasą i hashami każdego pliku, do sprawdzenia bez zaglądania do bazy.
Ekrany systemu
Zobacz, jak system działa w praktyce
To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.
- Ekrany
- 11
- px
- 1440 · 390
- 021440×1953
Lokalne wyznaczanie trasy PDF i OCR dla każdej strony osobno, z rozwinięciem dowodów dla hybrydy i uszkodzonego pliku. - 031440×1100
Strumień dokumentów w kadrze telefonu.
Otwórz archiwum pozostałych ekranów (8)
- 041440×1100
Skierowane do OCR - 051440×1100
Odrzucone przy wejściu - 061440×1100
Rachunek za odczyt - 071440×1100
Ślad klasyfikacji - 081440×1100
Zasady kierowania - 091440×1100
Wstrzymane do przeglądu - 101440×1100
Skan bez warstwy tekstowej - 111440×1100
Uszkodzona warstwa tekstowa
Stos technologiczny
Trasa PDF wynika z inspekcji każdej strony i jawnych reguł.
Biblioteka inspekcji wybiera strony do odczytu lokalnego lub OCR, bo ta decyzja wynika z właściwości pliku. Osobny krok modelowy może odczytać dokument po routingu i zapisuje pełny ślad dostawcy. Dzięki temu koszt OCR i koszt modelu pozostają rozdzielone i widoczne.
- pdf-inspector 0.7.0
- klasyfikuje PDF strona po stronie i czyta natywny tekst, z przypiętej rewizji
- Tesseract 5
- lokalny OCR po polsku i angielsku, w osobnym kontenerze, tylko dla wskazanych stron
- Python 3.13 + FastAPI
- prowadzi bramę: przyjmuje pliki, egzekwuje trasy i zapisuje zdarzenia
- PostgreSQL 17
- przechowuje dokumenty, trasę każdej strony i hash-chain audytu
- Next.js 16
- ekran operatora: strumień dokumentów, rachunek i publiczny audyt JSON
Klient dostaje kod, konfigurację tras, dane ewaluacyjne i dokumentację; całość działa w jego infrastrukturze. Używamy otwartych komponentów z przypiętymi wersjami, a odczyt i OCR działają wewnątrz stosu, więc żaden etap nie wysyła dokumentów do zewnętrznej usługi.
Szczegóły techniczne i pomiar
Pętla pracy
Tania klasyfikacja przed drogim odczytem. Zawsze w tej kolejności.
Inspekcja rozstrzyga trasę każdej strony przed poniesieniem kosztu. Wątpliwy tekst trafia do ręcznej oceny operatora.
Strumień PDF: natywne, skany, hybrydy
Inspekcja: osobna decyzja dla każdej strony
Zaufany tekst → odczyt lokalny
Skan → OCR wskazanych stron · uszkodzony tekst → przegląd
Trasa, czas i koszt zapisane przy każdym pliku
Architektura systemu
Inspektor, dwie trasy, eskalacja i hash-chain.
Deterministyczna klasyfikacja na wejściu, lokalna ekstrakcja i izolowany OCR jako osobne trasy, audyt domknięty wokół każdego narzędzia.
- 01
Inspekcja
Klasyfikacja strona po stronie.
pdf-inspector z przypiętej rewizji rozpoznaje typ dokumentu i wskazuje strony bez użytecznej warstwy tekstowej. Hybryda dostaje decyzję dla każdej strony osobno, bez wspólnej etykiety na cały plik.
- 02
Trasa lokalna
Tekst natywny czytany bez opłaty za OCR.
Strony z zaufaną warstwą tekstową przechodzą lokalną ekstrakcję, więc ich treść nie jest degradowana przez ponowny odczyt, a taryfa nie nalicza za nie ani grosza.
- 03
Trasa OCR
Tesseract w izolacji, tylko wskazane strony.
OCR działa wewnątrz stosu, w osobnym kontenerze i sieci wewnętrznej, z polskim i angielskim. Jest wywoływany wyłącznie dla stron wskazanych przez inspekcję, a rachunek stosuje jawną taryfę do tych stron, pozycja po pozycji.
- 04
Eskalacja i audyt
Uszkodzony tekst idzie do człowieka.
Zniekształcona warstwa tekstowa eskaluje cały dokument do przeglądu, a przed każdym narzędziem i po nim zapisywany jest ciągły hash-chain. Trasę każdego pliku można zweryfikować w publicznym audycie.
Dlaczego nie ma tu modelu językowego
Użyteczna warstwa tekstowa jest właściwością pliku, którą mierzy deterministyczna inspekcja. Model zwiększyłby w tej decyzji koszt i niepewność, ale nie dostarczyłby dodatkowej informacji. Dlatego ten krok nie korzysta z modelu.
- Decyzję o trasie podejmuje deterministyczna inspekcja
- Koszt OCR jest widoczny osobno dla każdej strony
- Hash-chain domyka audyt wokół każdego narzędzia
- Wątpliwy dokument zawsze trafia do przeglądu człowieka
Chcesz sprawdzić podobny proces w swojej firmie?
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
Terminy zobaczysz w swojej strefie czasowej.
Bez prezentacji sprzedażowej i bez zobowiązań. Jeśli automatyzacja nie ma sensu, też to napiszemy.