Przejdź do treści

System sprawdza każdą stronę PDF i płaci za OCR tylko wtedy, gdy strona jest skanem.

Do jednej skrzynki mogą trafiać zwykłe PDF-y, skany i dokumenty mieszane. Brama wybiera sposób odczytu osobno dla każdej strony. Przy pliku zapisuje decyzję, powód i koszt.

OCR tylko dla stron, które go potrzebująSystem demonstracyjnySprawdźmy koszt OCR na waszych PDF-ach

Co zmierzyliśmy

Demonstracja nie zawiera danych ani poświadczeń klienta. Przetwarza dokumenty publiczne i przygotowane pliki testowe. Wyniki na dokumentach klienta trzeba zmierzyć osobno.

Zapisany pomiar
Co zmierzyliśmy
181 PDF · 496 stron · 11 kontroli strukturalnych
OCR tylko dla stron, które go potrzebują
Zweryfikowano
korpus mieszany

Problem, rozwiązanie i wynik

  1. Problem

    Do jednego procesu trafiają PDF-y tekstowe, skany i dokumenty mieszane. Gdy każdy plik idzie do OCR, firma płaci również za strony, które komputer mógł odczytać bez niego. OCR może też pogorszyć tekst zapisany poprawnie w oryginale.

  2. Jak to działa

    System sprawdza każdą stronę przed odczytem. Poprawny tekst odczytuje lokalnie. Do OCR wysyła tylko strony rozpoznane jako skany. Jeśli warstwa tekstowa jest uszkodzona, zatrzymuje dokument i pokazuje pracownikowi powód.

  3. 432 z 496 stron obyły się bez OCR

    Demonstracja nie zawiera danych ani poświadczeń klienta. Przetwarza dokumenty publiczne i przygotowane pliki testowe. Wyniki na dokumentach klienta trzeba zmierzyć osobno.

Dla kogo

Ten system ma sens, jeśli do jednego procesu trafiają PDF-y tekstowe, skany i dokumenty mieszane, a dziś wszystkie strony są wysyłane do płatnego OCR.

Plik → inspekcja → trasa → rachunek

  1. 01Każda strona dostaje własną decyzję, zanim popłynie jakikolwiek koszt
  2. 02Strona z zaufanym tekstem przechodzi lokalnie, taryfa liczy wyłącznie strony OCR
  3. 03Uszkodzony tekst zatrzymuje dokument w kolejce przeglądu u operatora
Typ firmy
Firmy przetwarzające duże wolumeny skanowanych i mieszanych PDF-ów
Wejście
Jeden strumień PDF: natywne, skany i hybrydy; w próbie 181 plików i 496 stron
Granica
Uszkodzona warstwa tekstowa zatrzymuje dokument w przeglądzie człowieka
Koszt
5,12 zł za OCR w pełnym przebiegu 181 plików oraz około 0,0035 zł za osobny odczyt dokumentu.
Bezpieczeństwo
Uszkodzony lub nieczytelny dokument trafia do człowieka zamiast przejść dalej jako poprawny.
Ślad
Historia pokazuje źródło pliku, wybraną metodę odczytu, wynik kontroli i decyzję człowieka.
Budowa podobnego systemu
od 15 000 zł netto · 2–6 tygodni

Granica bramy

Wątpliwy dokument czeka na człowieka

Dokument z uszkodzoną warstwą tekstową zatrzymuje się w kolejce przeglądu z powodem zapisanym przy pliku i o jego dalszej drodze decyduje operator dokumentów. Plik, który nie jest poprawnym PDF-em, w ogóle nie wchodzi do procesu; w przebiegu zapisano jedno takie kontrolowane odrzucenie. Drogę każdego dokumentu można sprawdzić w publicznym audycie, bez dostępu do bazy.

Granica
Uszkodzona warstwa tekstowa zatrzymuje dokument w przeglądzie człowieka
Koszt
5,12 zł za OCR w pełnym przebiegu 181 plików oraz około 0,0035 zł za osobny odczyt dokumentu.
Bezpieczeństwo
Uszkodzony lub nieczytelny dokument trafia do człowieka zamiast przejść dalej jako poprawny.

Plik, który oszukał bramę

Publikujemy też granicę, którą znaleźliśmy. Archiwalne akty z lat dziewięćdziesiątych potrafią nieść warstwę tekstową w porzuconym kodowaniu: poprawne „określony” ekstrahuje się jako „okreÊlony” i przechodzi jako czytelne. Człowiek widzi zniekształcenie od razu, brama na dziś go nie wykrywa. Druga słabość leży w korpusie: żaden pobrany dokument publiczny nie był czystym skanem, więc trasę bez warstwy tekstowej sprawdza 6 odbitek wykonanych ze stron archiwalnych. W produkcji obserwowalibyśmy błędy OCR i prowadzili ręczną kolejkę dla niepewnych ekstrakcji.

Szacowany efekt

Policz efekt na swoim wolumenie

To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Wynik potwierdzamy dopiero podczas pilotażu.

  1. Dziś

    Założenie dziś: 245 h/mies.

  2. Po uruchomieniu

    Scenariusz po: 56 h/mies.

  3. Oszczędność czasu lub kosztu

    Scenariusz modelowany: 145-230 h/mies., baza 189 h

Wolumen
Scenariusz modelowany: 4 200 PDF/mies.
Formuła
4200 x 2,7 min / 60
Status wyliczenia
średnia

Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są syntetyczne. Dane klientów pozostają prywatne. Pomiary dotyczą opisanej wersji demonstracyjnej i są wyraźnie oddzielone od wyników produkcyjnych.

Powierzchnie pracy

Operator nie otwiera już każdego pliku: do decyzji dostaje tylko dokumenty, którym brama przestała ufać.

Przy każdym pliku widać sposób odczytu, czas i naliczony koszt. Zespół może sprawdzić, które strony odczytano lokalnie, które wysłano do OCR i które czekają na decyzję. Rachunek wynika z listy stron i stawki za każdą z nich. Czasy oraz pełny koszt obsługi trzeba jeszcze zmierzyć na dokumentach klienta przed ustaleniem SLA.

Brama PDF: strumień, rachunek, ślad.

Strumień dokumentów

Każdy plik z typem, trasą, czasem odczytu i kosztem w jednej tabeli, od natywnych po eskalacje.

Rachunek

Koszt OCR zliczony ze zdarzeń, pozycja po pozycji, obok stron odczytanych lokalnie.

Ślad

Publiczny audyt JSON z trasą i hashami każdego pliku, do sprawdzenia bez zaglądania do bazy.

Ekrany systemu

Zobacz, jak system działa w praktyce

To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.

Ekrany
11
px
1440 · 390
011440×1100
Brama wejścia PDF: schemat dwóch tras, 432 z 496 stron poza OCR i strumień 181 dokumentów z trasami oraz kosztem według taryfy.
390390×844
  1. 021440×1953
    Lokalne wyznaczanie trasy PDF i OCR dla każdej strony osobno, z rozwinięciem dowodów dla hybrydy i uszkodzonego pliku.
  2. 031440×1100
    Strumień dokumentów w kadrze telefonu.
Otwórz archiwum pozostałych ekranów (8)
  1. 041440×1100
    Skierowane do OCR
  2. 051440×1100
    Odrzucone przy wejściu
  3. 061440×1100
    Rachunek za odczyt
  4. 071440×1100
    Ślad klasyfikacji
  5. 081440×1100
    Zasady kierowania
  6. 091440×1100
    Wstrzymane do przeglądu
  7. 101440×1100
    Skan bez warstwy tekstowej
  8. 111440×1100
    Uszkodzona warstwa tekstowa

Stos technologiczny

Trasa PDF wynika z inspekcji każdej strony i jawnych reguł.

Biblioteka inspekcji wybiera strony do odczytu lokalnego lub OCR, bo ta decyzja wynika z właściwości pliku. Osobny krok modelowy może odczytać dokument po routingu i zapisuje pełny ślad dostawcy. Dzięki temu koszt OCR i koszt modelu pozostają rozdzielone i widoczne.

pdf-inspector 0.7.0
klasyfikuje PDF strona po stronie i czyta natywny tekst, z przypiętej rewizji
Tesseract 5
lokalny OCR po polsku i angielsku, w osobnym kontenerze, tylko dla wskazanych stron
Python 3.13 + FastAPI
prowadzi bramę: przyjmuje pliki, egzekwuje trasy i zapisuje zdarzenia
PostgreSQL 17
przechowuje dokumenty, trasę każdej strony i hash-chain audytu
Next.js 16
ekran operatora: strumień dokumentów, rachunek i publiczny audyt JSON

Klient dostaje kod, konfigurację tras, dane ewaluacyjne i dokumentację; całość działa w jego infrastrukturze. Używamy otwartych komponentów z przypiętymi wersjami, a odczyt i OCR działają wewnątrz stosu, więc żaden etap nie wysyła dokumentów do zewnętrznej usługi.

Szczegóły techniczne i pomiar

Pętla pracy

Tania klasyfikacja przed drogim odczytem. Zawsze w tej kolejności.

Inspekcja rozstrzyga trasę każdej strony przed poniesieniem kosztu. Wątpliwy tekst trafia do ręcznej oceny operatora.

01

Strumień PDF: natywne, skany, hybrydy

02

Inspekcja: osobna decyzja dla każdej strony

03

Zaufany tekst → odczyt lokalny

Skan → OCR wskazanych stron · uszkodzony tekst → przegląd

04

Trasa, czas i koszt zapisane przy każdym pliku

Architektura systemu

Inspektor, dwie trasy, eskalacja i hash-chain.

Deterministyczna klasyfikacja na wejściu, lokalna ekstrakcja i izolowany OCR jako osobne trasy, audyt domknięty wokół każdego narzędzia.

  1. 01

    Inspekcja

    Klasyfikacja strona po stronie.

    pdf-inspector z przypiętej rewizji rozpoznaje typ dokumentu i wskazuje strony bez użytecznej warstwy tekstowej. Hybryda dostaje decyzję dla każdej strony osobno, bez wspólnej etykiety na cały plik.

  2. 02

    Trasa lokalna

    Tekst natywny czytany bez opłaty za OCR.

    Strony z zaufaną warstwą tekstową przechodzą lokalną ekstrakcję, więc ich treść nie jest degradowana przez ponowny odczyt, a taryfa nie nalicza za nie ani grosza.

  3. 03

    Trasa OCR

    Tesseract w izolacji, tylko wskazane strony.

    OCR działa wewnątrz stosu, w osobnym kontenerze i sieci wewnętrznej, z polskim i angielskim. Jest wywoływany wyłącznie dla stron wskazanych przez inspekcję, a rachunek stosuje jawną taryfę do tych stron, pozycja po pozycji.

  4. 04

    Eskalacja i audyt

    Uszkodzony tekst idzie do człowieka.

    Zniekształcona warstwa tekstowa eskaluje cały dokument do przeglądu, a przed każdym narzędziem i po nim zapisywany jest ciągły hash-chain. Trasę każdego pliku można zweryfikować w publicznym audycie.

Dlaczego nie ma tu modelu językowego

Użyteczna warstwa tekstowa jest właściwością pliku, którą mierzy deterministyczna inspekcja. Model zwiększyłby w tej decyzji koszt i niepewność, ale nie dostarczyłby dodatkowej informacji. Dlatego ten krok nie korzysta z modelu.

  • Decyzję o trasie podejmuje deterministyczna inspekcja
  • Koszt OCR jest widoczny osobno dla każdej strony
  • Hash-chain domyka audyt wokół każdego narzędzia
  • Wątpliwy dokument zawsze trafia do przeglądu człowieka

Chcesz sprawdzić podobny proces w swojej firmie?

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
0 zł30 minut · pisemne podsumowanie w 2 dni robocze
Umów bezpłatny skan procesów (30 min)

Terminy zobaczysz w swojej strefie czasowej.

Bez prezentacji sprzedażowej i bez zobowiązań. Jeśli automatyzacja nie ma sensu, też to napiszemy.