Przejdź do treści

System sprawdza każdą stronę PDF i płaci za OCR tylko wtedy, gdy strona jest skanem.

Do jednej skrzynki mogą trafiać zwykłe PDF-y, skany i dokumenty mieszane. System wybiera sposób odczytu osobno dla każdej strony. Przy pliku zapisuje decyzję, powód i koszt.

OCR tylko dla stron, które go potrzebująDostarczoneSprawdźmy koszt OCR na waszych PDF-ach

Co sprawdziliśmy

Publiczny test nie zawiera danych ani poświadczeń klienta. Przetwarza dokumenty publiczne i przygotowane pliki testowe. Wyniki na dokumentach klienta trzeba sprawdzić osobno.

Zapisany test
Co sprawdziliśmy
181 PDF · 496 stron · 11 kontroli strukturalnych
OCR tylko dla stron, które go potrzebują
Zweryfikowano
korpus mieszany

Problem, rozwiązanie i wynik

  1. OCR naliczał koszt także za strony z poprawnym tekstem

    Do jednego procesu trafiają PDF-y tekstowe, skany i dokumenty mieszane. Gdy każdy plik idzie do OCR, firma płaci również za strony, które komputer mógł odczytać bez niego. OCR może też pogorszyć tekst zapisany poprawnie w oryginale.

  2. Jak to działa

    System sprawdza każdą stronę przed odczytem. Poprawny tekst odczytuje lokalnie. Do OCR wysyła tylko strony rozpoznane jako skany. Jeśli warstwa tekstowa jest uszkodzona, zatrzymuje dokument i pokazuje pracownikowi powód.

  3. 432 z 496 stron obyły się bez OCR

    Publiczny przebieg nie zawiera danych ani poświadczeń klienta. Przetwarza dokumenty publiczne i przygotowane pliki testowe. Wyniki na dokumentach klienta trzeba zmierzyć osobno.

Dla kogo

Ten system ma sens, jeśli do jednego procesu trafiają PDF-y tekstowe, skany i dokumenty mieszane, a dziś wszystkie strony są wysyłane do płatnego OCR.

Plik → kontrola → metoda odczytu → koszt

  1. 01Każda strona dostaje własną decyzję przed naliczeniem kosztu
  2. 02Strona z zaufanym tekstem przechodzi lokalnie, taryfa liczy wyłącznie strony OCR
  3. 03Uszkodzony tekst zatrzymuje dokument w kolejce przeglądu u operatora
Typ firmy
Firmy przetwarzające duże wolumeny skanowanych i mieszanych PDF-ów
Wejście
Jeden strumień plików PDF: dokumenty tekstowe, skany i pliki mieszane; w próbie 181 plików i 496 stron
Warunek zatrzymania
Uszkodzona warstwa tekstowa zatrzymuje dokument w przeglądzie człowieka
Koszt
5,12 zł za OCR w pełnym przebiegu 181 plików oraz około 0,0035 zł za osobny odczyt dokumentu.
Bezpieczeństwo
Uszkodzony lub nieczytelny dokument trafia do człowieka zamiast przejść dalej jako poprawny.
Historia pliku
Historia pokazuje źródło pliku, wybraną metodę odczytu, wynik kontroli i decyzję człowieka.
Budowa podobnego systemu
od 15 000 zł netto · 2–6 tygodni

Warunek bramy

Wątpliwy dokument czeka na człowieka

Dokument z uszkodzoną warstwą tekstową trafia do kolejki z powodem zapisanym przy pliku. O dalszym odczycie decyduje operator. Niepoprawny plik PDF nie wchodzi do procesu. W przebiegu zapisano jedno takie kontrolowane odrzucenie. Sposób obsługi każdego dokumentu można sprawdzić w publicznym zapisie bez dostępu do bazy.

Koszt
5,12 zł za OCR w pełnym przebiegu 181 plików oraz około 0,0035 zł za osobny odczyt dokumentu.
Bezpieczeństwo
Uszkodzony lub nieczytelny dokument trafia do człowieka zamiast przejść dalej jako poprawny.

Kodowanie, którego obecna kontrola nie wykrywa

Publikujemy też znalezione ograniczenie. Archiwalne akty z lat dziewięćdziesiątych mogą zawierać warstwę tekstową w nieobsługiwanym kodowaniu: poprawne „określony” odczytuje się jako „okreÊlony” i zostaje uznane za czytelne. Człowiek widzi zniekształcenie od razu, lecz obecna kontrola go nie wykrywa. Drugi problem dotyczy zestawu testowego: żaden pobrany dokument publiczny nie był czystym skanem, dlatego odczyt bez warstwy tekstowej sprawdzamy na 6 odbitkach wykonanych ze stron archiwalnych. W produkcji monitorowalibyśmy błędy OCR i kierowali niepewne odczyty do ręcznej kolejki.

Szacowany efekt

Policz efekt na swoim wolumenie

To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Podczas pilotażu sprawdzamy go na danych procesu.

  1. Dziś

    Założenie dziś: 245 h/mies.

  2. Po uruchomieniu

    Scenariusz po: 56 h/mies.

  3. Oszczędność czasu lub kosztu

    Scenariusz modelowany: 145-230 h/mies., baza 189 h

Wolumen
Scenariusz modelowany: 4 200 PDF/mies.
Formuła
4200 x 2,7 min / 60
Status wyliczenia
średnia

Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są testowe. Dane klientów pozostają prywatne. Wyniki dotyczą opisanego testu; wpływ produkcyjny sprawdzamy na danych klienta.

Ekrany

Operator dostaje do decyzji tylko dokumenty, których metoda odczytu jest niepewna.

Przy każdym pliku widać sposób odczytu, czas i naliczony koszt. Zespół może sprawdzić, które strony odczytano lokalnie, które wysłano do OCR i które czekają na decyzję. Rachunek wynika z listy stron i stawki za każdą z nich. Czasy oraz pełny koszt obsługi trzeba jeszcze zmierzyć na dokumentach klienta przed ustaleniem SLA.

Ekran pokazuje przebieg dokumentu, koszt OCR i zapis decyzji systemu.

Strumień dokumentów

Każdy plik z typem, trasą, czasem odczytu i kosztem w jednej tabeli, od natywnych po eskalacje.

Rachunek

Koszt OCR zliczony ze zdarzeń, pozycja po pozycji, obok stron odczytanych lokalnie.

Historia pliku

Publiczny audyt JSON z trasą i hashami każdego pliku, do sprawdzenia bez zaglądania do bazy.

Ekrany systemu

Zobacz, jak system działa w praktyce

To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.

Ekrany
11
px
1440 · 390
011440×1100
Kontrola wejścia PDF: dwie metody odczytu, 432 z 496 stron poza OCR i lista 181 dokumentów z kosztem według taryfy.
390390×844
  1. 021440×1953
    Lokalne wyznaczanie trasy PDF i OCR dla każdej strony osobno, z rozwinięciem dowodów dla hybrydy i uszkodzonego pliku.
  2. 031440×1100
    Strumień dokumentów w kadrze telefonu.
Otwórz archiwum pozostałych ekranów (8)
  1. 041440×1100
    Skierowane do OCR
  2. 051440×1100
    Odrzucone przy wejściu
  3. 061440×1100
    Rachunek za odczyt
  4. 071440×1100
    Historia klasyfikacji
  5. 081440×1100
    Zasady kierowania
  6. 091440×1100
    Wstrzymane do przeglądu
  7. 101440×1100
    Skan bez warstwy tekstowej
  8. 111440×1100
    Uszkodzona warstwa tekstowa

Stos technologiczny

Metoda odczytu wynika z kontroli każdej strony i jawnych reguł

Biblioteka inspekcji wybiera strony do odczytu lokalnego lub OCR, bo ta decyzja wynika z właściwości pliku. Osobny krok modelowy może odczytać dokument po wybraniu trasy i zapisuje użytego dostawcę oraz koszt. Dzięki temu koszt OCR i koszt modelu pozostają rozdzielone i widoczne.

pdf-inspector 0.7.0
klasyfikuje PDF strona po stronie i czyta natywny tekst, z przypiętej rewizji
Tesseract 5
lokalny OCR po polsku i angielsku, w osobnym kontenerze, tylko dla wskazanych stron
Python 3.13 + FastAPI
przyjmuje pliki, wybiera metodę odczytu i zapisuje zdarzenia
PostgreSQL 17
przechowuje dokumenty, metodę odczytu każdej strony i łańcuch skrótów
Next.js 16
ekran operatora: strumień dokumentów, rachunek i publiczny audyt JSON

Klient dostaje kod, konfigurację tras, dane ewaluacyjne i dokumentację; całość działa w jego infrastrukturze. Używamy otwartych komponentów z przypiętymi wersjami, a odczyt i OCR działają wewnątrz stosu, więc żaden etap nie wysyła dokumentów do zewnętrznej usługi.

Szczegóły techniczne i wyniki testów

Pętla pracy

Kontrola strony odbywa się przed płatnym OCR

System wybiera metodę odczytu każdej strony przed naliczeniem kosztu. Wątpliwy tekst trafia do ręcznej oceny operatora.

01

Strumień PDF: dokumenty tekstowe, skany i pliki mieszane

02

Kontrola: osobna decyzja dla każdej strony

03

Zaufany tekst → odczyt lokalny

Skan → OCR wskazanych stron · uszkodzony tekst → przegląd

04

Metoda odczytu, czas i koszt zapisane przy każdym pliku

Architektura systemu

Kontrola wybiera odczyt lokalny albo OCR, a wyjątki trafiają do człowieka

Kod klasyfikuje wejście, odczytuje tekst lokalnie albo wysyła stronę do izolowanego OCR. Historia obejmuje użycie każdego narzędzia.

  1. 01

    Inspekcja

    Każda strona jest sprawdzana osobno

    pdf-inspector z przypiętej rewizji rozpoznaje typ dokumentu i wskazuje strony bez użytecznej warstwy tekstowej. Hybryda dostaje decyzję dla każdej strony osobno, bez wspólnej etykiety na cały plik.

  2. 02

    Trasa lokalna

    Poprawny tekst jest czytany bez opłaty za OCR

    Strony z poprawną warstwą tekstową są odczytywane lokalnie, więc ponowny odczyt nie zniekształca ich treści, a taryfa OCR nie nalicza za nie ani grosza.

  3. 03

    Trasa OCR

    Tesseract odczytuje tylko wskazane strony

    OCR działa wewnątrz stosu, w osobnym kontenerze i sieci wewnętrznej, z polskim i angielskim. Jest wywoływany wyłącznie dla stron wskazanych przez inspekcję, a rachunek stosuje jawną taryfę do tych stron, pozycja po pozycji.

  4. 04

    Eskalacja i audyt

    Uszkodzony tekst trafia do człowieka

    Zniekształcona warstwa tekstowa kieruje cały dokument do sprawdzenia przez człowieka. Przed i po użyciu narzędzia system dopisuje wpis do łańcucha skrótów, dzięki czemu historię pliku można sprawdzić w publicznym zapisie testu.

Dlaczego nie ma tu modelu językowego

Jakość warstwy tekstowej jest właściwością pliku i można ją zmierzyć stałymi regułami. Model zwiększyłby koszt oraz niepewność bez dostarczenia dodatkowej informacji. Dlatego ten krok nie korzysta z modelu.

  • Decyzję o sposobie odczytu podejmują stałe reguły kontroli
  • Koszt OCR jest widoczny osobno dla każdej strony
  • Łańcuch skrótów obejmuje użycie każdego narzędzia
  • Wątpliwy dokument zawsze trafia do przeglądu człowieka

Chcesz sprawdzić podobny proces w swojej firmie?

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
0 zł30 minut · pisemne podsumowanie w 2 dni robocze
Umów bezpłatny skan procesów (30 min)

Terminy zobaczysz w swojej strefie czasowej.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.