System sprawdza każdą stronę PDF i płaci za OCR tylko wtedy, gdy strona jest skanem.
Do jednej skrzynki mogą trafiać zwykłe PDF-y, skany i dokumenty mieszane. System wybiera sposób odczytu osobno dla każdej strony. Przy pliku zapisuje decyzję, powód i koszt.
Co sprawdziliśmy
Publiczny test nie zawiera danych ani poświadczeń klienta. Przetwarza dokumenty publiczne i przygotowane pliki testowe. Wyniki na dokumentach klienta trzeba sprawdzić osobno.
- Zapisany test
- Co sprawdziliśmy
- 181 PDF · 496 stron · 11 kontroli strukturalnych
- OCR tylko dla stron, które go potrzebują
- Zweryfikowano
- korpus mieszany
Problem, rozwiązanie i wynik
OCR naliczał koszt także za strony z poprawnym tekstem
Do jednego procesu trafiają PDF-y tekstowe, skany i dokumenty mieszane. Gdy każdy plik idzie do OCR, firma płaci również za strony, które komputer mógł odczytać bez niego. OCR może też pogorszyć tekst zapisany poprawnie w oryginale.
Jak to działa
System sprawdza każdą stronę przed odczytem. Poprawny tekst odczytuje lokalnie. Do OCR wysyła tylko strony rozpoznane jako skany. Jeśli warstwa tekstowa jest uszkodzona, zatrzymuje dokument i pokazuje pracownikowi powód.
432 z 496 stron obyły się bez OCR
Publiczny przebieg nie zawiera danych ani poświadczeń klienta. Przetwarza dokumenty publiczne i przygotowane pliki testowe. Wyniki na dokumentach klienta trzeba zmierzyć osobno.
Dla kogo
Ten system ma sens, jeśli do jednego procesu trafiają PDF-y tekstowe, skany i dokumenty mieszane, a dziś wszystkie strony są wysyłane do płatnego OCR.
Plik → kontrola → metoda odczytu → koszt
- 01Każda strona dostaje własną decyzję przed naliczeniem kosztu
- 02Strona z zaufanym tekstem przechodzi lokalnie, taryfa liczy wyłącznie strony OCR
- 03Uszkodzony tekst zatrzymuje dokument w kolejce przeglądu u operatora
- Typ firmy
- Firmy przetwarzające duże wolumeny skanowanych i mieszanych PDF-ów
- Wejście
- Jeden strumień plików PDF: dokumenty tekstowe, skany i pliki mieszane; w próbie 181 plików i 496 stron
- Warunek zatrzymania
- Uszkodzona warstwa tekstowa zatrzymuje dokument w przeglądzie człowieka
- Koszt
- 5,12 zł za OCR w pełnym przebiegu 181 plików oraz około 0,0035 zł za osobny odczyt dokumentu.
- Bezpieczeństwo
- Uszkodzony lub nieczytelny dokument trafia do człowieka zamiast przejść dalej jako poprawny.
- Historia pliku
- Historia pokazuje źródło pliku, wybraną metodę odczytu, wynik kontroli i decyzję człowieka.
- Budowa podobnego systemu
- od 15 000 zł netto · 2–6 tygodni
Warunek bramy
Wątpliwy dokument czeka na człowieka
Dokument z uszkodzoną warstwą tekstową trafia do kolejki z powodem zapisanym przy pliku. O dalszym odczycie decyduje operator. Niepoprawny plik PDF nie wchodzi do procesu. W przebiegu zapisano jedno takie kontrolowane odrzucenie. Sposób obsługi każdego dokumentu można sprawdzić w publicznym zapisie bez dostępu do bazy.
- Koszt
- 5,12 zł za OCR w pełnym przebiegu 181 plików oraz około 0,0035 zł za osobny odczyt dokumentu.
- Bezpieczeństwo
- Uszkodzony lub nieczytelny dokument trafia do człowieka zamiast przejść dalej jako poprawny.
Kodowanie, którego obecna kontrola nie wykrywa
Publikujemy też znalezione ograniczenie. Archiwalne akty z lat dziewięćdziesiątych mogą zawierać warstwę tekstową w nieobsługiwanym kodowaniu: poprawne „określony” odczytuje się jako „okreÊlony” i zostaje uznane za czytelne. Człowiek widzi zniekształcenie od razu, lecz obecna kontrola go nie wykrywa. Drugi problem dotyczy zestawu testowego: żaden pobrany dokument publiczny nie był czystym skanem, dlatego odczyt bez warstwy tekstowej sprawdzamy na 6 odbitkach wykonanych ze stron archiwalnych. W produkcji monitorowalibyśmy błędy OCR i kierowali niepewne odczyty do ręcznej kolejki.
Szacowany efekt
Policz efekt na swoim wolumenie
To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Podczas pilotażu sprawdzamy go na danych procesu.
Dziś
Założenie dziś: 245 h/mies.
Po uruchomieniu
Scenariusz po: 56 h/mies.
Oszczędność czasu lub kosztu
Scenariusz modelowany: 145-230 h/mies., baza 189 h
- Wolumen
- Scenariusz modelowany: 4 200 PDF/mies.
- Formuła
- 4200 x 2,7 min / 60
- Status wyliczenia
- średnia
Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są testowe. Dane klientów pozostają prywatne. Wyniki dotyczą opisanego testu; wpływ produkcyjny sprawdzamy na danych klienta.
Ekrany
Operator dostaje do decyzji tylko dokumenty, których metoda odczytu jest niepewna.
Przy każdym pliku widać sposób odczytu, czas i naliczony koszt. Zespół może sprawdzić, które strony odczytano lokalnie, które wysłano do OCR i które czekają na decyzję. Rachunek wynika z listy stron i stawki za każdą z nich. Czasy oraz pełny koszt obsługi trzeba jeszcze zmierzyć na dokumentach klienta przed ustaleniem SLA.
Ekran pokazuje przebieg dokumentu, koszt OCR i zapis decyzji systemu.
Strumień dokumentów
Każdy plik z typem, trasą, czasem odczytu i kosztem w jednej tabeli, od natywnych po eskalacje.
Rachunek
Koszt OCR zliczony ze zdarzeń, pozycja po pozycji, obok stron odczytanych lokalnie.
Historia pliku
Publiczny audyt JSON z trasą i hashami każdego pliku, do sprawdzenia bez zaglądania do bazy.
Ekrany systemu
Zobacz, jak system działa w praktyce
To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.
- Ekrany
- 11
- px
- 1440 · 390
- 021440×1953
Lokalne wyznaczanie trasy PDF i OCR dla każdej strony osobno, z rozwinięciem dowodów dla hybrydy i uszkodzonego pliku. - 031440×1100
Strumień dokumentów w kadrze telefonu.
Otwórz archiwum pozostałych ekranów (8)
- 041440×1100
Skierowane do OCR - 051440×1100
Odrzucone przy wejściu - 061440×1100
Rachunek za odczyt - 071440×1100
Historia klasyfikacji - 081440×1100
Zasady kierowania - 091440×1100
Wstrzymane do przeglądu - 101440×1100
Skan bez warstwy tekstowej - 111440×1100
Uszkodzona warstwa tekstowa
Stos technologiczny
Metoda odczytu wynika z kontroli każdej strony i jawnych reguł
Biblioteka inspekcji wybiera strony do odczytu lokalnego lub OCR, bo ta decyzja wynika z właściwości pliku. Osobny krok modelowy może odczytać dokument po wybraniu trasy i zapisuje użytego dostawcę oraz koszt. Dzięki temu koszt OCR i koszt modelu pozostają rozdzielone i widoczne.
- pdf-inspector 0.7.0
- klasyfikuje PDF strona po stronie i czyta natywny tekst, z przypiętej rewizji
- Tesseract 5
- lokalny OCR po polsku i angielsku, w osobnym kontenerze, tylko dla wskazanych stron
- Python 3.13 + FastAPI
- przyjmuje pliki, wybiera metodę odczytu i zapisuje zdarzenia
- PostgreSQL 17
- przechowuje dokumenty, metodę odczytu każdej strony i łańcuch skrótów
- Next.js 16
- ekran operatora: strumień dokumentów, rachunek i publiczny audyt JSON
Klient dostaje kod, konfigurację tras, dane ewaluacyjne i dokumentację; całość działa w jego infrastrukturze. Używamy otwartych komponentów z przypiętymi wersjami, a odczyt i OCR działają wewnątrz stosu, więc żaden etap nie wysyła dokumentów do zewnętrznej usługi.
Szczegóły techniczne i wyniki testów
Pętla pracy
Kontrola strony odbywa się przed płatnym OCR
System wybiera metodę odczytu każdej strony przed naliczeniem kosztu. Wątpliwy tekst trafia do ręcznej oceny operatora.
Strumień PDF: dokumenty tekstowe, skany i pliki mieszane
Kontrola: osobna decyzja dla każdej strony
Zaufany tekst → odczyt lokalny
Skan → OCR wskazanych stron · uszkodzony tekst → przegląd
Metoda odczytu, czas i koszt zapisane przy każdym pliku
Architektura systemu
Kontrola wybiera odczyt lokalny albo OCR, a wyjątki trafiają do człowieka
Kod klasyfikuje wejście, odczytuje tekst lokalnie albo wysyła stronę do izolowanego OCR. Historia obejmuje użycie każdego narzędzia.
- 01
Inspekcja
Każda strona jest sprawdzana osobno
pdf-inspector z przypiętej rewizji rozpoznaje typ dokumentu i wskazuje strony bez użytecznej warstwy tekstowej. Hybryda dostaje decyzję dla każdej strony osobno, bez wspólnej etykiety na cały plik.
- 02
Trasa lokalna
Poprawny tekst jest czytany bez opłaty za OCR
Strony z poprawną warstwą tekstową są odczytywane lokalnie, więc ponowny odczyt nie zniekształca ich treści, a taryfa OCR nie nalicza za nie ani grosza.
- 03
Trasa OCR
Tesseract odczytuje tylko wskazane strony
OCR działa wewnątrz stosu, w osobnym kontenerze i sieci wewnętrznej, z polskim i angielskim. Jest wywoływany wyłącznie dla stron wskazanych przez inspekcję, a rachunek stosuje jawną taryfę do tych stron, pozycja po pozycji.
- 04
Eskalacja i audyt
Uszkodzony tekst trafia do człowieka
Zniekształcona warstwa tekstowa kieruje cały dokument do sprawdzenia przez człowieka. Przed i po użyciu narzędzia system dopisuje wpis do łańcucha skrótów, dzięki czemu historię pliku można sprawdzić w publicznym zapisie testu.
Dlaczego nie ma tu modelu językowego
Jakość warstwy tekstowej jest właściwością pliku i można ją zmierzyć stałymi regułami. Model zwiększyłby koszt oraz niepewność bez dostarczenia dodatkowej informacji. Dlatego ten krok nie korzysta z modelu.
- Decyzję o sposobie odczytu podejmują stałe reguły kontroli
- Koszt OCR jest widoczny osobno dla każdej strony
- Łańcuch skrótów obejmuje użycie każdego narzędzia
- Wątpliwy dokument zawsze trafia do przeglądu człowieka
Chcesz sprawdzić podobny proces w swojej firmie?
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
Terminy zobaczysz w swojej strefie czasowej.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.