Dwa adresy w formularzu ubezpieczeniowym: czy AI je rozróżni?
Pracownik przenosi dane z formularza ubezpieczeniowego do systemu. Narzędzie odczytało adres bez literówki, ale wpisało siedzibę firmy także jako lokalizację magazynu. Poprawienie takiego wyniku wymaga powrotu do dokumentu. Przydatna pomoc pokazuje każdy adres przy właściwej części formularza, tak aby pracownik mógł sprawdzić dane przed ich zapisaniem.
Syntalith
Adres musi pozostać przy właściwej części formularza
Załóżmy, że formularz dotyczący ubezpieczenia mienia firmy zawiera dwa różne adresy. Pierwszy znajduje się w części z danymi firmy i opisuje jej siedzibę. Drugi wpisano w osobno oznaczonej części dotyczącej magazynu zgłaszanego do ubezpieczenia. Po odczycie pracownik widzi w systemie adres siedziby w obu miejscach.
Poprawny zapis pobiera lokalizację magazynu z części dotyczącej magazynu. Przy każdej wartości pokazuje fragment formularza, z którego ją odczytano. Osoba rejestrująca dane może wtedy sprawdzić właściwy adres i poprawić przypisanie bez przeszukiwania wszystkich stron. Odczytanie znaków to dopiero część zadania; trzeba jeszcze rozpoznać, czego dotyczy dany zapis.
Jeżeli część dotycząca magazynu pozostaje pusta, adres siedziby nie uzupełnia tej luki. Pracownik powinien widzieć, że lokalizacja wymaga wyjaśnienia. Przygotowywanie danych z formularza nie rozstrzyga przyjęcia do ubezpieczenia ani zakresu ochrony.
Przy kolejnych lokalizacjach ważne są powiązania
Inny formularz może opisywać dwa magazyny w oddzielnych częściach. Pracownik potrzebuje wtedy dwóch grup danych, z adresem i opisem przypisanym do odpowiedniej lokalizacji. Pojedyncza lista odczytanych adresów i osobna lista opisów pozostawia mu pracę nad ponownym połączeniem informacji.
Pracownik powinien móc przeglądać i poprawiać każdą lokalizację oddzielnie, także gdy ta sama sekcja powtarza się na kolejnych stronach.
Taką potrzebę warto sprawdzić w systemie, do którego dane mają trafić. Jeśli formularz zawiera kilka lokalizacji, a przygotowany import przewiduje tylko jedną, poprawa samego modelu nie usunie problemu. Projekt obejmuje także sposób zapisania odczytanych grup w docelowym narzędziu.
Co sprawdzić przed douczaniem modelu
Przy stałym układzie formularza wystarczyć może istniejący szablon odczytu. Jeśli firma zbiera odpowiedzi przez formularz internetowy, osobne pola na siedzibę i lokalizacje mogą ograniczyć potrzebę ponownego wydobywania danych. Warto zacząć od tego, co jest już dostępne w obecnym systemie rejestracji.
Przy skanach trzeba rozróżnić niepoprawnie odczytany tekst od poprawnego tekstu przypisanego do złego pola. OCR zamienia obraz strony na tekst. Jeśli gubi nagłówek sekcji, dalsze rozpoznanie adresu może opierać się na niepełnym materiale. W takim przypadku najpierw należy sprawdzić odczyt dokumentu, zamiast zakładać, że zawodzi rozumienie roli adresu.
Dostępne narzędzia ekstrakcji danych warto porównać na formularzach, które zespół zwykle poprawia. Google opisuje Custom Extractor wykorzystujący model bazowy oraz możliwości dostosowania, w tym fine-tuningu, zależne od wersji procesora. Porównaj wynik z poprawkami wykonywanymi przez zespół, zanim zdecydujesz się na dostosowanie modelu.
Kiedy adaptacja może pomóc
Fine-tuning oznacza dalsze uczenie istniejącego modelu na przykładach z poprawnie wskazanymi informacjami. W tym zastosowaniu warto go rozważyć, gdy czytelne formularze regularnie prowadzą do pomyłek między siedzibą a lokalizacją lub do mieszania danych kilku obiektów. Chodzi o powtarzalne trudności w przypisaniu znaczenia polom mimo różnych układów dokumentu.
Zespół rejestrujący formularze wnosi wiedzę o tym, co powinno znaleźć się w każdym polu. Pokazuje poprawki, które dziś wykonuje, i wyjaśnia, jak rozdziela lokalizacje. Bez tego model może powielać niejednoznaczności obecnego opisu pól. Warto też ustalić, które informacje po prostu nie występują w dokumencie i mają pozostać do uzupełnienia.
Próbę ocenia się na osobnych formularzach i wersjach niewykorzystanych do adaptacji. Pracownicy sprawdzają błędnie przypisane adresy, wymieszane grupy i pominięte wartości, a także pracę potrzebną do poprawienia całego wpisu. Porównanie z dotychczasowym odczytem pokazuje, czy dostosowanie uzasadnia dodatkowe utrzymanie.
Dane do sprawdzenia i zapisania w obecnym systemie
Syntalith proponuje aplikację do odczytu formularzy, która pokazuje pracownikowi wartości wraz z ich miejscem w dokumencie i zachowuje oddzielne lokalizacje. Po sprawdzeniu wynik trafia do uzgodnionego etapu rejestracji w obecnym systemie. Taki zakres odpowiada pracy, którą zespół dziś wykonuje przy przepisywaniu i ponownym łączeniu danych.
Zaczynamy od formularzy, które pracownicy regularnie poprawiają. Zespół klienta wyjaśnia, co powinno znaleźć się w każdym polu, i ustala sposób wykorzystania materiałów. Sprawdzamy obecne narzędzie oraz import do systemu, a dostosowanie modelu proponujemy przy błędach, które nadal wracają.
Opisz jeden formularz, w którym poprawnie odczytana informacja trafiła do niewłaściwego miejsca. Powiedz, jak pracownik naprawił zapis i gdzie powinien znaleźć się wynik. To punkt wyjścia do rozmowy o projekcie; informacje o współpracy są w cenniku Syntalith.
Dobierzmy model do wymagań Twojego zadania
Opisz wynik, którego obecne AI nie daje wystarczająco dobrze. Porównamy możliwości dostosowania modelu, wymagania dotyczące danych i koszty dalszego działania.
Prywatne modele LLM i fine-tuning