Jev 1.13 w firmie: klasyfikacja i routing spraw
Gdzie sprawdzić Jev i małe modele decyzyjne w firmie? Routing zgłoszeń, kompletność dokumentów, progi pewności i pilotaż przygotowany przez Syntalith.
Syntalith
Kolejka reklamacji zawiera sprawy o opóźnioną dostawę, błędną fakturę i uszkodzony towar. Czasem jedna wiadomość dotyczy wszystkich tych tematów. Prosta reguła słów kluczowych zaczyna zawodzić, a każdorazowe pytanie dużego modelu o długie uzasadnienie może być zbędne.
To rozsądny przypadek do sprawdzenia modelu decyzyjnego. Jev 1.13 w OpenRouter zwraca typowane decyzje z prawdopodobieństwami. Poniższe scenariusze są propozycjami pilotażu. Nie opisują wdrożeń Jev u klientów Syntalith.
Oddziel pytania, które prowadzą do różnych działań
Dla wiadomości z reklamacją można zapytać o dział prowadzący, brakujące informacje i potrzebę eskalacji. Każda odpowiedź ma inne znaczenie dla aplikacji. Wybrany dział kieruje sprawę do kolejki. Wykryty brak dokumentu przygotowuje prośbę do sprawdzenia przez pracownika. Eskalacja nadaje sprawie inny tryb obsługi.
Ważne jest dopuszczenie sytuacji wieloznacznej. Jeśli zadanie wymusza jedną kategorię przy wielu problemach, trzeba ustalić priorytet albo rozbić sprawę. Bez tej reguły nawet ludzie mogą nie zgadzać się co do poprawnej odpowiedzi.
Gdzie zacząć pilotaż
| Proces | Zadanie modelu | Co sprawdza aplikacja lub człowiek |
|---|---|---|
| Help desk | Wybór kolejki i sygnału pilności | Dostępne zespoły, uprawnienia i wyjątki |
| Obsługa zamówień | Ocena kompletności wiadomości | Rzeczywiste pola oraz dane w ERP |
| Dokumentacja serwisowa | Wskazanie kategorii usterki | Czy kategoria pasuje do urządzenia i zgłoszenia |
| Wewnętrzna baza wiedzy | Wybór źródła do przeszukania | Dostęp użytkownika i istnienie dokumentu |
Na początek wybieramy zadanie, którego wynik da się odwrócić i sprawdzić. Przeniesienie zgłoszenia między kolejkami jest łatwiejsze do oceny niż samodzielne rozstrzygnięcie roszczenia. Zakres automatyzacji musi uwzględniać konsekwencję błędu.
Próg pewności wynika z pomiaru
Załóżmy, że system przepuszcza decyzje powyżej określonego progu, a resztę przekazuje operatorowi. Podnoszenie progu może zwiększać trafność zaakceptowanych odpowiedzi, ale zmniejszać odsetek automatycznie obsługiwanych spraw. Mierzymy oba skutki.
Przygotujmy przykładowy scenariusz: w próbie 1000 spraw aplikacja zaakceptowała 600 decyzji, z czego 12 było błędnych. Pokrycie wynosi 600 / 1000 = 60%, a trafność zaakceptowanych decyzji (600 - 12) / 600 = 98%. To ilustracja sposobu raportowania, bez związku z wynikiem Jev lub Syntalith. Pozostałe 400 spraw nadal wymaga pracy.
Jedna średnia dla całego zbioru ukryłaby tę różnicę. Dlatego raport pokazuje również najtrudniejsze kategorie i błędy o największym koszcie.
Przetestuj zmianę reguł
Nowa procedura reklamacji może zmienić odpowiedź bez zmiany modelu. Wersjonujemy opis kategorii i oczekiwane zachowanie. Zbiór testowy obejmuje sprawy sprzed zmiany i po niej, z informacją, które zasady obowiązują.
Model decyzyjny może zwrócić kategorię w poprawnym formacie, ale aplikacja nadal odpowiada za wykonanie działania. Przed aktualizacją CRM sprawdza tożsamość, uprawnienia i kompletność danych. Log powinien łączyć wynik z wersją modelu oraz reguły.
Jev czy rozwiązanie lokalne?
Jev jest punktem porównania, gdy dostęp do usługi i warunki przetwarzania pasują do projektu. Jeśli dane mają pozostawać w wydzielonej sieci, sprawdzamy Kev, TinyJev lub własny mały model. Wspólny format odpowiedzi nie oznacza jednakowej jakości.
Syntalith przygotuje test kategorii, porówna kandydatów i wdroży wybrany wariant z obsługą wyjątków. Opisz kolejkę, którą chcesz usprawnić, wraz z liczbą spraw i obecnym sposobem ich rozdzielania. Ustalimy, co można mierzyć przed decyzją o zakupie.
Dobierzmy model do wymagań Twojego zadania
Opisz wynik, którego obecne AI nie daje wystarczająco dobrze. Porównamy możliwości dostosowania modelu, wymagania dotyczące danych i koszty dalszego działania.
Prywatne modele LLM i fine-tuning