Jak sprawdzić LLM przed wdrożeniem w firmie
Test prywatnego LLM na polskich dokumentach: jakość, odmowy, dostęp, opóźnienia i koszt błędów. Jak Syntalith ustala kryteria odbioru wdrożenia.
Syntalith
Model poprawnie odpowiada na pięć pytań podczas prezentacji. Następnego dnia trafia na skan z odwróconą stroną, brakującą tabelę i umowę, do której pytający nie ma dostępu. Dopiero takie przypadki pokazują, czy system nadaje się do pracy w firmie.
Ewaluacja to powtarzalny test wykonania zadania. Przed wyborem Qwena, DeepSeeka czy innego modelu ustalamy, co uznajemy za poprawny wynik, a jaki błąd blokuje wdrożenie. Podobne podejście opisują wytyczne ewaluacji OpenAI: cel, zbiór danych i metryki powinny odpowiadać rzeczywistemu zastosowaniu.
Zacznij od decyzji użytkownika
W kancelarii odpowiedź musi wskazywać właściwą klauzulę i jej wersję. W help desku liczy się dział, do którego trafi sprawa. W księgowości błędny identyfikator kontrahenta jest innym problemem niż zbędna spacja w opisie. W dokumentacji produkcyjnej niejasna instrukcja powinna prowadzić do weryfikacji przez odpowiedzialną osobę.
Te różnice zapisujemy w kryteriach. Ocena stylistyczna nie zastąpi sprawdzenia numerów, kategorii i źródeł. Użytkownik procesu powinien współtworzyć test, ponieważ wie, które pomyłki powodują dalszą pracę lub ryzyko.
Zbuduj zestaw, którego model nie widział podczas uczenia
Zbiór powinien obejmować typowe sprawy, rzadsze wyjątki i sytuacje z brakującą informacją. Dodaj polskie znaki, skróty branżowe, mieszane języki i dokumenty słabej jakości, jeśli występują w procesie. Są to proponowane grupy testów, które dopasowujemy do zadania.
Oddziel dane treningowe od końcowego testu. Podobne dokumenty z tej samej sprawy łatwo sprawiają, że model wygląda na lepszy, niż jest wobec nowych klientów. Zapisz wersję danych i kryteria, aby porównać kolejną aktualizację z tą samą podstawą.
Mierz kilka rodzajów błędów
| Obszar | Co sprawdzić | Co daje wynik |
|---|---|---|
| Jakość zadania | Poprawne pola, kategorie i cytaty | Informację, czy odpowiedź pomaga w pracy |
| Niepewność | Brak źródła, sprzeczne dokumenty, nowy typ sprawy | Ocenę, kiedy model powinien odmówić lub przekazać sprawę |
| Dostęp | To samo pytanie od użytkowników z różnymi rolami | Sprawdzenie, czy aplikacja respektuje uprawnienia |
| Obciążenie | Krótkie i długie wejścia, kilka jednoczesnych żądań | Kolejkę i rzeczywisty czas oczekiwania |
| Utrzymanie | Restart, brak GPU, zmiana wag lub szablonu | Ocenę zachowania po awarii i aktualizacji |
W klasyfikacji pokazujemy wyniki dla poszczególnych kategorii. Dobry wynik średni może ukrywać słabą obsługę rzadkich reklamacji. Dla ekstrakcji osobno liczymy brak pola oraz pole wymyślone. W RAG sprawdzamy, czy wskazany fragment rzeczywiście potwierdza odpowiedź.
Próg pewności też trzeba przetestować
Liczba 0,9 przy odpowiedzi nie dowodzi, że dziewięć na dziesięć podobnych decyzji będzie poprawnych. Tę zależność mierzymy na danych z zadania. Jest to szczególnie ważne dla Jev i modeli decyzyjnych, które zwracają prawdopodobieństwa.
Porównujemy jakość przy różnych progach oraz udział spraw przekazywanych człowiekowi. Wysoki próg może ograniczyć błędy, ale zostawić większość pracy operatorowi. Obie liczby powinny znaleźć się w raporcie.
Co otrzymujesz po teście
Przydatny raport zawiera wersję modelu, konfigurację, wyniki dla kategorii, przykłady błędów, pomiar obciążenia i rekomendację. Zachowujemy także poprzednią działającą wersję i warunki wycofania aktualizacji. Ten sam zestaw można uruchamiać po fine-tuningu lub zmianie kwantyzacji.
Syntalith prowadzi dobór i ewaluację prywatnych LLM przed ich uruchomieniem. Opisz proces i konsekwencję błędnej odpowiedzi. Na tej podstawie zaproponujemy test, który pomoże podjąć decyzję o wdrożeniu i jego zakresie.
Oceńmy prywatne AI w warunkach Twojej firmy
Pomagamy firmom i osobom prywatnym dobrać sprzęt, uruchomić model i sprawdzić go na własnych zadaniach. Możesz zacząć od komputera, który już masz, albo od rozmowy przed zakupem.
Prywatne modele LLM i fine-tuning