Przejdź do treści
← Wróć do bloga
local-modelsArtykuł

Jak sprawdzić LLM przed wdrożeniem w firmie

Test prywatnego LLM na polskich dokumentach: jakość, odmowy, dostęp, opóźnienia i koszt błędów. Jak Syntalith ustala kryteria odbioru wdrożenia.

Autor

Syntalith

Opublikowano Zaktualizowano 2 min czytania

Model poprawnie odpowiada na pięć pytań podczas prezentacji. Następnego dnia trafia na skan z odwróconą stroną, brakującą tabelę i umowę, do której pytający nie ma dostępu. Dopiero takie przypadki pokazują, czy system nadaje się do pracy w firmie.

Ewaluacja to powtarzalny test wykonania zadania. Przed wyborem Qwena, DeepSeeka czy innego modelu ustalamy, co uznajemy za poprawny wynik, a jaki błąd blokuje wdrożenie. Podobne podejście opisują wytyczne ewaluacji OpenAI: cel, zbiór danych i metryki powinny odpowiadać rzeczywistemu zastosowaniu.

Zacznij od decyzji użytkownika

W kancelarii odpowiedź musi wskazywać właściwą klauzulę i jej wersję. W help desku liczy się dział, do którego trafi sprawa. W księgowości błędny identyfikator kontrahenta jest innym problemem niż zbędna spacja w opisie. W dokumentacji produkcyjnej niejasna instrukcja powinna prowadzić do weryfikacji przez odpowiedzialną osobę.

Te różnice zapisujemy w kryteriach. Ocena stylistyczna nie zastąpi sprawdzenia numerów, kategorii i źródeł. Użytkownik procesu powinien współtworzyć test, ponieważ wie, które pomyłki powodują dalszą pracę lub ryzyko.

Zbuduj zestaw, którego model nie widział podczas uczenia

Zbiór powinien obejmować typowe sprawy, rzadsze wyjątki i sytuacje z brakującą informacją. Dodaj polskie znaki, skróty branżowe, mieszane języki i dokumenty słabej jakości, jeśli występują w procesie. Są to proponowane grupy testów, które dopasowujemy do zadania.

Oddziel dane treningowe od końcowego testu. Podobne dokumenty z tej samej sprawy łatwo sprawiają, że model wygląda na lepszy, niż jest wobec nowych klientów. Zapisz wersję danych i kryteria, aby porównać kolejną aktualizację z tą samą podstawą.

Mierz kilka rodzajów błędów

ObszarCo sprawdzićCo daje wynik
Jakość zadaniaPoprawne pola, kategorie i cytatyInformację, czy odpowiedź pomaga w pracy
NiepewnośćBrak źródła, sprzeczne dokumenty, nowy typ sprawyOcenę, kiedy model powinien odmówić lub przekazać sprawę
DostępTo samo pytanie od użytkowników z różnymi rolamiSprawdzenie, czy aplikacja respektuje uprawnienia
ObciążenieKrótkie i długie wejścia, kilka jednoczesnych żądańKolejkę i rzeczywisty czas oczekiwania
UtrzymanieRestart, brak GPU, zmiana wag lub szablonuOcenę zachowania po awarii i aktualizacji

W klasyfikacji pokazujemy wyniki dla poszczególnych kategorii. Dobry wynik średni może ukrywać słabą obsługę rzadkich reklamacji. Dla ekstrakcji osobno liczymy brak pola oraz pole wymyślone. W RAG sprawdzamy, czy wskazany fragment rzeczywiście potwierdza odpowiedź.

Próg pewności też trzeba przetestować

Liczba 0,9 przy odpowiedzi nie dowodzi, że dziewięć na dziesięć podobnych decyzji będzie poprawnych. Tę zależność mierzymy na danych z zadania. Jest to szczególnie ważne dla Jev i modeli decyzyjnych, które zwracają prawdopodobieństwa.

Porównujemy jakość przy różnych progach oraz udział spraw przekazywanych człowiekowi. Wysoki próg może ograniczyć błędy, ale zostawić większość pracy operatorowi. Obie liczby powinny znaleźć się w raporcie.

Co otrzymujesz po teście

Przydatny raport zawiera wersję modelu, konfigurację, wyniki dla kategorii, przykłady błędów, pomiar obciążenia i rekomendację. Zachowujemy także poprzednią działającą wersję i warunki wycofania aktualizacji. Ten sam zestaw można uruchamiać po fine-tuningu lub zmianie kwantyzacji.

Syntalith prowadzi dobór i ewaluację prywatnych LLM przed ich uruchomieniem. Opisz proces i konsekwencję błędnej odpowiedzi. Na tej podstawie zaproponujemy test, który pomoże podjąć decyzję o wdrożeniu i jego zakresie.

Oceńmy prywatne AI w warunkach Twojej firmy

Pomagamy firmom i osobom prywatnym dobrać sprzęt, uruchomić model i sprawdzić go na własnych zadaniach. Możesz zacząć od komputera, który już masz, albo od rozmowy przed zakupem.

Prywatne modele LLM i fine-tuning
Porozmawiaj o prywatnym AI