Przejdź do treści
← Wróć do bloga
lokalne AIArtykuł

Jak kupić lokalne AI z testem na własnych dokumentach

Przed zakupem lokalnego asystenta dokumentów porównaj jego odpowiedzi na własnych zadaniach. Sprawdź, czy wskazuje właściwą wersję źródła, ujawnia brak informacji i ogranicza pracę kontrolną. Dopiero taki test pomaga zdecydować, czy wystarczy obecne wyszukiwanie, zatwierdzona usługa prywatna czy system lokalny.

Autor

Syntalith

Opublikowano Zaktualizowano 5 min czytania

Pokaz produktu i wynik benchmarku nie mówią jeszcze, czy narzędzie odpowie poprawnie na pytania z dokumentów Twojej firmy. Potrzebujesz próby, w której treść zadania, dozwolone źródła i kryteria akceptacji są ustalone przed porównaniem. Pozwoli to ocenić odpowiedzi oraz czas potrzebny pracownikowi na ich sprawdzenie.

Jedno pytanie, dwie wersje dokumentu

Wyobraźmy sobie dział zakupów, który porównuje oferty dostawców. W folderze znajdują się starsza oferta z terminem dostawy i nowszy dokument opisujący zamówienie. Ten dokument odsyła do aneksu, który określa termin, ale pliku z aneksem brakuje w zbiorze dopuszczonym do próby. Pracownik pyta, jaki termin obowiązuje dla wskazanej wersji zamówienia.

Asystent może wyszukać starszą ofertę i podać jej termin płynnym, pewnym tonem. Zdanie będzie miało oparcie w dokumencie, lecz wniosek o obowiązującym terminie pozostanie bez podstawy. Oczekiwany wynik powinien wskazać znalezioną wersję i zgłosić brak aneksu, który pozwoliłby ustalić zmianę. Osoba z zakupów sprawdza źródło, ocenia odpowiedź i rozstrzyga, czy brak trzeba uzupełnić przed dalszym użyciem.

Z tego przykładu powstaje zadanie testowe: pytanie, określony zestaw źródeł, wersja dokumentu, oczekiwana odpowiedź i opis błędów, które dyskwalifikują wynik. Przykładowym błędem krytycznym jest przypisanie starszego terminu do późniejszego zamówienia. Akceptacji nie powinno przesądzać samo podobieństwo sformułowań ani przekonujący ton odpowiedzi.

Ustal kryteria, zanim zobaczysz wynik

Zapisz zadania wynikające z rzeczywistych pomyłek lub pytań pracowników. Dla każdego określ, jakich źródeł asystent może użyć, co ma zwrócić, jak pokazać podstawę odpowiedzi i kiedy zgłosić brak informacji. Warto uwzględnić zarówno pytanie z pełną odpowiedzią w aktualnej wersji, jak i przypadek podobny do brakującego aneksu. Kryteria pomagają odróżnić brak źródła od błędnego odczytu treści. Wskazówki Anthropic o ewaluacji agentów zalecają testy oparte na rzeczywistych błędach, jasne kryteria i analizę nieudanych przypadków. Te zasady można zastosować do oceny asystenta dokumentów.

Próby służące do poprawiania systemu oddziel od zadań zarezerwowanych na odbiór. Zachowaj dla porównania tę samą treść pytań, kontekst, zakres dokumentów i ich wersje. Gdy jeden wariant dostaje dodatkową wskazówkę lub nowszy plik, wynik przestaje być równym porównaniem.

Pracownik zakupów powinien oceniać, czy system odnalazł właściwe źródło i czy odpowiedź zachowuje warunki w nim zapisane. Osobno zapisz, ile weryfikacji wymaga wynik i czy osoba sprawdzająca może odtworzyć jego podstawę. Błąd wyszukania starego dokumentu mówi coś innego niż błędna interpretacja fragmentu, który system już znalazł. To rozróżnienie podpowiada, co należy poprawić i jakie zadanie powtórzyć.

Porównaj rozwiązania na równych warunkach

W teście mogą wziąć udział trzy warianty: obecne wyszukiwanie w dokumentach, zatwierdzona usługa chmurowa lub prywatna oraz system lokalny. Najpierw ustalcie, które z nich mogą pracować na tych samych materiałach i w podobnym zakresie. Nie każda opcja musi używać modelu językowego. Jeśli zwykłe wyszukiwanie szybko znajduje aktualny dokument, którego pracownik potrzebuje, może wystarczyć.

Oceniaj wyniki według wcześniej uzgodnionych kryteriów. Czy odpowiedź wskazuje właściwą wersję i źródło? Czy przy braku aneksu system sygnalizuje brak podstawy? Ile czasu zajmuje kontrola przez pracownika? Jak długo trwa uzyskanie użytecznego wyniku w warunkach, na które zgadza się zespół? Ustal też, kto będzie opiekował się rozwiązaniem i weryfikował je po zmianach. Wynik benchmarku i szybkość generowania tekstu mają znaczenie obok rezultatów zadań firmy.

Wynik wyszukiwania źródła i jakość odpowiedzi modelu oceniaj osobno. Jeśli asystent nie znajduje nowszego dokumentu, problem może leżeć w dostępie do materiału lub jego indeksowaniu. Jeśli znajduje właściwy fragment, ale przekręca jego warunek, trzeba sprawdzić sposób tworzenia odpowiedzi. Przed wyborem wariantu lokalnego ustal, którędy dokument przechodzi od użytkownika do wyniku, w tym czy przetwarzają go zewnętrzne komponenty, takie jak odczyt pliku lub usługa logowania, oraz kto ma dostęp do materiałów.

Nieudany test może zmienić decyzję zakupową. Błędna wersja źródła może wskazywać na problem z wyszukiwaniem lub uporządkowaniem dokumentów. Zgadnięcie terminu mimo braku aneksu wymaga poprawy zachowania przy niepełnych danych i ponownego sprawdzenia tego przypadku. Jeżeli poprawione zadanie wciąż nie spełnia uzgodnionego kryterium, odbiorca może zawęzić zastosowanie, wrócić do prostszego wyszukiwania albo zrezygnować z zakupu w tym zakresie.

Przed próbą uzgodnij, że raport obejmie warunki testu, zaakceptowane i niezaakceptowane przykłady oraz zakres zadań, dla których decyzja ma obowiązywać. Raport pokaże kompromisy między użytecznością odpowiedzi, czasem kontroli i wymaganiami dotyczącymi środowiska. Powinien też wskazywać warunki dalszej próby, zmian albo rezygnacji.

Co ustalić przed rozmową o lokalnym AI

Syntalith rozwija aplikacje AI dla firm, w tym rozwiązania wykorzystujące modele lokalne i prywatne. W tym przypadku można uzgodnić porównawczą ocenę na zadaniach zakupowych, z raportem warunków próby, przykładami zaakceptowanymi i błędnymi oraz rekomendacją, czy poprawić wyszukiwanie, rozwijać aplikację lokalną, czy pozostać przy obecnym narzędziu.

Przygotuj opis dwóch lub trzech pytań, na które pracownicy regularnie szukają odpowiedzi, oraz informację, z jakich dokumentów dziś korzystają. Dołącz przykładowy przypadek błędu i wskaż, kto może zatwierdzić poprawną odpowiedź. Te materiały pozwolą ustalić, które zadania sprawdzać, komu powierzyć ocenę i jakie warianty porównać. Informacje o cenach i usługach Syntalith pomogą zaplanować dalszą rozmowę.

Jeżeli test potwierdzi potrzebę lokalnego systemu, kolejną decyzją będzie jego uruchomienie na stacji roboczej lub wspólnym serwerze. Kryteria tego wyboru opisuje artykuł o lokalnym modelu na stacji roboczej i serwerze.

Oceńmy prywatne AI w warunkach Twojej firmy

Pomagamy firmom i osobom prywatnym dobrać sprzęt, uruchomić model i sprawdzić go na własnych zadaniach. Możesz zacząć od komputera, który już masz, albo od rozmowy przed zakupem.

Prywatne modele LLM i fine-tuning
Porozmawiaj o prywatnym AI