Fine-tuning, RAG czy trening własnego modelu?
Jak dobrać RAG, fine-tuning LoRA lub trening małego modelu do firmowego zadania. Dane, testy i koszty adaptacji LLM wyjaśnione przez Syntalith.
Syntalith
Model odpowiada według starego regulaminu. Albo zna regulamin, ale uparcie przypisuje reklamacje do niewłaściwego działu. Te dwa błędy wyglądają podobnie dla użytkownika, lecz pierwszy dotyczy źródła wiedzy, a drugi sposobu wykonywania zadania. Od tej różnicy zależy wybór między RAG a fine-tuningiem.
W Syntalith zaczynamy od zapisania błędów gotowego modelu. Kilka konkretnych przykładów zwykle mówi więcej o potrzebnym zakresie niż prośba o „wytrenowanie AI na wszystkich dokumentach”.
RAG dostarcza informacje podczas zapytania
RAG łączy wyszukiwanie z generowaniem odpowiedzi. Aplikacja znajduje fragmenty dokumentów, sprawdza uprawnienia i przekazuje je modelowi wraz z pytaniem. Wagi modelu pozostają bez zmian. W ten sposób można korzystać z nowej wersji instrukcji bez ponownego uczenia.
Sprawdza się to przy regulaminach, kartach produktów i bazach procedur. Wynik zależy jednak od wyszukiwarki: jeśli ta pominie właściwy dokument, większy model może nadal odpowiedzieć błędnie. Dlatego osobno oceniamy odnalezione źródła i odpowiedź generatora. Cytowanie powinno prowadzić do fragmentu, który faktycznie wspiera zdanie.
Fine-tuning uczy zachowania na przykładach
W nadzorowanym dostrajaniu pokazujesz wejście i oczekiwany wynik. Dla zgłoszenia może to być dział, priorytet i powód eskalacji. Dla dokumentu: pola w ustalonym formacie, z pustą wartością tam, gdzie informacji brakuje.
LoRA uczy dodatkowe macierze przy zamrożonych wagach bazowych. QLoRA łączy ten pomysł ze skwantyzowanym modelem bazowym. Ogranicza to zasoby potrzebne do uczenia w porównaniu z aktualizacją wszystkich wag. Podczas działania nadal potrzebujesz modelu bazowego i zgodnego sposobu zastosowania adaptera.
Dostrojenie warto sprawdzić, gdy gotowy model systematycznie myli firmową taksonomię, styl odpowiedzi albo format wyjścia. Wiedzę, którą trzeba często aktualizować lub usuwać, łatwiej kontrolować w oddzielnym źródle niż w wagach.
Kiedy wystarczy mały model
Wybór jednego z kilkunastu działów może obsłużyć klasyfikator, model embeddingowy albo niewielki model decyzyjny. Potrzebujesz wtedy prawidłowej kategorii, a swobodna odpowiedź tekstowa może tylko zwiększać czas działania.
Modele inspirowane Jev pokazują ten kierunek. Najpierw porównujemy je z prostą regułą lub klasyfikatorem. Jeśli mały model osiąga ustalony próg jakości, można poświęcić więcej budżetu na kontrolę danych i integrację.
Trening od zera oznacza szerszą odpowiedzialność za dane i koszt obliczeń. Może mieć sens dla małego, ściśle określonego modelu. Budowa ogólnego LLM od podstaw wymaga osobnego uzasadnienia ekonomicznego. Nie zakładamy jej jako domyślnego kroku przy firmowej bazie wiedzy.
Dane treningowe wymagają decyzji człowieka
Przykłady powinny odzwierciedlać prawdziwe przypadki, także rzadkie i niejednoznaczne. Jeżeli dwie osoby oznaczają tę samą sprawę inaczej, trzeba najpierw doprecyzować regułę. Model nie rozwiąże sprzecznej polityki działu.
Oddzielamy zbiór do treningu, walidacji i końcowej oceny. Powiązane wiadomości z jednej sprawy pozostają w tej samej części, żeby treść nie przenikała do testu. Kontrolujemy prawa do danych, ograniczamy dane osobowe i dokumentujemy wersję zbioru. Przy destylacji sprawdzamy także, czy warunki dostawcy modelu nauczyciela pozwalają użyć jego odpowiedzi do uczenia.
Jak wygląda wynik współpracy
Porównanie powinno pokazać model bazowy, wariant z lepszą instrukcją lub RAG i model po dostrojeniu. Mierzymy wynik na przykładach niewidzianych podczas uczenia, czas obsługi oraz koszt błędów. Zapisujemy również przypadki, w których nowa wersja działa gorzej.
Syntalith dobiera i dostraja prywatne modele, przygotowuje dane i wdraża wybrany wariant. Na początek opisz zadanie, pokaż oczekiwany format odpowiedzi i wskaż kilka obecnych błędów. Ustalimy, czy problem uzasadnia trening i jak zmierzyć jego efekt.
Dobierzmy model do wymagań Twojego zadania
Opisz wynik, którego obecne AI nie daje wystarczająco dobrze. Porównamy możliwości dostosowania modelu, wymagania dotyczące danych i koszty dalszego działania.
Prywatne modele LLM i fine-tuning