Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Jak zbudować polskiego asystenta wiedzy z RAG

Asystent wiedzy musi znaleźć właściwy dokument, sprawdzić uprawnienia, odpowiedzieć z cytatem i umieć odmówić. Dwa polskie badania pokazują, jak to mierzyć.

Autor

Syntalith

Opublikowano Zaktualizowano 3 min czytania

Asystent wiedzy firmy nie powstaje przez wgranie folderu dokumentów do modelu. System musi znaleźć właściwe źródło, sprawdzić uprawnienia użytkownika, rozpoznać obowiązującą wersję dokumentu, udzielić odpowiedzi z cytatem i odmówić, gdy brakuje podstawy. Dopiero potem wybiera się generator: Qwen, Bielik, PLLuM albo model dostępny przez zewnętrzne API.

Dwie publikacje z 2026 roku dobrze pokazują, dlaczego nie wybiera się tego komponentu po nazwie. W RAG na dokumentacji technicznej lepszy wynik uzyskał Bielik. W RAG na polskiej Wikipedii lepszy wynik uzyskał PLLuM. Oba wyniki są prawdziwe i dotyczą innych wersji modeli oraz innych sposobów wyszukiwania.

Pierwsze badanie na rzeczywistej dokumentacji technicznej

W pracy Evaluation of Two Leading Polish Language Models in a Real-world RAG Scenario korpusem była rzeczywista dokumentacja techniczna platformy low-code, podzielona na około 1200 fragmentów. Badacze przygotowali 146 pytań referencyjnych wybranych jako prawdopodobne pytania użytkowników. Pracownicy pomagali zbudować odpowiedzi wzorcowe.

Najlepsze wyszukiwanie wektorowe z modelem OrlikB/KartonBERT-USE-base-v1 uzyskało:

Zwracane fragmentyTrafnośćPełnośćF1NDCG
50,8910,7440,4850,682
70,8990,7960,4240,701

Generator otrzymywał pięć dokumentów. Średnia ocena w skali 1–5 wyniosła:

Wersja modeluŚrednia ocena
Bielik-11B-v2.3-Instruct4,521
PLLuM-12B-nc-chat4,025

Badanie ujawniło też problem sędziego. Gdy odpowiedź PLLuM była pokazywana pierwsza, Bielik wygrywał 81,5% porównań. Po odwróceniu kolejności udział Bielika spadł do 54,3%. Ocena parami bez losowania kolejności może więc stworzyć pozornie duży margines.

Drugie badanie na polskiej Wikipedii

Praca Evaluating Cost-Efficiency of LLMs in a RAG Setup on Polish Wikipedia wykorzystała 1000 pytań PolQA. System pobierał fragmenty z polskiej Wikipedii, ponownie porządkował je według trafności i przekazywał najlepsze generatorowi. Odpowiedzi porównywał GPT-4o.

Ranking Bradley'a-Terry'ego wyniósł:

Wersja modeluOcena
PLLuM-12B-nc-chat FP161,273 ± 0,030
Bielik-11B-v2.6-Instruct FP161,061 ± 0,014

Tym razem PLLuM uzyskał lepszy wynik. Nie obala to pierwszej publikacji. Zmieniły się wersja Bielika, korpus, pytania, wyszukiwarka, sposób porządkowania fragmentów i procedura oceny. „Najlepszy polski model do RAG” bez tych szczegółów nie jest użytecznym zdaniem.

Gdzie w tym wszystkim jest Qwen3.8-27B

Oficjalna karta Qwen3.8-27B opisuje gęsty model 27B z natywnym oknem 262 144 tokenów. W naszym domowym eksperymencie Qwen odtworzył wszystkie sprawdzane fakty z wejść liczących 50 059, 115 074 i 230 085 tokenów. Najdłuższa próba trwała 563,4 s i osiągnęła 23 623 MiB VRAM.

To daje Qwenowi miejsce na liście kandydatów do pracy z długimi pakietami dokumentów. Nie rozstrzyga wyboru modelu do polskiego RAG. Nasz pomiar Qwena sprawdzał tylko odnalezienie trzech faktów w długim tekście; wyniki RAG wyżej należą wyłącznie do wersji modeli użytych w cytowanych publikacjach.

System wiedzy ma co najmniej dwa osobne wyniki

Pierwszy wynik dotyczy wyszukiwania: czy właściwy fragment znalazł się wysoko w rankingu. Drugi dotyczy odpowiedzi: czy generator zachował sens źródła, cytat, wersję dokumentu i właściwą odmowę.

Jedna zbiorcza ocena ukrywa miejsce awarii. Gdy odpowiedź jest błędna, zespół powinien umieć rozstrzygnąć, czy:

  • moduł odczytujący zgubił tabelę albo nagłówek;
  • podział dokumentu rozdzielił definicję od wyjątku;
  • wyszukiwarka nie znalazła właściwego dokumentu;
  • filtr uprawnień usunął poprawne źródło lub przepuścił niedozwolone;
  • generator zignorował dostarczony fragment;
  • w indeksie pozostała nieaktualna wersja.

Co trzeba zachować przy każdej odpowiedzi

Odpowiedź bez śladu źródła jest trudna do odbioru i trudna do naprawy. Operacyjny system powinien zachować identyfikator oraz wersję dokumentu, znalezione fragmenty i ich kolejność, tożsamość użytkownika i wynik filtra dostępu, dokładną wersję modelu oraz profil, odpowiedź końcową i decyzję recenzenta.

Takie dane pozwalają powtórzyć przypadek po zmianie modułu odczytującego lub modelu wektorowego lub modelu. Bez nich aktualizacja staje się porównaniem wrażeń.

Jak wygląda test przed wdrożeniem

Zestaw powstaje z pytań, które pracownicy naprawdę zadają. Właściciel procesu wskazuje źródło rozstrzygające, obowiązującą wersję, dopuszczalną odpowiedź i przypadki wymagające odmowy. Kontrole dostępu wchodzą do tego samego zestawu od początku.

Następnie porównujemy dokładne profile na identycznym indeksie albo, jeśli zmieniamy wyszukiwarkę, rozdzielamy jej wyniki od wyników generatora. Raport pokazuje każdą odrzuconą odpowiedź i jej powód. Sama średnia nie wystarcza.

Co Syntalith może zbudować i przekazać

Możemy rozpocząć od audytu źródeł i zestawu pytań, następnie wykonać moduły odczytujące pliki, indeks, filtrowanie po rolach, cytaty, panel przeglądu i bramkę aktualizacji. Porównujemy lokalne modele z sensowną alternatywą API. Jeżeli Qwen wygrywa na zadaniu klienta, wdrażamy Qwena. Jeżeli wygrywa Bielik, PLLuM lub rozwiązanie prostsze od LLM, rekomendacja powinna to powiedzieć.

Audyt procesu AI zaczyna się od 4990 zł netto. Własny system wiedzy mieści się w Aplikacjach AI, które zaczynają się od 25 000 zł netto. Zakres obejmuje wykonanie, dokumentację, testy odbiorowe i szkolenie osób, które mają system utrzymywać. Pierwszym krokiem może być bezpłatny skan procesu.

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze