Qwen3.8, Bielik czy PLLuM? Porównanie modeli bez skrótów
Qwen3.8-27B, Bielik-11B-v3.0-Instruct i PLLuM-12B-chat-2512: architektura, parametry, kontekst, sprzęt, licencje, zastosowania i wyniki.
Syntalith
Qwen3.8-27B jest dużym modelem ogólnego zastosowania do kodu, zadań agentowych oraz pracy z tekstem, obrazem i wideo. Bielik-11B-v3.0-Instruct to tekstowy model europejski zoptymalizowany pod język polski. PLLuM-12B-chat-2512 to tekstowy model polski rozwijany z myślą o administracji, dialogu i RAG. Różnią się architekturą, rozmiarem, kontekstem, wymaganiami sprzętowymi oraz dojrzałością integracji.
Najkrótsza rekomendacja wygląda tak:
- Qwen3.8-27B wybierz do kodu, obsługi narzędzi, analizy obrazów i bardzo długich materiałów, jeśli akceptujesz większy koszt infrastruktury.
- Bielik-11B-v3.0-Instruct sprawdź jako pierwszy model do polskich zadań tekstowych, ekstrakcji, klasyfikacji, redagowania i mniejszego lokalnego agenta.
- PLLuM-12B-chat-2512 sprawdź jako pierwszy do polskiego asystenta wiedzy, szczególnie dla dokumentów urzędowych, regulaminów, procedur i kontrolowanego RAG.
Żadna z tych rekomendacji nie zastępuje testu na danych firmy. Wyjaśnia jednak, od którego modelu warto zacząć.
Jakie dokładnie modele porównujemy
Nazwy „Bielik” i „PLLuM” oznaczają całe rodziny. Porównanie bez numeru wersji, rozmiaru i typu wersji modelu jest bezużyteczne. W tym artykule zestawiamy trzy modele gotowe do rozmowy lub wykonywania instrukcji:
Qwen/Qwen3.8-27B, post-trenowany model Qwen z 27 mld parametrów językowych i enkoderem obrazu.speakleash/Bielik-11B-v3.0-Instruct, wariant instrukcyjny Bielika 11B v3.CYFRAGOVPL/PLLuM-12B-chat-2512, wariant dialogowy drugiej generacji PLLuM z grudnia 2025 roku.
Starsze publikacje używały między innymi Bielika v2.3, Bielika v2.6 i PLLuM-12B-nc-chat-2412. Ich wyniki nadal są informacyjne, ale nie opisują bezpośrednio powyższych wersji.
Porównanie techniczne Qwen3.8, Bielika i PLLuM
| Cecha | Qwen3.8-27B | Bielik-11B-v3.0-Instruct | PLLuM-12B-chat-2512 |
|---|---|---|---|
| Główne przeznaczenie | kod, agenci, narzędzia, praca biurowa, analiza wizualna | polskie i europejskie zadania tekstowe, instrukcje, lokalne automatyzacje | polski dialog, administracja, streszczanie i RAG |
| Parametry | 27 mld w części językowej oraz osobny enkoder obrazu | około 11 mld | około 12 mld |
| Typ | gęsty model przyczynowy z enkoderem obrazu | gęsty model dekoderowy | gęsty model dekoderowy |
| Fundament architektury | hybryda Gated DeltaNet i pełnej atencji | Mistral 7B v0.2 powiększony przez dodanie warstw | Mistral-NeMo-Base-2407 po dalszym treningu |
| Warstwy językowe | 64 | 50 | 40 |
| Wymiar ukryty | 5120 | 4096 | 5120 |
| Atencja | 48 warstw liniowych i 16 warstw pełnej atencji; GQA w warstwach pełnych | 32 głowy zapytań, 8 głów KV, GQA | 32 głowy zapytań, 8 głów KV, GQA |
| Kontekst zadeklarowany przez twórców | 262 144 tokeny natywnie, rozszerzenie do 1 mln | 32 768 natywnie, do 131 072 przez YaRN | 131 072 tokeny w konfiguracji |
| Modalności | tekst, obraz, wideo | tekst | tekst |
| Tryb rozumowania | wbudowany tryb rozumowania thinking, regulowany lub wyłączany | opcjonalny tryb rozumowania przez szablon i moduł odczytujący projektu Bielik | karta modelu nie opisuje osobnego trybu rozumowania |
| Narzędzia | model projektowany do pracy agentowej z popularnymi klientami | wywoływanie narzędzi przez rozszerzony szablon i moduł bielik-tools odczytujący wywołania | karta 2512 nie deklaruje natywnego formatu wywoływania narzędzi |
| Licencja pliku wag | Apache 2.0 | Apache 2.0 oraz dodatkowe warunki Bielik v3 | Apache 2.0 |
Parametry architektury pochodzą z kart, konfiguracji i raportów technicznych modeli. Sama liczba parametrów nie mówi, który model odpowie lepiej po polsku. Dobrze pokazuje za to różnicę w koszcie uruchomienia oraz zakres ambicji każdego projektu.
Czym jest Qwen3.8-27B i do czego służy
Qwen3.8-27B jest największym i najbardziej wszechstronnym modelem w tym zestawieniu. To model gęsty: przy każdym tokenie pracuje cała część językowa o wielkości 27 mld parametrów. Do niej dochodzi 27-warstwowy enkoder obrazu. Model może więc analizować zrzuty ekranu, diagramy, skany dokumentów, obrazy i wideo, a następnie łączyć je z tekstem oraz wywołaniami narzędzi.
Najciekawszym elementem architektury jest układ 64 warstw: trzy warstwy Gated DeltaNet z atencją liniową przeplatają się z jedną warstwą pełnej atencji. Pełna atencja dobrze modeluje zależności między tokenami, lecz jej koszt rośnie szybko wraz z długością wejścia. Warstwy liniowe ograniczają ten koszt. Ten kompromis pomaga obsługiwać natywne okno 262 144 tokenów bez stosowania pełnej atencji w każdej warstwie.
Qwen udostępnia też tryb rozumowania nazywany thinking. Można go wyłączyć przy prostym wydobywaniu pól albo krótkich odpowiedziach, a zwiększyć poziom rozumowania przy debugowaniu, planowaniu czy analizie wieloetapowej. Dla wdrożenia ma to znaczenie, ponieważ dłuższe rozumowanie poprawia część wyników, ale zwiększa czas i liczbę generowanych tokenów.
Kiedy Qwen3.8-27B ma sens
- agent programistyczny pracujący na repozytorium i terminalu;
- analiza zrzutu ekranu, formularza, wykresu albo dokumentu zawierającego obrazy;
- proces łączący wiele narzędzi, na przykład wyszukiwanie, kod, przeglądarkę i API;
- długie zadania, w których model musi utrzymać plan przez wiele kroków;
- jeden model do zadań polskich i międzynarodowych, gdy polszczyzna nie jest jedynym kryterium.
Kiedy Qwen3.8-27B jest przerostem formy
Do klasyfikacji wiadomości, wydobycia kilku pól z tekstu albo pisania krótkich polskich odpowiedzi 27B może zużywać niepotrzebnie dużo VRAM i energii. Pełne okno kontekstowe także nie jest darmowe. Wczytanie 200 tys. tokenów podnosi opóźnienie i zapotrzebowanie na pamięć, nawet jeśli architektura jest wydajniejsza od klasycznego Transformera z pełną atencją w każdej warstwie.
Czym jest Bielik-11B-v3.0-Instruct i do czego służy
Bielik 11B v3 jest modelem tekstowym rozwijanym przez SpeakLeash i ACK Cyfronet AGH. Jego punkt wyjścia stanowi architektura Mistral 7B v0.2. Zespół zwiększył głębokość z 32 do 50 warstw, dodając warstwy do modelu bazowego, a następnie kontynuował trening na danych z 32 języków europejskich. Według raportu 54,25% dokumentów treningowych było polskich, a 20,5% angielskich.
Wariant Instruct przeszedł trening na instrukcjach, DPO, czyli uczenie na parach preferencji, oraz uczenie ze wzmocnieniem. Służy do wykonywania poleceń, generowania odpowiedzi i pracy w aplikacjach. Oficjalne narzędzia projektu dodają format odpowiedzi strukturalnych, wywołania funkcji i opcjonalne rozumowanie dla vLLM. Integracja wymaga właściwego szablonu czatu oraz modułu odczytującego odpowiedź, więc zgodność nie sprowadza się do samego uruchomienia API.
Model ma 32 768 tokenów kontekstu natywnego. Raport opisuje rozszerzenie do 131 072 przez YaRN. Rozszerzone okno należy osobno przetestować na zadaniu firmy, ponieważ możliwość przyjęcia długiego wejścia nie gwarantuje poprawnego odnalezienia i wykorzystania każdej informacji.
Kiedy Bielik 11B v3 ma sens
- klasyfikacja polskich pism, wiadomości i zgłoszeń;
- wydobywanie pól oraz generowanie ustrukturyzowanego JSON;
- redagowanie, korekta i streszczanie polskich tekstów;
- asystent wewnętrzny, który pracuje głównie po polsku;
- mniejszy lokalny agent tekstowy z wywołaniami narzędzi;
- środowisko wielojęzyczne skupione na językach europejskich.
Bielik nie analizuje obrazów ani wideo. Przy skanach faktur lub formularzy potrzebuje wcześniejszego OCR albo osobnego modelu wizyjnego.
Ważne ograniczenie prawne Bielika
Karta modelu podaje Apache 2.0, ale dodatkowe warunki użycia Bielik v3 w wersji 1.1 z 31 lipca 2025 roku zakazują przetwarzania jakichkolwiek danych osobowych. To wyklucza bezpośrednie użycie tej wersji na niezanonimizowanych wiadomościach klientów, dokumentach HR, umowach z danymi osób i wielu procesach obsługowych. Przed wdrożeniem trzeba sprawdzić aktualny tekst warunków i uzgodnić interpretację z prawnikiem. Lokalny serwer nie usuwa tego ograniczenia.
Czym jest PLLuM-12B-chat-2512 i do czego służy
PLLuM to program rozwoju całej rodziny polskich modeli językowych. Obejmuje modele 4B, 8B, 12B i 70B oraz warianty base, instruct i chat na kilku licencjach. Do tego porównania wybieramy otwarty PLLuM-12B-chat-2512, bo jest zbliżony rozmiarem do Bielika 11B i został przygotowany do bezpośredniego dialogu.
Model bazuje na Mistral-NeMo-Base-2407. Ma 40 warstw, wymiar ukryty 5120, 32 głowy zapytań, 8 głów KV i kontekst 131 072 tokenów. Projekt kontynuował trening na korpusach polskich i angielskich, a potem wykorzystał ręcznie tworzone instrukcje, instrukcje RAG oraz pary preferencji oceniane przez ludzi. Wariant chat ma dodatkowe dostrojenie do dialogu, bezpieczeństwa i ogólnego użycia.
Najbardziej konkretna specjalizacja praktyczna PLLuM dotyczy RAG. Karta modelu publikuje gotowy wzorzec polecenia: model ma odpowiadać wyłącznie na podstawie przekazanych dokumentów, dodawać cytowania [0], [1] i odmawiać, gdy kontekst nie zawiera odpowiedzi. To nadal wymaga dobrej wyszukiwarki dokumentów, ponownego rankingu wyników i testów odmowy, ale daje sensowny punkt startowy dla asystenta wiedzy.
Kiedy PLLuM-12B-chat-2512 ma sens
- asystent pracownika korzystający z regulaminów, procedur i zarządzeń;
- chatbot odpowiadający z zatwierdzonej bazy dokumentów;
- streszczanie pism oraz redagowanie korespondencji urzędowej;
- polskie projekty publiczne i regulowane, w których ważne są pochodzenie modelu oraz możliwość wdrożenia we własnej infrastrukturze;
- eksperymenty z RAG, w których potrzebne są cytowania i jasna odpowiedź przy braku podstawy.
PLLuM-12B-chat-2512 jest modelem tekstowym. Jego oficjalna karta nie przedstawia go jako modelu do obrazów, zaawansowanego kodowania ani autonomicznej pracy agentowej. Można otoczyć go narzędziami po stronie aplikacji, ale trzeba samodzielnie zdefiniować format, moduł odczytujący odpowiedź i mechanizm naprawy błędnych wywołań.
Który wariant pobrać
To rozróżnienie jest szczególnie ważne w rodzinie PLLuM:
| Wariant | Do czego służy | Kiedy go nie wybierać |
|---|---|---|
base | dalszy trening, badania, adaptacja domenowa | bezpośrednia rozmowa z użytkownikiem bez własnego dostrojenia |
instruct | wykonywanie konkretnych poleceń, ekstrakcja, transformacja tekstu | swobodny chatbot, jeśli dostępny wariant chat lepiej pasuje do tonu i bezpieczeństwa |
chat | rozmowa, asystent użytkownika, RAG, bezpieczniejsze odpowiedzi ogólne | precyzyjne zadania maszynowe bez porównania z instruct |
W Bieliku porównujemy wariant Instruct, który łączy wykonywanie instrukcji z funkcjami konwersacyjnymi. Qwen3.8-27B jest już dostrojony do wykonywania poleceń i obsługuje zarówno odpowiedzi bezpośrednie, jak i tryb rozumowania thinking.
Ile pamięci GPU potrzeba
Same wagi zajmują w przybliżeniu 2 bajty na parametr w BF16, 1 bajt w 8-bit i 0,5 bajta w 4-bit. Do tego dochodzą pamięć KV, bufory, aktywacje, enkoder obrazu, stos inferencyjny i zapas na równoległe zapytania.
| Model | Same wagi BF16 | Typowy rozmiar wag 4-bit | Praktyczny punkt startowy |
|---|---|---|---|
| Qwen3.8-27B | około 54 GB plus enkoder obrazu | około 16–18 GB z narzutem kwantyzacji | GPU 24 GB dla jednego skwantyzowanego przebiegu z kontrolowanym kontekstem; więcej VRAM dla długiego kontekstu i wielu użytkowników |
| Bielik 11B v3 | około 22 GB | około 6–7 GB | GPU 12–16 GB dla 4-bit; 24 GB daje większy kontekst i swobodniejszy serwer |
| PLLuM 12B 2512 | pliki BF16 mają 24,5 GB | około 7–8 GB | GPU 16 GB dla 4-bit; 24 GB daje większy zapas na kontekst i ruch |
To są szacunki pojemności. Nie opisują szybkości. Kwantyzacja może pogorszyć jakość, zwłaszcza w ekstrakcji, rozumowaniu i generowaniu kodu. Każdy kandydat powinien przejść ten sam test w planowanym formacie liczbowym.
Oficjalna strona PLLuM podaje około 48 GB dla generatora 12B w produkcyjnym systemie RAG bez opisanej kwantyzacji. Ta liczba obejmuje bezpieczniejszy zapas niż same wagi. Nie przeczy możliwości uruchomienia modelu 4-bit na mniejszej karcie, opisuje po prostu inny profil wdrożenia.
Który model najlepiej mówi po polsku
Bielik i PLLuM mają wyraźną przewagę konstrukcyjną: zostały świadomie dotrenowane i dostrojone pod polszczyznę. Qwen3.8 jest mocniejszym modelem ogólnym, lecz jego karta nie podaje osobnego, porównywalnego wyniku dla współczesnej polszczyzny.
Raport Bielik 11B v3 porównał Bielik-11B-v3.0-Instruct ze starszym PLLuM-12B-chat w jednej metodologii. Bielik uzyskał wyższe wyniki między innymi w CPTUB, Polish Medical i PLCC. Raport przygotował zespół Bielika, a użyty PLLuM poprzedza wersję 2512. To dobry powód, aby umieścić Bielika wysoko na krótkiej liście. Wynik nie rozstrzyga porównania z aktualnym PLLuM-12B-chat-2512.
Dwa opublikowane badania RAG na starszych wersjach dodatkowo pokazują, jak bardzo wynik zależy od danych:
- w badaniu dokumentacji platformy low-code Bielik-11B-v2.3-Instruct uzyskał średnio 4,521/5, a PLLuM-12B-nc-chat 4,025/5;
- w badaniu polskiej Wikipedii i pytań PolQA wyższą ocenę uzyskał PLLuM-12B-nc-chat niż Bielik-11B-v2.6-Instruct.
Różne wersje modeli, zbiory treningowe, wyszukiwarki i sposoby oceny dały różną kolejność. Tak właśnie zachowują się modele w realnych systemach. Ogólny ranking ma mniejszą wartość niż test na dokumencie, pytaniu i typie błędu, który występuje w konkretnej firmie.
Który model wybrać do konkretnego zadania
| Zadanie | Pierwszy kandydat | Drugi kandydat | Dlaczego |
|---|---|---|---|
| agent programistyczny | Qwen3.8-27B | Bielik 11B v3 | Qwen publikuje wyniki agentowego kodowania i został zaprojektowany pod długie przebiegi z narzędziami |
| analiza skanów, wykresów i zrzutów ekranu | Qwen3.8-27B | osobny OCR lub model wizyjny plus Bielik/PLLuM | tylko Qwen w tym zestawie ma natywny enkoder obrazu |
| klasyfikacja i ekstrakcja po polsku | Bielik 11B v3 | PLLuM-12B-instruct-2512 | mniejszy Bielik obsługuje odpowiedzi o zadanej strukturze i ma mocne dostrojenie instrukcyjne; wariant PLLuM instruct także powinien wejść do testu |
| asystent procedur i regulaminów | PLLuM-12B-chat-2512 | Bielik 11B v3 | PLLuM publikuje szablon RAG z cytowaniem oraz odmową przy braku odpowiedzi |
| polskie redagowanie i korekta | Bielik 11B v3 | PLLuM-12B-chat-2512 | oba są specjalizowane językowo; ton i terminologia wymagają próby na tekstach firmy |
| długi raport z tabelami i obrazami | Qwen3.8-27B | OCR plus Bielik lub PLLuM | Qwen łączy długi kontekst z analizą wizualną |
| dane osobowe w lokalnym procesie | PLLuM lub Qwen po analizie prawnej | Bielik dopiero po zmianie lub wyjaśnieniu jego warunków | warunki Bielik v3 wprost zakazują przetwarzania danych osobowych |
| dalszy trening modelu domenowego | wariant base Bielika lub PLLuM | Qwen, jeśli domena wymaga obrazu, kodu albo szerokiej wiedzy | do treningu wybiera się model bazowy i osobno projektuje późniejsze dostrojenie |
„Pierwszy kandydat” oznacza kolejność testowania. Nie oznacza automatycznego zwycięzcy.
Co mówią realne testy Qwena na RTX 3090
Uruchomiliśmy Qwen3.8-27B w W4A16 na RTX 3090 z 24 GB VRAM przez zmodyfikowany vLLM. W długiej naprawie repozytorium Go model z Qwen Code zdobył 100/100 w 502,14 s. Ten sam model w innym programie sterującym osiągnął 87/100, a przez warstwę zgodności Claude Code 98/100. W krótszym zadaniu importu CSV Qwen Code zaliczył 4/5 ukrytych testów, a OpenCode 5/5.
To praktyczny dowód dwóch rzeczy. Qwen3.8-27B można uruchomić w kwantyzacji na pojedynczej karcie 24 GB, a warstwa agentowa potrafi zmienić wynik równie mocno jak sam model. Te przebiegi nie porównują Bielika ani PLLuM, więc nie używamy ich do rankingu polskich modeli. Pełne dane są w wynikach Qwen3.8-27B na RTX 3090 oraz w porównaniu programów sterujących.
Jak przeprowadzić uczciwe porównanie w firmie
Przygotuj 50–100 zanonimizowanych przykładów z jednego procesu. Dla każdego zapisz oczekiwaną odpowiedź, dozwolone źródła, format wyniku i sytuacje wymagające odmowy albo decyzji człowieka. Następnie uruchom dokładne wersje modeli w tej samej kwantyzacji lub osobno oznacz koszt różnego formatu.
Mierz co najmniej:
- poprawność merytoryczną i zgodność z regułami procesu;
- kompletność wymaganych pól;
- poprawność cytatów oraz odsetek odpowiedzi bez podstawy;
- poprawność JSON i wywołań narzędzi;
- czas do pierwszego tokenu i czas całej odpowiedzi;
- użycie VRAM przy docelowym kontekście i liczbie użytkowników;
- liczbę spraw wymagających korekty człowieka;
- wpływ kwantyzacji na te same przykłady.
W teście RAG każdy model musi dostać te same fragmenty dokumentów. Osobno trzeba zmierzyć jakość wyszukiwania, ponieważ dobry generator nie naprawi sytuacji, w której wyszukiwarka podała niewłaściwy regulamin.
Ostateczny wybór zależy od zadania
Qwen3.8-27B oferuje najszerszy zakres funkcji: kod, narzędzia, rozumowanie, obraz, wideo i długi kontekst. Płaci się za to większym modelem i bardziej wymagającym serwowaniem. Bielik-11B-v3.0-Instruct jest najbardziej interesującym kompaktowym kandydatem do polskich zadań tekstowych oraz lokalnych automatyzacji, ale jego aktualne dodatkowe warunki blokują procesy z danymi osobowymi. PLLuM-12B-chat-2512 ma najlepiej opisaną ścieżkę do polskiego asystenta wiedzy i administracyjnego RAG, a rodzina daje osobne warianty do dialogu, instrukcji i dalszego treningu.
W praktyce sensowna krótka lista często zawiera dwa modele. Dla kodu i materiałów wizualnych będą to Qwen oraz jeden polski specjalista. Dla czysto polskiego RAG będą to aktualne wersje Bielika i PLLuM uruchomione na tych samych dokumentach. Decyzję podejmuje się po wyniku procesu, koszcie obsługi i ograniczeniach prawnych.
Jeśli chcesz wykonać takie porównanie na własnych sprawach, bezpłatny skan procesu pozwoli określić zadanie, dane i próg jakości. Syntalith może potem zbudować zestaw ewaluacyjny, uruchomić modele w odizolowanym środowisku i wdrożyć wybrany wariant wraz z RAG, uprawnieniami oraz monitoringiem.
Źródła techniczne
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces