Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Qwen3.8, Bielik czy PLLuM? Porównanie modeli bez skrótów

Qwen3.8-27B, Bielik-11B-v3.0-Instruct i PLLuM-12B-chat-2512: architektura, parametry, kontekst, sprzęt, licencje, zastosowania i wyniki.

Autor

Syntalith

Opublikowano Zaktualizowano 10 min czytania

Qwen3.8-27B jest dużym modelem ogólnego zastosowania do kodu, zadań agentowych oraz pracy z tekstem, obrazem i wideo. Bielik-11B-v3.0-Instruct to tekstowy model europejski zoptymalizowany pod język polski. PLLuM-12B-chat-2512 to tekstowy model polski rozwijany z myślą o administracji, dialogu i RAG. Różnią się architekturą, rozmiarem, kontekstem, wymaganiami sprzętowymi oraz dojrzałością integracji.

Najkrótsza rekomendacja wygląda tak:

  • Qwen3.8-27B wybierz do kodu, obsługi narzędzi, analizy obrazów i bardzo długich materiałów, jeśli akceptujesz większy koszt infrastruktury.
  • Bielik-11B-v3.0-Instruct sprawdź jako pierwszy model do polskich zadań tekstowych, ekstrakcji, klasyfikacji, redagowania i mniejszego lokalnego agenta.
  • PLLuM-12B-chat-2512 sprawdź jako pierwszy do polskiego asystenta wiedzy, szczególnie dla dokumentów urzędowych, regulaminów, procedur i kontrolowanego RAG.

Żadna z tych rekomendacji nie zastępuje testu na danych firmy. Wyjaśnia jednak, od którego modelu warto zacząć.

Jakie dokładnie modele porównujemy

Nazwy „Bielik” i „PLLuM” oznaczają całe rodziny. Porównanie bez numeru wersji, rozmiaru i typu wersji modelu jest bezużyteczne. W tym artykule zestawiamy trzy modele gotowe do rozmowy lub wykonywania instrukcji:

  1. Qwen/Qwen3.8-27B, post-trenowany model Qwen z 27 mld parametrów językowych i enkoderem obrazu.
  2. speakleash/Bielik-11B-v3.0-Instruct, wariant instrukcyjny Bielika 11B v3.
  3. CYFRAGOVPL/PLLuM-12B-chat-2512, wariant dialogowy drugiej generacji PLLuM z grudnia 2025 roku.

Starsze publikacje używały między innymi Bielika v2.3, Bielika v2.6 i PLLuM-12B-nc-chat-2412. Ich wyniki nadal są informacyjne, ale nie opisują bezpośrednio powyższych wersji.

Porównanie techniczne Qwen3.8, Bielika i PLLuM

CechaQwen3.8-27BBielik-11B-v3.0-InstructPLLuM-12B-chat-2512
Główne przeznaczeniekod, agenci, narzędzia, praca biurowa, analiza wizualnapolskie i europejskie zadania tekstowe, instrukcje, lokalne automatyzacjepolski dialog, administracja, streszczanie i RAG
Parametry27 mld w części językowej oraz osobny enkoder obrazuokoło 11 mldokoło 12 mld
Typgęsty model przyczynowy z enkoderem obrazugęsty model dekoderowygęsty model dekoderowy
Fundament architekturyhybryda Gated DeltaNet i pełnej atencjiMistral 7B v0.2 powiększony przez dodanie warstwMistral-NeMo-Base-2407 po dalszym treningu
Warstwy językowe645040
Wymiar ukryty512040965120
Atencja48 warstw liniowych i 16 warstw pełnej atencji; GQA w warstwach pełnych32 głowy zapytań, 8 głów KV, GQA32 głowy zapytań, 8 głów KV, GQA
Kontekst zadeklarowany przez twórców262 144 tokeny natywnie, rozszerzenie do 1 mln32 768 natywnie, do 131 072 przez YaRN131 072 tokeny w konfiguracji
Modalnościtekst, obraz, wideoteksttekst
Tryb rozumowaniawbudowany tryb rozumowania thinking, regulowany lub wyłączanyopcjonalny tryb rozumowania przez szablon i moduł odczytujący projektu Bielikkarta modelu nie opisuje osobnego trybu rozumowania
Narzędziamodel projektowany do pracy agentowej z popularnymi klientamiwywoływanie narzędzi przez rozszerzony szablon i moduł bielik-tools odczytujący wywołaniakarta 2512 nie deklaruje natywnego formatu wywoływania narzędzi
Licencja pliku wagApache 2.0Apache 2.0 oraz dodatkowe warunki Bielik v3Apache 2.0

Parametry architektury pochodzą z kart, konfiguracji i raportów technicznych modeli. Sama liczba parametrów nie mówi, który model odpowie lepiej po polsku. Dobrze pokazuje za to różnicę w koszcie uruchomienia oraz zakres ambicji każdego projektu.

Czym jest Qwen3.8-27B i do czego służy

Qwen3.8-27B jest największym i najbardziej wszechstronnym modelem w tym zestawieniu. To model gęsty: przy każdym tokenie pracuje cała część językowa o wielkości 27 mld parametrów. Do niej dochodzi 27-warstwowy enkoder obrazu. Model może więc analizować zrzuty ekranu, diagramy, skany dokumentów, obrazy i wideo, a następnie łączyć je z tekstem oraz wywołaniami narzędzi.

Najciekawszym elementem architektury jest układ 64 warstw: trzy warstwy Gated DeltaNet z atencją liniową przeplatają się z jedną warstwą pełnej atencji. Pełna atencja dobrze modeluje zależności między tokenami, lecz jej koszt rośnie szybko wraz z długością wejścia. Warstwy liniowe ograniczają ten koszt. Ten kompromis pomaga obsługiwać natywne okno 262 144 tokenów bez stosowania pełnej atencji w każdej warstwie.

Qwen udostępnia też tryb rozumowania nazywany thinking. Można go wyłączyć przy prostym wydobywaniu pól albo krótkich odpowiedziach, a zwiększyć poziom rozumowania przy debugowaniu, planowaniu czy analizie wieloetapowej. Dla wdrożenia ma to znaczenie, ponieważ dłuższe rozumowanie poprawia część wyników, ale zwiększa czas i liczbę generowanych tokenów.

Kiedy Qwen3.8-27B ma sens

  • agent programistyczny pracujący na repozytorium i terminalu;
  • analiza zrzutu ekranu, formularza, wykresu albo dokumentu zawierającego obrazy;
  • proces łączący wiele narzędzi, na przykład wyszukiwanie, kod, przeglądarkę i API;
  • długie zadania, w których model musi utrzymać plan przez wiele kroków;
  • jeden model do zadań polskich i międzynarodowych, gdy polszczyzna nie jest jedynym kryterium.

Kiedy Qwen3.8-27B jest przerostem formy

Do klasyfikacji wiadomości, wydobycia kilku pól z tekstu albo pisania krótkich polskich odpowiedzi 27B może zużywać niepotrzebnie dużo VRAM i energii. Pełne okno kontekstowe także nie jest darmowe. Wczytanie 200 tys. tokenów podnosi opóźnienie i zapotrzebowanie na pamięć, nawet jeśli architektura jest wydajniejsza od klasycznego Transformera z pełną atencją w każdej warstwie.

Czym jest Bielik-11B-v3.0-Instruct i do czego służy

Bielik 11B v3 jest modelem tekstowym rozwijanym przez SpeakLeash i ACK Cyfronet AGH. Jego punkt wyjścia stanowi architektura Mistral 7B v0.2. Zespół zwiększył głębokość z 32 do 50 warstw, dodając warstwy do modelu bazowego, a następnie kontynuował trening na danych z 32 języków europejskich. Według raportu 54,25% dokumentów treningowych było polskich, a 20,5% angielskich.

Wariant Instruct przeszedł trening na instrukcjach, DPO, czyli uczenie na parach preferencji, oraz uczenie ze wzmocnieniem. Służy do wykonywania poleceń, generowania odpowiedzi i pracy w aplikacjach. Oficjalne narzędzia projektu dodają format odpowiedzi strukturalnych, wywołania funkcji i opcjonalne rozumowanie dla vLLM. Integracja wymaga właściwego szablonu czatu oraz modułu odczytującego odpowiedź, więc zgodność nie sprowadza się do samego uruchomienia API.

Model ma 32 768 tokenów kontekstu natywnego. Raport opisuje rozszerzenie do 131 072 przez YaRN. Rozszerzone okno należy osobno przetestować na zadaniu firmy, ponieważ możliwość przyjęcia długiego wejścia nie gwarantuje poprawnego odnalezienia i wykorzystania każdej informacji.

Kiedy Bielik 11B v3 ma sens

  • klasyfikacja polskich pism, wiadomości i zgłoszeń;
  • wydobywanie pól oraz generowanie ustrukturyzowanego JSON;
  • redagowanie, korekta i streszczanie polskich tekstów;
  • asystent wewnętrzny, który pracuje głównie po polsku;
  • mniejszy lokalny agent tekstowy z wywołaniami narzędzi;
  • środowisko wielojęzyczne skupione na językach europejskich.

Bielik nie analizuje obrazów ani wideo. Przy skanach faktur lub formularzy potrzebuje wcześniejszego OCR albo osobnego modelu wizyjnego.

Ważne ograniczenie prawne Bielika

Karta modelu podaje Apache 2.0, ale dodatkowe warunki użycia Bielik v3 w wersji 1.1 z 31 lipca 2025 roku zakazują przetwarzania jakichkolwiek danych osobowych. To wyklucza bezpośrednie użycie tej wersji na niezanonimizowanych wiadomościach klientów, dokumentach HR, umowach z danymi osób i wielu procesach obsługowych. Przed wdrożeniem trzeba sprawdzić aktualny tekst warunków i uzgodnić interpretację z prawnikiem. Lokalny serwer nie usuwa tego ograniczenia.

Czym jest PLLuM-12B-chat-2512 i do czego służy

PLLuM to program rozwoju całej rodziny polskich modeli językowych. Obejmuje modele 4B, 8B, 12B i 70B oraz warianty base, instruct i chat na kilku licencjach. Do tego porównania wybieramy otwarty PLLuM-12B-chat-2512, bo jest zbliżony rozmiarem do Bielika 11B i został przygotowany do bezpośredniego dialogu.

Model bazuje na Mistral-NeMo-Base-2407. Ma 40 warstw, wymiar ukryty 5120, 32 głowy zapytań, 8 głów KV i kontekst 131 072 tokenów. Projekt kontynuował trening na korpusach polskich i angielskich, a potem wykorzystał ręcznie tworzone instrukcje, instrukcje RAG oraz pary preferencji oceniane przez ludzi. Wariant chat ma dodatkowe dostrojenie do dialogu, bezpieczeństwa i ogólnego użycia.

Najbardziej konkretna specjalizacja praktyczna PLLuM dotyczy RAG. Karta modelu publikuje gotowy wzorzec polecenia: model ma odpowiadać wyłącznie na podstawie przekazanych dokumentów, dodawać cytowania [0], [1] i odmawiać, gdy kontekst nie zawiera odpowiedzi. To nadal wymaga dobrej wyszukiwarki dokumentów, ponownego rankingu wyników i testów odmowy, ale daje sensowny punkt startowy dla asystenta wiedzy.

Kiedy PLLuM-12B-chat-2512 ma sens

  • asystent pracownika korzystający z regulaminów, procedur i zarządzeń;
  • chatbot odpowiadający z zatwierdzonej bazy dokumentów;
  • streszczanie pism oraz redagowanie korespondencji urzędowej;
  • polskie projekty publiczne i regulowane, w których ważne są pochodzenie modelu oraz możliwość wdrożenia we własnej infrastrukturze;
  • eksperymenty z RAG, w których potrzebne są cytowania i jasna odpowiedź przy braku podstawy.

PLLuM-12B-chat-2512 jest modelem tekstowym. Jego oficjalna karta nie przedstawia go jako modelu do obrazów, zaawansowanego kodowania ani autonomicznej pracy agentowej. Można otoczyć go narzędziami po stronie aplikacji, ale trzeba samodzielnie zdefiniować format, moduł odczytujący odpowiedź i mechanizm naprawy błędnych wywołań.

Który wariant pobrać

To rozróżnienie jest szczególnie ważne w rodzinie PLLuM:

WariantDo czego służyKiedy go nie wybierać
basedalszy trening, badania, adaptacja domenowabezpośrednia rozmowa z użytkownikiem bez własnego dostrojenia
instructwykonywanie konkretnych poleceń, ekstrakcja, transformacja tekstuswobodny chatbot, jeśli dostępny wariant chat lepiej pasuje do tonu i bezpieczeństwa
chatrozmowa, asystent użytkownika, RAG, bezpieczniejsze odpowiedzi ogólneprecyzyjne zadania maszynowe bez porównania z instruct

W Bieliku porównujemy wariant Instruct, który łączy wykonywanie instrukcji z funkcjami konwersacyjnymi. Qwen3.8-27B jest już dostrojony do wykonywania poleceń i obsługuje zarówno odpowiedzi bezpośrednie, jak i tryb rozumowania thinking.

Ile pamięci GPU potrzeba

Same wagi zajmują w przybliżeniu 2 bajty na parametr w BF16, 1 bajt w 8-bit i 0,5 bajta w 4-bit. Do tego dochodzą pamięć KV, bufory, aktywacje, enkoder obrazu, stos inferencyjny i zapas na równoległe zapytania.

ModelSame wagi BF16Typowy rozmiar wag 4-bitPraktyczny punkt startowy
Qwen3.8-27Bokoło 54 GB plus enkoder obrazuokoło 16–18 GB z narzutem kwantyzacjiGPU 24 GB dla jednego skwantyzowanego przebiegu z kontrolowanym kontekstem; więcej VRAM dla długiego kontekstu i wielu użytkowników
Bielik 11B v3około 22 GBokoło 6–7 GBGPU 12–16 GB dla 4-bit; 24 GB daje większy kontekst i swobodniejszy serwer
PLLuM 12B 2512pliki BF16 mają 24,5 GBokoło 7–8 GBGPU 16 GB dla 4-bit; 24 GB daje większy zapas na kontekst i ruch

To są szacunki pojemności. Nie opisują szybkości. Kwantyzacja może pogorszyć jakość, zwłaszcza w ekstrakcji, rozumowaniu i generowaniu kodu. Każdy kandydat powinien przejść ten sam test w planowanym formacie liczbowym.

Oficjalna strona PLLuM podaje około 48 GB dla generatora 12B w produkcyjnym systemie RAG bez opisanej kwantyzacji. Ta liczba obejmuje bezpieczniejszy zapas niż same wagi. Nie przeczy możliwości uruchomienia modelu 4-bit na mniejszej karcie, opisuje po prostu inny profil wdrożenia.

Który model najlepiej mówi po polsku

Bielik i PLLuM mają wyraźną przewagę konstrukcyjną: zostały świadomie dotrenowane i dostrojone pod polszczyznę. Qwen3.8 jest mocniejszym modelem ogólnym, lecz jego karta nie podaje osobnego, porównywalnego wyniku dla współczesnej polszczyzny.

Raport Bielik 11B v3 porównał Bielik-11B-v3.0-Instruct ze starszym PLLuM-12B-chat w jednej metodologii. Bielik uzyskał wyższe wyniki między innymi w CPTUB, Polish Medical i PLCC. Raport przygotował zespół Bielika, a użyty PLLuM poprzedza wersję 2512. To dobry powód, aby umieścić Bielika wysoko na krótkiej liście. Wynik nie rozstrzyga porównania z aktualnym PLLuM-12B-chat-2512.

Dwa opublikowane badania RAG na starszych wersjach dodatkowo pokazują, jak bardzo wynik zależy od danych:

Różne wersje modeli, zbiory treningowe, wyszukiwarki i sposoby oceny dały różną kolejność. Tak właśnie zachowują się modele w realnych systemach. Ogólny ranking ma mniejszą wartość niż test na dokumencie, pytaniu i typie błędu, który występuje w konkretnej firmie.

Który model wybrać do konkretnego zadania

ZadaniePierwszy kandydatDrugi kandydatDlaczego
agent programistycznyQwen3.8-27BBielik 11B v3Qwen publikuje wyniki agentowego kodowania i został zaprojektowany pod długie przebiegi z narzędziami
analiza skanów, wykresów i zrzutów ekranuQwen3.8-27Bosobny OCR lub model wizyjny plus Bielik/PLLuMtylko Qwen w tym zestawie ma natywny enkoder obrazu
klasyfikacja i ekstrakcja po polskuBielik 11B v3PLLuM-12B-instruct-2512mniejszy Bielik obsługuje odpowiedzi o zadanej strukturze i ma mocne dostrojenie instrukcyjne; wariant PLLuM instruct także powinien wejść do testu
asystent procedur i regulaminówPLLuM-12B-chat-2512Bielik 11B v3PLLuM publikuje szablon RAG z cytowaniem oraz odmową przy braku odpowiedzi
polskie redagowanie i korektaBielik 11B v3PLLuM-12B-chat-2512oba są specjalizowane językowo; ton i terminologia wymagają próby na tekstach firmy
długi raport z tabelami i obrazamiQwen3.8-27BOCR plus Bielik lub PLLuMQwen łączy długi kontekst z analizą wizualną
dane osobowe w lokalnym procesiePLLuM lub Qwen po analizie prawnejBielik dopiero po zmianie lub wyjaśnieniu jego warunkówwarunki Bielik v3 wprost zakazują przetwarzania danych osobowych
dalszy trening modelu domenowegowariant base Bielika lub PLLuMQwen, jeśli domena wymaga obrazu, kodu albo szerokiej wiedzydo treningu wybiera się model bazowy i osobno projektuje późniejsze dostrojenie

„Pierwszy kandydat” oznacza kolejność testowania. Nie oznacza automatycznego zwycięzcy.

Co mówią realne testy Qwena na RTX 3090

Uruchomiliśmy Qwen3.8-27B w W4A16 na RTX 3090 z 24 GB VRAM przez zmodyfikowany vLLM. W długiej naprawie repozytorium Go model z Qwen Code zdobył 100/100 w 502,14 s. Ten sam model w innym programie sterującym osiągnął 87/100, a przez warstwę zgodności Claude Code 98/100. W krótszym zadaniu importu CSV Qwen Code zaliczył 4/5 ukrytych testów, a OpenCode 5/5.

To praktyczny dowód dwóch rzeczy. Qwen3.8-27B można uruchomić w kwantyzacji na pojedynczej karcie 24 GB, a warstwa agentowa potrafi zmienić wynik równie mocno jak sam model. Te przebiegi nie porównują Bielika ani PLLuM, więc nie używamy ich do rankingu polskich modeli. Pełne dane są w wynikach Qwen3.8-27B na RTX 3090 oraz w porównaniu programów sterujących.

Jak przeprowadzić uczciwe porównanie w firmie

Przygotuj 50–100 zanonimizowanych przykładów z jednego procesu. Dla każdego zapisz oczekiwaną odpowiedź, dozwolone źródła, format wyniku i sytuacje wymagające odmowy albo decyzji człowieka. Następnie uruchom dokładne wersje modeli w tej samej kwantyzacji lub osobno oznacz koszt różnego formatu.

Mierz co najmniej:

  • poprawność merytoryczną i zgodność z regułami procesu;
  • kompletność wymaganych pól;
  • poprawność cytatów oraz odsetek odpowiedzi bez podstawy;
  • poprawność JSON i wywołań narzędzi;
  • czas do pierwszego tokenu i czas całej odpowiedzi;
  • użycie VRAM przy docelowym kontekście i liczbie użytkowników;
  • liczbę spraw wymagających korekty człowieka;
  • wpływ kwantyzacji na te same przykłady.

W teście RAG każdy model musi dostać te same fragmenty dokumentów. Osobno trzeba zmierzyć jakość wyszukiwania, ponieważ dobry generator nie naprawi sytuacji, w której wyszukiwarka podała niewłaściwy regulamin.

Ostateczny wybór zależy od zadania

Qwen3.8-27B oferuje najszerszy zakres funkcji: kod, narzędzia, rozumowanie, obraz, wideo i długi kontekst. Płaci się za to większym modelem i bardziej wymagającym serwowaniem. Bielik-11B-v3.0-Instruct jest najbardziej interesującym kompaktowym kandydatem do polskich zadań tekstowych oraz lokalnych automatyzacji, ale jego aktualne dodatkowe warunki blokują procesy z danymi osobowymi. PLLuM-12B-chat-2512 ma najlepiej opisaną ścieżkę do polskiego asystenta wiedzy i administracyjnego RAG, a rodzina daje osobne warianty do dialogu, instrukcji i dalszego treningu.

W praktyce sensowna krótka lista często zawiera dwa modele. Dla kodu i materiałów wizualnych będą to Qwen oraz jeden polski specjalista. Dla czysto polskiego RAG będą to aktualne wersje Bielika i PLLuM uruchomione na tych samych dokumentach. Decyzję podejmuje się po wyniku procesu, koszcie obsługi i ograniczeniach prawnych.

Jeśli chcesz wykonać takie porównanie na własnych sprawach, bezpłatny skan procesu pozwoli określić zadanie, dane i próg jakości. Syntalith może potem zbudować zestaw ewaluacyjny, uruchomić modele w odizolowanym środowisku i wdrożyć wybrany wariant wraz z RAG, uprawnieniami oraz monitoringiem.

Źródła techniczne

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze