Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Qwen3.8, Bielik czy PLLuM? Porównanie pod konkretne zadanie

Porównujemy Qwen3.8-27B, Bielik-11B-v3.0-Instruct i PLLuM-12B-chat-2512 pod kątem parametrów, architektury, polskiego języka, licencji, sprzętu i wdrożenia.

Autor

Syntalith

Opublikowano Zaktualizowano 7 min czytania

Qwen3.8-27B, Bielik-11B-v3.0-Instruct i PLLuM-12B-chat-2512 rozwiązują różne problemy. Qwen łączy tekst, obraz, wideo, długi kontekst i pracę z narzędziami. Bielik koncentruje się na tekście w językach europejskich, z mocnym udziałem polskiego. PLLuM rozwija rodzinę modeli do polskiego dialogu, instrukcji i pracy z wiedzą.

Najlepszy wybór zależy od procesu, danych i kosztu błędu. Dobrym początkiem jest:

  • Qwen do kodu, wizji, wielu narzędzi i bardzo długich wejść;
  • Bielik do polskiej klasyfikacji, ekstrakcji, redakcji i mniejszego lokalnego agenta tekstowego;
  • PLLuM do asystenta opartego na polskich regulaminach, procedurach i dokumentach.

To kolejność testowania oparta na deklarowanych możliwościach i opisanym przeznaczeniu modeli. Nie wykonywaliśmy wspólnego testu tych trzech wersji. Wynik na danych firmy rozstrzyga wdrożenie.

Jakie wersje porównujemy

„Bielik” i „PLLuM” oznaczają rodziny modeli. Dlatego podajemy dokładną wersję modelu:

  1. Qwen/Qwen3.8-27B, dostrojony model z 27 mld parametrów w części językowej i osobnym enkoderem wizji.
  2. speakleash/Bielik-11B-v3.0-Instruct, wariant instrukcyjny Bielika 11B v3.
  3. CYFRAGOVPL/PLLuM-12B-chat-2512, wariant dialogowy linii PLLuM 2512.

Starsze badania używają między innymi Bielik-11B-v2.3-Instruct, Bielik-11B-v2.6-Instruct i PLLuM-12B-nc-chat. Ich liczby są wynikami tamtych wersji. Nie przenosimy ich automatycznie na trzy wersje z tego porównania.

Karta techniczna

CechaQwen3.8-27BBielik-11B-v3.0-InstructPLLuM-12B-chat-2512
Parametry27B w części językowej; osobny enkoder wizjiokoło 11Bokoło 12B
Rodzajgęsty model przyczynowy z wizjągęsty model dekoderowygęsty model dekoderowy
Architektura64 warstwy; trzy Gated DeltaNet i jedna pełnej atencji powtarzane 16 razyrodzina oparta na Mistral 7B v0.2, 50 warstw według raportu v3oparty na Mistral-NeMo-Base-2407, 40 warstw według karty wariantu
Wymiar ukryty512040965120
Kontekst262 144 tokeny natywnie; Qwen opisuje rozszerzenie do 1M przez YaRN32 768 natywnie; raport opisuje rozszerzenie do 131 072 przez YaRN131 072 tokeny w konfiguracji wariantu
Modalnościtekst, obraz, wideoteksttekst
Tryb rozumowaniawbudowany thinking, regulowany albo wyłączanyintegracja przez szablon i narzędzia projektukarta wariantu nie opisuje osobnego trybu rozumowania
LicencjaApache 2.0Apache 2.0 na karcie oraz dodatkowe warunki v3Apache 2.0 na karcie wariantu

Parametry i architekturę podajemy za kartami, konfiguracjami i raportami wskazanymi w źródłach. Nie wykonaliśmy tu wspólnego testu na tych samych zadaniach. Rozmiar pomaga przewidzieć wymagania pamięci, lecz nie zastępuje testu polskich odpowiedzi.

Qwen3.8-27B do kodu, obrazu i długich wejść

Qwen jest największym modelem w tym zestawieniu. Gęsta część językowa ma 27B parametrów. Osobny enkoder obrazu pozwala przyjmować materiały wizualne, a karta opisuje także wideo. Tryb thinking można wyłączyć dla prostego wydobywania pól albo zostawić przy debugowaniu i planowaniu.

Układ warstw łączy 48 bloków Gated DeltaNet z 16 blokami pełnej, bramkowanej atencji. Taka hybryda wspiera długie wejścia. Natywny limit 262 144 tokenów nadal oznacza koszt pamięci i czasu. W naszym teście trzy fakty z początku, środka i końca syntetycznego tekstu zostały zwrócone przy 230 085 tokenach, lecz przebieg trwał 563,4 s.

Qwen warto najpierw przetestować w zadaniach takich jak:

  • praca agenta programistycznego w repozytorium;
  • proces łączący terminal, przeglądarkę, API i dokumenty;
  • analiza wykresów, formularzy, zrzutów ekranu i skanów;
  • długie, wieloetapowe zadanie, gdy jedna sesja ma zachować szeroki kontekst.

Do krótkiej klasyfikacji albo kilku pól w formularzu model może być kosztowny względem mniejszego modelu lub programu deterministycznego.

Bielik-11B-v3.0-Instruct do pracy z polskim tekstem

Bielik v3 jest rozwijany przez SpeakLeash i ACK Cyfronet AGH. Oficjalna karta opisuje 11B, 33 języki i ponad 20 mln instrukcji obejmujących 17 mld tokenów. Raport techniczny opisuje bazę Mistral 7B v0.2, zwiększenie głębokości do 50 warstw oraz dalszy trening na danych europejskich.

Wariant Instruct służy do wykonywania poleceń, transformacji tekstu i odpowiedzi w aplikacji. Projekt Bielik publikuje narzędzia do odpowiedzi strukturalnych, wywołań funkcji i opcjonalnego rozumowania. Zgodność wymaga właściwego szablonu oraz modułu odczytującego odpowiedź wybranego serwera.

Bielik warto najpierw przetestować przy:

  • klasyfikacji polskich pism, wiadomości i zgłoszeń;
  • ekstrakcji pól oraz odpowiedzi JSON;
  • korekty, redakcji i streszczeń po polsku;
  • lokalnego asystenta tekstowego z umiarkowanym kontekstem.

Karta tego wariantu opisuje tekst. Skan faktury wymaga OCR albo osobnego modelu wizji.

Licencja Bielika a dane osobowe

Karta wskazuje Apache 2.0, a dodatkowe warunki Bielik v3 zawierają dalsze ograniczenia. Wersja 1.1 z 31 lipca 2025 roku zakazuje przetwarzania danych osobowych. Przed użyciem w wiadomościach klientów, HR lub umowach trzeba przeczytać aktualny tekst i uzyskać ocenę prawną. Lokalny serwer nie zmienia treści licencji.

PLLuM-12B-chat-2512 do dialogu i RAG po polsku

PLLuM jest rodziną, w której występują różne rozmiary i warianty base, instruct oraz chat. Porównujemy PLLuM-12B-chat-2512, model dialogowy oparty na Mistral-NeMo-Base-2407. Karta wariantu podaje 12B, 40 warstw, wymiar ukryty 5120 i kontekst 131 072 tokenów.

Karta wariantu chat opisuje użycie tego modelu w rozmowie z pracownikiem i jako asystenta dokumentowego. Publikuje też wzorzec RAG, w którym model ma odpowiadać na podstawie dostarczonego kontekstu, dodawać odwołania [0] i [1] oraz sygnalizować brak odpowiedzi. Wdrożenie nadal potrzebuje wyszukiwarki, kontroli dostępu i testu odmowy.

PLLuM warto przetestować przy:

  • asystencie korzystającym z regulaminów, procedur i decyzji;
  • streszczaniu polskiej korespondencji;
  • RAG z wymaganymi cytowaniami i jasno określonym źródłem;
  • projekcie, w którym ważna jest możliwość utrzymania modelu we własnym środowisku.

Oficjalna karta tej wersji opisuje model tekstowy. Obraz, autonomiczne narzędzia i zaawansowane kodowanie wymagają osobnych komponentów i testów.

Wariant ma znaczenie

WariantNajlepszy punkt wyjściaPraca, która wymaga ostrożności
basedalszy trening i badaniarozmowa z użytkownikiem bez własnego dostrojenia
instructekstrakcja, klasyfikacja i transformacjaswobodny dialog, jeśli lepiej pasuje chat
chatasystent, rozmowa i RAGścisłe formaty maszynowe bez testu wariantu instruct

Nazwy rodziny nie wystarczają do decyzji o licencji, kontekście ani formacie polecenia. Zapisz identyfikator repozytorium, wersję plików i użyty szablon.

Sprzęt i sposób wdrożenia

Przybliżenie dla samych wag wynosi około 2 bajtów na parametr w BF16, 1 bajt w 8-bit i 0,5 bajta w 4-bit. Dochodzą pamięć kontekstu, bufory, aktywacje, enkoder wizji i zapas dla równoległych żądań.

ModelSame wagi BF16Orientacyjne wagi 4-bitPunkt startowy
Qwen3.8-27Bokoło 54 GB plus enkoder wizjiokoło 16–18 GB z narzutem24 GB dla kontrolowanego, pojedynczego przebiegu; dłuższy kontekst wymaga pomiaru
Bielik 11B v3około 22 GBokoło 6–7 GB12–16 GB dla 4-bit; dodatkowy zapas poprawia kontekst
PLLuM 12B 2512pliki BF16 około 24,5 GBokoło 7–8 GB16 GB dla 4-bit; 24 GB daje większy margines

To są szacunki pojemności. Nie są porównaniem szybkości ani jakości. Kwantyzację trzeba ocenić na tych samych przypadkach.

Licencja wag nie opisuje całego wdrożenia. Sprawdź także warunki wariantu, źródło obrazu serwera, prawa do danych, retencję, dostęp użytkowników i narzędzia, które model może wywołać. API zarządzane zwykle upraszcza utrzymanie. Serwer lokalny może lepiej pasować do wymagań dotyczących trasy danych, lecz wymaga właściciela aktualizacji, monitoringu i oceny jakości.

Co wiemy o polskim języku

Bielik i PLLuM zostały rozwijane z wyraźnym celem pracy z językiem polskim. Qwen jest szerszym modelem ogólnym, a jego karta nie publikuje porównywalnego, osobnego wyniku dla współczesnej polszczyzny. Z tego nie wynika automatyczny zwycięzca.

Raport Bielik v3 porównuje Bielik z wcześniejszą wersją PLLuM i pokazuje wyższe wyniki Bielika w wybranych testach. Raport powstał po stronie zespołu Bielika, a użyty PLLuM poprzedza wersję 2512. W dwóch badaniach RAG starsze wersje dały różną kolejność: Bielik-11B-v2.3-Instruct uzyskał 4,521/5 w teście dokumentacji low-code, a PLLuM-12B-nc-chat wyższą ocenę niż Bielik-11B-v2.6-Instruct w badaniu PolQA. Te wyniki zależą od korpusu, wyszukiwarki, polecenia, osoby oceniającej i wersji modelu.

Najuczciwszy test firmy używa tych samych polskich przykładów, źródeł, reguł odmowy i formatu wyjścia dla każdej wersji modelu.

Kolejność testów według zadania

ZadanieZacznij odDodaj do porównaniaDlaczego
agent kodowyQwen3.8-27BBielik 11B v3Qwen ma wizję, długi kontekst i profil narzędziowy
skany, wykresy, zrzutyQwen3.8-27BOCR plus Bielik lub PLLuMQwen ma natywną ścieżkę wizji
polska klasyfikacja i ekstrakcjaBielik 11B v3PLLuM instructmniejszy model tekstowy ogranicza koszt; oba wymagają pomiaru
asystent regulaminówPLLuM-12B-chat-2512Bielik 11B v3karta PLLuM opisuje polecenie RAG z cytowaniami
redakcja i korektaBielik 11B v3PLLuM-12B-chat-2512trzeba ocenić terminologię i ton na własnych tekstach
proces z danymi osobowymiQwen lub PLLuM po analizie prawnejBielik po wyjaśnieniu warunkówwarunki Bielik v3 mają wyraźne ograniczenie

Co pokazał nasz test Qwena

Na jednej RTX 3090 z 24 GB VRAM uruchomiliśmy Qwen w W4A16 przez zmodyfikowany, zamrożony stos vLLM. W naprawie Go Qwen Code pracował 502,14 s, a Codex przyznał zmianie 100/100 według arkusza kryteriów Syntalith. Ten sam lokalny model dostał 87/100 z klientem Codex i 98/100 w eksperymencie zgodności z Claude Code. Oceny wykonał Codex. Bielik i PLLuM nie brały udziału w tej próbie.

Arkusz przyznawał 40 punktów za poprawność obsługi błędów, 20 za testy regresji, 15 za zgodność API, 10 za zakres, 10 za weryfikację i 5 za dokumentację. Wynik dotyczy jednej zmiany i jednego przebiegu.

To pokazuje, że profil sprzętowy i program prowadzący model wpływają na rezultat. Nie jest rankingiem polskich modeli. Pełne wyniki Qwena i publiczny zapis wyników JSON opisują dokładne przebiegi.

Jak zbudować porównanie dla firmy

Przygotuj 50–100 zanonimizowanych przykładów z jednego procesu. Zapisz oczekiwany wynik, dozwolone źródła, wymagany format oraz przypadki, w których system ma odmówić albo poprosić o człowieka. Uruchom dokładne wersje modeli z tą samą kwantyzacją i podobnym limitem kontekstu.

Mierz poprawność reguł, kompletność pól, trafność cytowań, poprawność JSON, czas odpowiedzi, VRAM, koszt korekty człowieka i odsetek uzasadnionych odmów. W RAG podaj każdemu generatorowi te same fragmenty. Jakość wyszukiwania mierz osobno.

Wybierz Qwena, Bielika, PLLuM, układ mieszany albo API dopiero po takim teście. Bezpłatny skan procesu pomaga zdefiniować dane, próg jakości i koszt utrzymania.

Źródła

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze