Qwen3.8, Bielik czy PLLuM? Porównanie pod konkretne zadanie
Porównujemy Qwen3.8-27B, Bielik-11B-v3.0-Instruct i PLLuM-12B-chat-2512 pod kątem parametrów, architektury, polskiego języka, licencji, sprzętu i wdrożenia.
Syntalith
Qwen3.8-27B, Bielik-11B-v3.0-Instruct i PLLuM-12B-chat-2512 rozwiązują różne problemy. Qwen łączy tekst, obraz, wideo, długi kontekst i pracę z narzędziami. Bielik koncentruje się na tekście w językach europejskich, z mocnym udziałem polskiego. PLLuM rozwija rodzinę modeli do polskiego dialogu, instrukcji i pracy z wiedzą.
Najlepszy wybór zależy od procesu, danych i kosztu błędu. Dobrym początkiem jest:
- Qwen do kodu, wizji, wielu narzędzi i bardzo długich wejść;
- Bielik do polskiej klasyfikacji, ekstrakcji, redakcji i mniejszego lokalnego agenta tekstowego;
- PLLuM do asystenta opartego na polskich regulaminach, procedurach i dokumentach.
To kolejność testowania oparta na deklarowanych możliwościach i opisanym przeznaczeniu modeli. Nie wykonywaliśmy wspólnego testu tych trzech wersji. Wynik na danych firmy rozstrzyga wdrożenie.
Jakie wersje porównujemy
„Bielik” i „PLLuM” oznaczają rodziny modeli. Dlatego podajemy dokładną wersję modelu:
Qwen/Qwen3.8-27B, dostrojony model z 27 mld parametrów w części językowej i osobnym enkoderem wizji.speakleash/Bielik-11B-v3.0-Instruct, wariant instrukcyjny Bielika 11B v3.CYFRAGOVPL/PLLuM-12B-chat-2512, wariant dialogowy linii PLLuM 2512.
Starsze badania używają między innymi Bielik-11B-v2.3-Instruct, Bielik-11B-v2.6-Instruct i PLLuM-12B-nc-chat. Ich liczby są wynikami tamtych wersji. Nie przenosimy ich automatycznie na trzy wersje z tego porównania.
Karta techniczna
| Cecha | Qwen3.8-27B | Bielik-11B-v3.0-Instruct | PLLuM-12B-chat-2512 |
|---|---|---|---|
| Parametry | 27B w części językowej; osobny enkoder wizji | około 11B | około 12B |
| Rodzaj | gęsty model przyczynowy z wizją | gęsty model dekoderowy | gęsty model dekoderowy |
| Architektura | 64 warstwy; trzy Gated DeltaNet i jedna pełnej atencji powtarzane 16 razy | rodzina oparta na Mistral 7B v0.2, 50 warstw według raportu v3 | oparty na Mistral-NeMo-Base-2407, 40 warstw według karty wariantu |
| Wymiar ukryty | 5120 | 4096 | 5120 |
| Kontekst | 262 144 tokeny natywnie; Qwen opisuje rozszerzenie do 1M przez YaRN | 32 768 natywnie; raport opisuje rozszerzenie do 131 072 przez YaRN | 131 072 tokeny w konfiguracji wariantu |
| Modalności | tekst, obraz, wideo | tekst | tekst |
| Tryb rozumowania | wbudowany thinking, regulowany albo wyłączany | integracja przez szablon i narzędzia projektu | karta wariantu nie opisuje osobnego trybu rozumowania |
| Licencja | Apache 2.0 | Apache 2.0 na karcie oraz dodatkowe warunki v3 | Apache 2.0 na karcie wariantu |
Parametry i architekturę podajemy za kartami, konfiguracjami i raportami wskazanymi w źródłach. Nie wykonaliśmy tu wspólnego testu na tych samych zadaniach. Rozmiar pomaga przewidzieć wymagania pamięci, lecz nie zastępuje testu polskich odpowiedzi.
Qwen3.8-27B do kodu, obrazu i długich wejść
Qwen jest największym modelem w tym zestawieniu. Gęsta część językowa ma 27B parametrów. Osobny enkoder obrazu pozwala przyjmować materiały wizualne, a karta opisuje także wideo. Tryb thinking można wyłączyć dla prostego wydobywania pól albo zostawić przy debugowaniu i planowaniu.
Układ warstw łączy 48 bloków Gated DeltaNet z 16 blokami pełnej, bramkowanej atencji. Taka hybryda wspiera długie wejścia. Natywny limit 262 144 tokenów nadal oznacza koszt pamięci i czasu. W naszym teście trzy fakty z początku, środka i końca syntetycznego tekstu zostały zwrócone przy 230 085 tokenach, lecz przebieg trwał 563,4 s.
Qwen warto najpierw przetestować w zadaniach takich jak:
- praca agenta programistycznego w repozytorium;
- proces łączący terminal, przeglądarkę, API i dokumenty;
- analiza wykresów, formularzy, zrzutów ekranu i skanów;
- długie, wieloetapowe zadanie, gdy jedna sesja ma zachować szeroki kontekst.
Do krótkiej klasyfikacji albo kilku pól w formularzu model może być kosztowny względem mniejszego modelu lub programu deterministycznego.
Bielik-11B-v3.0-Instruct do pracy z polskim tekstem
Bielik v3 jest rozwijany przez SpeakLeash i ACK Cyfronet AGH. Oficjalna karta opisuje 11B, 33 języki i ponad 20 mln instrukcji obejmujących 17 mld tokenów. Raport techniczny opisuje bazę Mistral 7B v0.2, zwiększenie głębokości do 50 warstw oraz dalszy trening na danych europejskich.
Wariant Instruct służy do wykonywania poleceń, transformacji tekstu i odpowiedzi w aplikacji. Projekt Bielik publikuje narzędzia do odpowiedzi strukturalnych, wywołań funkcji i opcjonalnego rozumowania. Zgodność wymaga właściwego szablonu oraz modułu odczytującego odpowiedź wybranego serwera.
Bielik warto najpierw przetestować przy:
- klasyfikacji polskich pism, wiadomości i zgłoszeń;
- ekstrakcji pól oraz odpowiedzi JSON;
- korekty, redakcji i streszczeń po polsku;
- lokalnego asystenta tekstowego z umiarkowanym kontekstem.
Karta tego wariantu opisuje tekst. Skan faktury wymaga OCR albo osobnego modelu wizji.
Licencja Bielika a dane osobowe
Karta wskazuje Apache 2.0, a dodatkowe warunki Bielik v3 zawierają dalsze ograniczenia. Wersja 1.1 z 31 lipca 2025 roku zakazuje przetwarzania danych osobowych. Przed użyciem w wiadomościach klientów, HR lub umowach trzeba przeczytać aktualny tekst i uzyskać ocenę prawną. Lokalny serwer nie zmienia treści licencji.
PLLuM-12B-chat-2512 do dialogu i RAG po polsku
PLLuM jest rodziną, w której występują różne rozmiary i warianty base, instruct oraz chat. Porównujemy PLLuM-12B-chat-2512, model dialogowy oparty na Mistral-NeMo-Base-2407. Karta wariantu podaje 12B, 40 warstw, wymiar ukryty 5120 i kontekst 131 072 tokenów.
Karta wariantu chat opisuje użycie tego modelu w rozmowie z pracownikiem i jako asystenta dokumentowego. Publikuje też wzorzec RAG, w którym model ma odpowiadać na podstawie dostarczonego kontekstu, dodawać odwołania [0] i [1] oraz sygnalizować brak odpowiedzi. Wdrożenie nadal potrzebuje wyszukiwarki, kontroli dostępu i testu odmowy.
PLLuM warto przetestować przy:
- asystencie korzystającym z regulaminów, procedur i decyzji;
- streszczaniu polskiej korespondencji;
- RAG z wymaganymi cytowaniami i jasno określonym źródłem;
- projekcie, w którym ważna jest możliwość utrzymania modelu we własnym środowisku.
Oficjalna karta tej wersji opisuje model tekstowy. Obraz, autonomiczne narzędzia i zaawansowane kodowanie wymagają osobnych komponentów i testów.
Wariant ma znaczenie
| Wariant | Najlepszy punkt wyjścia | Praca, która wymaga ostrożności |
|---|---|---|
base | dalszy trening i badania | rozmowa z użytkownikiem bez własnego dostrojenia |
instruct | ekstrakcja, klasyfikacja i transformacja | swobodny dialog, jeśli lepiej pasuje chat |
chat | asystent, rozmowa i RAG | ścisłe formaty maszynowe bez testu wariantu instruct |
Nazwy rodziny nie wystarczają do decyzji o licencji, kontekście ani formacie polecenia. Zapisz identyfikator repozytorium, wersję plików i użyty szablon.
Sprzęt i sposób wdrożenia
Przybliżenie dla samych wag wynosi około 2 bajtów na parametr w BF16, 1 bajt w 8-bit i 0,5 bajta w 4-bit. Dochodzą pamięć kontekstu, bufory, aktywacje, enkoder wizji i zapas dla równoległych żądań.
| Model | Same wagi BF16 | Orientacyjne wagi 4-bit | Punkt startowy |
|---|---|---|---|
| Qwen3.8-27B | około 54 GB plus enkoder wizji | około 16–18 GB z narzutem | 24 GB dla kontrolowanego, pojedynczego przebiegu; dłuższy kontekst wymaga pomiaru |
| Bielik 11B v3 | około 22 GB | około 6–7 GB | 12–16 GB dla 4-bit; dodatkowy zapas poprawia kontekst |
| PLLuM 12B 2512 | pliki BF16 około 24,5 GB | około 7–8 GB | 16 GB dla 4-bit; 24 GB daje większy margines |
To są szacunki pojemności. Nie są porównaniem szybkości ani jakości. Kwantyzację trzeba ocenić na tych samych przypadkach.
Licencja wag nie opisuje całego wdrożenia. Sprawdź także warunki wariantu, źródło obrazu serwera, prawa do danych, retencję, dostęp użytkowników i narzędzia, które model może wywołać. API zarządzane zwykle upraszcza utrzymanie. Serwer lokalny może lepiej pasować do wymagań dotyczących trasy danych, lecz wymaga właściciela aktualizacji, monitoringu i oceny jakości.
Co wiemy o polskim języku
Bielik i PLLuM zostały rozwijane z wyraźnym celem pracy z językiem polskim. Qwen jest szerszym modelem ogólnym, a jego karta nie publikuje porównywalnego, osobnego wyniku dla współczesnej polszczyzny. Z tego nie wynika automatyczny zwycięzca.
Raport Bielik v3 porównuje Bielik z wcześniejszą wersją PLLuM i pokazuje wyższe wyniki Bielika w wybranych testach. Raport powstał po stronie zespołu Bielika, a użyty PLLuM poprzedza wersję 2512. W dwóch badaniach RAG starsze wersje dały różną kolejność: Bielik-11B-v2.3-Instruct uzyskał 4,521/5 w teście dokumentacji low-code, a PLLuM-12B-nc-chat wyższą ocenę niż Bielik-11B-v2.6-Instruct w badaniu PolQA. Te wyniki zależą od korpusu, wyszukiwarki, polecenia, osoby oceniającej i wersji modelu.
Najuczciwszy test firmy używa tych samych polskich przykładów, źródeł, reguł odmowy i formatu wyjścia dla każdej wersji modelu.
Kolejność testów według zadania
| Zadanie | Zacznij od | Dodaj do porównania | Dlaczego |
|---|---|---|---|
| agent kodowy | Qwen3.8-27B | Bielik 11B v3 | Qwen ma wizję, długi kontekst i profil narzędziowy |
| skany, wykresy, zrzuty | Qwen3.8-27B | OCR plus Bielik lub PLLuM | Qwen ma natywną ścieżkę wizji |
| polska klasyfikacja i ekstrakcja | Bielik 11B v3 | PLLuM instruct | mniejszy model tekstowy ogranicza koszt; oba wymagają pomiaru |
| asystent regulaminów | PLLuM-12B-chat-2512 | Bielik 11B v3 | karta PLLuM opisuje polecenie RAG z cytowaniami |
| redakcja i korekta | Bielik 11B v3 | PLLuM-12B-chat-2512 | trzeba ocenić terminologię i ton na własnych tekstach |
| proces z danymi osobowymi | Qwen lub PLLuM po analizie prawnej | Bielik po wyjaśnieniu warunków | warunki Bielik v3 mają wyraźne ograniczenie |
Co pokazał nasz test Qwena
Na jednej RTX 3090 z 24 GB VRAM uruchomiliśmy Qwen w W4A16 przez zmodyfikowany, zamrożony stos vLLM. W naprawie Go Qwen Code pracował 502,14 s, a Codex przyznał zmianie 100/100 według arkusza kryteriów Syntalith. Ten sam lokalny model dostał 87/100 z klientem Codex i 98/100 w eksperymencie zgodności z Claude Code. Oceny wykonał Codex. Bielik i PLLuM nie brały udziału w tej próbie.
Arkusz przyznawał 40 punktów za poprawność obsługi błędów, 20 za testy regresji, 15 za zgodność API, 10 za zakres, 10 za weryfikację i 5 za dokumentację. Wynik dotyczy jednej zmiany i jednego przebiegu.
To pokazuje, że profil sprzętowy i program prowadzący model wpływają na rezultat. Nie jest rankingiem polskich modeli. Pełne wyniki Qwena i publiczny zapis wyników JSON opisują dokładne przebiegi.
Jak zbudować porównanie dla firmy
Przygotuj 50–100 zanonimizowanych przykładów z jednego procesu. Zapisz oczekiwany wynik, dozwolone źródła, wymagany format oraz przypadki, w których system ma odmówić albo poprosić o człowieka. Uruchom dokładne wersje modeli z tą samą kwantyzacją i podobnym limitem kontekstu.
Mierz poprawność reguł, kompletność pól, trafność cytowań, poprawność JSON, czas odpowiedzi, VRAM, koszt korekty człowieka i odsetek uzasadnionych odmów. W RAG podaj każdemu generatorowi te same fragmenty. Jakość wyszukiwania mierz osobno.
Wybierz Qwena, Bielika, PLLuM, układ mieszany albo API dopiero po takim teście. Bezpłatny skan procesu pomaga zdefiniować dane, próg jakości i koszt utrzymania.
Źródła
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces