PLLuM: polski model językowy i jego wdrożenie w firmie (2026)
PLLuM to rodzina otwartych polskich modeli językowych rozwijana przez konsorcjum pod kierunkiem NASK PIB. Część wariantów działa na licencji Apache 2.0 i wolno ich użyć komercyjnie, część wyłącznie do badań. Wdrożenie na własnej infrastrukturze zaczyna się od 15 000 zł netto, a pierwszym krokiem jest bezpłatny skan procesów.
PLLuM to państwowy projekt otwartych polskich modeli językowych prowadzony przez konsorcjum pod kierunkiem NASK. Dla firmy liczą się trzy rzeczy: licencja wybranego wariantu, wymagany sprzęt i to, czy model dowiezie jakość w Twoim procesie.
11 min czytania
PLLuM to rodzina otwartych polskich modeli językowych rozwijana przez konsorcjum pod kierunkiem NASK PIB i finansowana przez Ministerstwo Cyfryzacji. Modele mają od 4 do około 71 miliardów parametrów i działają na własnym serwerze z kartą GPU. Część wariantów jest na licencji Apache 2.0, część wolno użyć wyłącznie do badań, i ta różnica przesądza, czy w ogóle wolno postawić model w firmie.
Szybka odpowiedź
Jeśli rozważasz PLLuM jako silnik dla wewnętrznego asystenta albo automatyzacji, wystarczy pięć faktów:
- Kto to prowadzi: konsorcjum pod kierunkiem NASK PIB, z Politechniką Wrocławską, IPI PAN, Instytutem Slawistyki PAN, OPI PIB, Uniwersytetem Łódzkim i Cyfronetem AGH. Bieżąca faza idzie razem z HIVE AI i Ministerstwem Cyfryzacji. Modele publikuje organizacja
CYFRAGOVPLna HuggingFace. - Licencja rozstrzyga wcześniej niż jakość. Warianty 4B i 12B z serii 2512 są na Apache 2.0. Llama-PLLuM 8B i 70B są na licencji Llama 3.1 Community License. Wszystko z
-nc-w nazwie to CC-BY-NC-4.0, czyli badania i tylko badania. - Sprzęt: oficjalna tabela projektu podaje od około 34 GB pamięci GPU dla generatora 8B do około 168 GB dla 70B, bez kwantyzacji. Po kwantyzacji do 4 bitów te same modele schodzą do kilku do kilkudziesięciu gigabajtów.
- Benchmarki: PLLuM nie publikuje własnych liczb. Na kartach modeli nie ma tabel wyników, stan na 7 sierpnia 2026. Kto twierdzi inaczej, cytuje coś, czego nie ma.
- Koszt po stronie Syntalith: automatyzacje AI od 15 000 zł netto, aplikacje AI i agenci AI od 25 000 zł netto, typowe pełne wdrożenia 25 000–150 000 zł netto, utrzymanie indywidualnie. Do tego infrastruktura GPU, którą liczysz osobno.
Start jest bezpłatny: skan procesów (0 zł) to 30 minut rozmowy z inżynierem i pisemne podsumowanie w 2 dni robocze. Szerszy obraz rynku polskich modeli otwartych jest w tekście polskie modele językowe PLLuM i Bielik dla firm.
Kto buduje PLLuM i kto za to płaci?
Liderem konsorcjum jest NASK PIB, państwowy instytut badawczy. To warto powiedzieć wprost, bo w obiegu krąży pomyłka przypisująca prowadzenie projektu OPI PIB; OPI jest członkiem konsorcjum, liderem jest NASK. Pozostali członkowie wymienieni na kartach modeli to Politechnika Wrocławska, Instytut Podstaw Informatyki PAN, Instytut Slawistyki PAN, OPI PIB, Uniwersytet Łódzki i Cyfronet AGH.
Bieżąca faza jest prowadzona z HIVE AI przy Ministerstwie Cyfryzacji. Na stronie pllum.org.pl (odczyt 7 sierpnia 2026) podana jest kwota grantu 5 999 102,67 zł, fundator Ministerstwo Cyfryzacji, program „HIVE 2 - kontynuacja rozwoju i wdrażania dużego modelu językowego w administracji publicznej", numer 4/WII/DBI/2026. Pierwotny okres realizacji projektu na tej samej stronie to marzec-grudzień 2024. Łączne finansowanie wszystkich faz nie jest podane publicznie, więc żadna suma kumulacyjna nie powinna krążyć w prezentacjach.
Dlaczego to ma znaczenie przy zakupie? Bo model utrzymywany z grantu publicznego ma inny profil ryzyka niż produkt komercyjny. Nie ma SLA, nie ma wsparcia w umowie, nie ma gwarancji, że kolejna wersja wyjdzie w konkretnym terminie. Jest za to publiczna licencja i pełny dostęp do wag, więc raz pobrany model działa u Ciebie niezależnie od tego, co stanie się z projektem.
Które warianty PLLuM wolno użyć komercyjnie?
To jest tabela, którą trzeba przeczytać przed jakąkolwiek rozmową o architekturze. Wybór złego wariantu jest błędem prawnym i żadna praca inżynierska go nie naprawi.
| Model | Parametry | Licencja | Użycie komercyjne |
|---|---|---|---|
| PLLuM-4B-{base,instruct,chat}-2512 | 4 mld | Apache 2.0 | tak, bez dodatkowych warunków |
| PLLuM-12B-{base,instruct,chat}-2512 | 12 mld | Apache 2.0 | tak, bez dodatkowych warunków |
| Llama-PLLuM-8B-{base,chat,instruct}-2512 | 8 mld | Llama 3.1 Community License | tak, na warunkach Meta (polityka dozwolonego użycia, atrybucja, klauzula 700 mln MAU) |
| Llama-PLLuM-70B-{chat,instruct}-2512 | ok. 71 mld | Llama 3.1 Community License | jak wyżej |
| PLLuM-12B-nc-base / -nc-instruct | 12 mld | CC-BY-NC-4.0 | nie, wyłącznie badania |
PLLuM-8x7B-nc-instruct i pozostałe -nc- | 47 mld (MoE 8×7B) | CC-BY-NC-4.0 | nie, wyłącznie badania |
Źródło: pllum.org.pl i karty modeli w organizacji CYFRAGOVPL na HuggingFace, odczyt 7 sierpnia 2026. Modele PLLuM-12B są zbudowane na bazie Mistral-Nemo-Base-2407. Nazewnictwo jest datowe w formacie RRMM: 2412 to grudzień 2024, 2508 to sierpień 2025, 2512 to grudzień 2025. Nie ma czegoś takiego jak „PLLuM 2.0"; projekt nazywa partię 2512 drugą generacją, ale wersjonuje datą.
W maju 2026 portal PurePC opisał publikację jedenastu modeli w rozmiarach 4B, 8B, 12B i 70B, w wariantach base, instruct i chat, wraz z zapowiedzią przygotowania ich pod wymagania AI Act. Warto potraktować ten drugi wątek ostrożnie: to deklaracja projektu opisana w prasie. Certyfikacji zgodności za tym nie ma.
Dlaczego najlepiej wytrenowane warianty są zablokowane licencją?
Tu leży najciekawszy i najrzadziej opisywany kompromis w całym projekcie. Karty modeli podają, że warianty na otwartych licencjach były dotrenowane na około 28-30 miliardów tokenów polskiego tekstu, z podzbioru wolnego od problemów prawnoautorskich. Warianty -nc- widziały około 150 miliardów tokenów polskiego tekstu i właśnie dlatego mają licencję niekomercyjną (odczyt kart 7 sierpnia 2026).
Konsekwencja jest prosta i niewygodna. Wariant, który miał największą ekspozycję na polszczyznę, jest dla firmy niedostępny. To, co wolno wdrożyć produkcyjnie, widziało pięć razy mniej polskiego tekstu. Jeśli ktoś pokazuje Ci demo PLLuM z zachwycającą polszczyzną, pierwsze pytanie brzmi: który to wariant i czy w ogóle wolno go uruchomić w firmie.
Dla porównania Bielik jest na licencji Apache 2.0 w całej sprawdzonej rodzinie, bez wariantu niekomercyjnego. Rozkładamy tę różnicę w tekście o Bieliku jako polskim modelu AI dla biznesu.
Ile pamięci GPU naprawdę potrzeba?
Projekt publikuje własną tabelę wymagań dla wdrożenia RAG na miejscu. Odtwarzamy ją wiernie, bo to jedyne oficjalne źródło sizingu dla tej rodziny (pllum.org.pl, sekcja Infrastruktura, odczyt 7 sierpnia 2026):
| Komponent | Wymagana pamięć GPU | Rekomendowane karty NVIDIA |
|---|---|---|
| Wyszukiwanie + reranker | 24–48 GB | A10 (24 GB), V100 (32 GB), L40 (48 GB) |
| Generator 70B | ~168 GB | 2× H100/GH200, 4× A100, 4× A6000/L40 |
| Generator 8×7B | ~134 GB | 2× H100/GH200, 2× A100, 4× A6000/L40 |
| Generator 24B | ~70 GB | A100, 2× A6000/L40, 4× A10 |
| Generator 12B | ~48 GB | A100, 2× A6000/L40, 4× A10 |
| Generator 8B | ~34 GB | A6000/L40, 2× A10 |
Ta tabela zakłada serwowanie w fp16/bf16 z zapasem na cache KV i narzut. Strona nie wspomina o kwantyzacji, vLLM, Ollamie ani llama.cpp. Dla firmy, która nie planuje obsługi setek równoległych sesji, liczby te są zawyżone względem realnego wdrożenia.
Poniżej ta sama rodzina policzona regułą kciuka, którą możesz odtworzyć sam: bf16 to około 2 GB na miliard parametrów, 8 bitów około 1 GB, 4 bity około 0,5-0,6 GB, plus 15-25% na cache KV, aktywacje i kontekst CUDA. To arytmetyka do samodzielnego sprawdzenia, żaden z tych wierszy nie jest wynikiem pomiaru.
| Model | bf16 | 8 bitów | 4 bity | Mieści się na karcie 24 GB? |
|---|---|---|---|---|
| PLLuM 4B | ~8 GB | ~4 GB | ~2,4 GB | tak, nawet w bf16 |
| Llama-PLLuM 8B | ~16 GB | ~8 GB | ~4,7 GB | bf16 ciasno przy krótkim kontekście, 4 bity swobodnie |
| PLLuM 12B | ~22–24 GB | ~11–12 GB | ~6,5–7 GB | bf16 nie mieści się z użytecznym kontekstem, 4 bity swobodnie |
| PLLuM 8×7B | ~94 GB | ~47 GB | ~26–28 GB | nie, 4 bity wymagają 2× 24 GB albo 1× 48 GB |
| Llama-PLLuM 70B | ~140 GB | ~70 GB | ~40–43 GB | nie, 4 bity realnie 48–80 GB |
Różnica między „48 GB według tabeli ministerialnej" a „7 GB po kwantyzacji do 4 bitów" dla tego samego modelu 12B jest najbardziej praktyczną liczbą w tym tekście. Uczciwa uwaga do niej: kwantyzacja kosztuje jakość, a dla PLLuM nikt nie opublikował pomiaru, o ile. Każdy, kto podaje Ci konkretny procent utraty jakości przy Q4, zgaduje.
Modelowany scenariusz kosztowy, do podstawienia własnych liczb: dedykowany serwer z kartą 96 GB w Hetznerze (GEX131, RTX PRO 6000 Blackwell Max-Q) kosztował od 889 EUR miesięcznie netto według komunikatu prasowego Hetznera z grudnia 2025. To pułap wystarczający na 70B w 4 bitach razem ze stosem wyszukiwania. Model 12B w 4 bitach mieści się na najtańszej klasie dedykowanego GPU w UE. Porównuj to zawsze z wydatkiem na tokeny przy Twoim wolumenie, nigdy w przeliczeniu na stanowisko. Pełny rachunek sprzętowy rozkładamy w tekście o wdrożeniu polskiego LLM: sprzęt, koszty, RODO.
Jak PLLuM jest w praktyce wdrażany?
Sam projekt opisuje trzy wzorce zastosowania i wszystkie trzy zakładają pracę na własnej infrastrukturze, bez wysyłania danych na zewnątrz.
- Czat dla obywateli na stronie instytucji. Model odpowiada na pytania publiczne, opierając się na treściach danej instytucji.
- Wewnętrzny asystent pracownika. Redagowanie pism, streszczanie dokumentów, przygotowywanie odpowiedzi. To wzorzec, który najłatwiej przenieść do firmy.
- Asystent wiedzy nad dokumentami wewnętrznymi (RAG). Model odpowiada z konkretnych fragmentów dokumentacji i wskazuje źródło.
Ostatni wzorzec jest tym, o który pyta najwięcej firm, i to on tłumaczy pozycję „wyszukiwanie + reranker" w tabeli sprzętowej. Generator nie jest całym systemem: bez porządnego wyszukiwania nawet dobry model odpowie ładnie i nie na temat. Jak to układamy w praktyce, opisujemy w tekście o asystencie wiedzy AI opartym o RAG.
Argument za trzymaniem modelu u siebie pochodzi tu z najlepszego możliwego źródła: strona PLLuM stwierdza wprost, że wdrożenie jest lokalne, a dane pozostają w infrastrukturze instytucji. Trudno o mocniejszą podstawę pod rozmowę o RODO niż projekt państwowy, który sam tak to zaprojektował. Poziomy izolacji, od hostingu w UE po air gap, rozkładamy osobno w tekście on-prem i air gap: poziomy izolacji AI.
Gdzie PLLuM już działa w administracji?
Według komunikatu NASK wdrożenia obejmują asystenta wewnętrznego w Ministerstwie Cyfryzacji, urzędy miast w Gdyni i Poznaniu oraz wirtualnego asystenta w aplikacji mObywatel, budowanego przez Centralny Ośrodek Informatyki. NASK zapowiada na 2026 rok rozszerzenie współpracy z administracją, kolejne miasta, zaawansowane testy oraz prace nad pierwszym polskim komercyjnym modelem tekstowo-obrazowym.
Traktuj to jako sygnał dojrzałości projektu. Na referencję produkcyjną dla firmy komercyjnej to za mało. Publicznie nie potwierdzono, które z tych wdrożeń są pilotażami, a które pełną dostępnością, ani ilu użytkowników obsługują. Liczby o „milionach użytkowników" w prezentacjach handlowych nie mają podstawy w dostępnych źródłach.
Kiedy PLLuM nie jest właściwym wyborem?
To sekcja, którą powinien mieć każdy tekst o polskich modelach otwartych, a ma ją mało który.
- Proces wymaga trudnego rozumowania albo kodu. Model o 4-12 miliardach parametrów nie jest w tej samej kategorii wagowej co modele frontier dostępne przez API. W niezależnym teście Oxido opisanym przez Bankier.pl w marcu 2026 (20 zadań w 10 kategoriach: pisanie maili, doradztwo, poprawność językowa, historia i kultura, pytania prawne i podatkowe, marketing) wygrał model Google, a Bielik i PLLuM znalazły się w dolnej części zestawienia. Autor testu Marek Jeleśniański nazwał wynik Bielika przyzwoitym, biorąc pod uwagę nieporównywalnie mniejsze zasoby. Publiczne porównania PLLuM z GPT, Claude czy Gemini na benchmarkach rozumowania i kodu nie istnieją, więc nie da się podać rozmiaru luki, ale nic nie przeczy jej istnieniu.
- Nie masz i nie chcesz mieć zespołu od infrastruktury. Serwer GPU, sterowniki, aktualizacje, monitoring, re-kwantyzacja przy każdej nowej wersji modelu: to praca ciągła. Kadencja wydawnicza PLLuM (2412, 2508, 2512, partia jedenastu modeli w maju 2026) oznacza regularne ponowne testy i regresje promptów.
- Wolumen jest mały. Serwer GPU kosztuje tyle samo przy stu i przy stu tysiącach zapytań miesięcznie. Poniżej pewnego progu API jest po prostu tańsze. Rachunek, który to rozstrzyga, jest w tekście polski model językowy czy API: jak wybrać.
- Twoje ograniczenie nie jest ograniczeniem lokalizacji danych. Jeśli chodzi o zgodność z RODO, umowa powierzenia z dostawcą w UE często wystarcza i jest tańsza. Co dokładnie trzeba mieć podpisane, rozkładamy w tekście o RODO i DPA przy wdrożeniu AI.
- Potrzebujesz długiego kontekstu. Karty modeli PLLuM nie podają okna kontekstu. Skoro nie jest zadeklarowane, nie planuj architektury, która zakłada setki tysięcy tokenów.
Jak Syntalith podchodzi do PLLuM
Wdrażamy modele z rodziny PLLuM na infrastrukturze klienta wtedy, gdy licencja wybranego wariantu i profil ograniczeń faktycznie do tego pasują. Pracujemy też z modelami API, w tym z Claude, i mówimy wprost, że w trudnym rozumowaniu modele frontier są mocniejsze. Wybór jest decyzją inżynierską podejmowaną osobno dla każdego procesu. Nie mamy publicznego wdrożenia PLLuM pod nazwą klienta i nie będziemy udawać, że mamy.
Na skanie wygląda to prosto: bierzemy jeden proces, liczymy wolumen, sprawdzamy, jakie dane w nim krążą, i mówimy, czy PLLuM na własnej infrastrukturze się broni, czy taniej i lepiej wyjdzie API. Bez prezentacji sprzedażowej, rozmawiasz z inżynierem, który będzie budował.
Jak zacząć
- Umów bezpłatny skan procesów: 30 minut z inżynierem i pisemne podsumowanie w 2 dni robocze.
- Przygotuj: jaki proces chcesz obsłużyć, ile zapytań miesięcznie, jakie dane w nim występują i czy jest wymóg, żeby nie opuszczały Twojego środowiska.
- Po rozmowie dostajesz rekomendację: konkretny wariant PLLuM z jego licencją, alternatywę w postaci Bielika albo modelu API, i uczciwe „to na razie nie potrzebuje własnego modelu", jeśli tak wyjdzie z liczb.
Umów bezpłatny skan procesów | Zobacz cennik | Aplikacje AI na zamówienie
Powiązane artykuły
Najczęstsze pytania
- Czy PLLuM można używać komercyjnie?
- Zależy od wariantu i to jest najczęstszy błąd w rozmowach o PLLuM. Modele PLLuM-12B i PLLuM-4B z serii 2512 są na licencji Apache 2.0, więc wolno ich użyć komercyjnie bez dodatkowych warunków. Warianty Llama-PLLuM 8B i 70B są na licencji Llama 3.1 Community License, czyli komercyjnie tak, ale na warunkach Meta. Wszystkie warianty z oznaczeniem -nc- są na CC-BY-NC-4.0 i wolno ich użyć wyłącznie do badań. Stan na sierpień 2026, według kart modeli na HuggingFace i pllum.org.pl.
- Jakiego sprzętu wymaga PLLuM?
- Oficjalna tabela na pllum.org.pl podaje dla generatora 12B około 48 GB pamięci GPU, dla 8x7B około 134 GB, a dla 70B około 168 GB, plus 24-48 GB na wyszukiwanie i reranker. Te liczby zakładają serwowanie bez kwantyzacji. Po kwantyzacji do 4 bitów model 12B mieści się w około 7 GB, a 8B w około 5 GB, więc realnie wystarcza karta 20-24 GB. Kwantyzacja kosztuje jakość i nikt nie opublikował pomiaru, o ile dokładnie.
- Czy PLLuM jest lepszy od modeli API w polszczyźnie?
- Nie ma na to dowodu. PLLuM nie publikuje żadnych tabel z wynikami benchmarków na kartach modeli, stan na sierpień 2026. W niezależnym teście Oxido opisanym przez Bankier.pl w marcu 2026 (20 zadań w 10 kategoriach) model Google wygrał, a Bielik i PLLuM znalazły się w dolnej części zestawienia. Przy 4-12 miliardach parametrów te modele nie są w tej samej kategorii wagowej co modele frontier w zadaniach wymagających rozumowania.
- Gdzie PLLuM już działa?
- Według komunikatu NASK wdrożenia pilotażowe obejmują Ministerstwo Cyfryzacji (asystent wewnętrzny), Urząd Miasta Gdynia, Urząd Miasta Poznań oraz asystenta w mObywatelu budowanego przez COI. Szczegółowy status tych wdrożeń (pilotaż czy pełna dostępność) nie jest publicznie potwierdzony, więc traktuj je jako sygnał kierunku rozwoju projektu. Na referencje produkcyjne dla firmy komercyjnej to za mało.
- Ile kosztuje wdrożenie PLLuM w firmie?
- W Syntalith automatyzacje AI zaczynają się od 15 000 zł netto, a aplikacje i agenci AI od 25 000 zł netto; typowe pełne wdrożenia mieszczą się w 25 000-150 000 zł netto. Do tego dochodzi infrastruktura GPU: dedykowany serwer z kartą 96 GB w Hetznerze kosztował od 889 EUR miesięcznie netto (komunikat prasowy Hetzner, grudzień 2025), a mniejsza karta 20-24 GB odpowiednio mniej. Utrzymanie wyceniamy indywidualnie.
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
Bez prezentacji sprzedażowej i bez zobowiązań. Jeśli automatyzacja nie ma sensu, też to napiszemy.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Formularz bez zobowiązań