Przejdź do treści
Wróć do bloga
Wdrożenia AIBielik i PLLuM: sprzęt i koszty 2026

Wdrożenie polskiego LLM w firmie: Bielik i PLLuM, sprzęt, koszty i RODO (2026)

Co naprawdę trzeba mieć, żeby uruchomić Bielika albo PLLuM u siebie? Kartę GPU z odpowiednią ilością VRAM, stos inferencyjny, umowę powierzenia przy hostingu w UE i budżet na utrzymanie. Model 11–12B w kwantyzacji 4-bit mieści się w około 7 GB VRAM, a oficjalna tabela PLLuM dla tej samej klasy modelu mówi o ~48 GB. Ten tekst pokazuje, skąd bierze się ta różnica.

Uruchomienie Bielika albo PLLuM u siebie to trzy decyzje: ile VRAM kupujesz, na jakim stosie serwujesz model i kto podpisuje umowę powierzenia. Ten tekst rozkłada każdą z nich na liczby, które przeliczysz sam.

11 min czytania

Uruchomienie Bielika albo PLLuM na własnej infrastrukturze to serwer z kartą GPU, stos inferencyjny, umowa powierzenia przy hostingu w UE i budżet na utrzymanie. Bielik 11B albo PLLuM 12B w kwantyzacji 4-bit mieści się w około 7 GB VRAM, czyli na karcie za kilkaset euro miesięcznie. Oficjalna tabela PLLuM dla tej samej klasy modelu mówi o ~48 GB, bo opisuje inny scenariusz.

Szybka odpowiedź

Trzy liczby ustawiają cały projekt: rozmiar modelu w VRAM, koszt karty w skali miesiąca i wolumen tokenów, który miałbyś inaczej kupić w API.

  • VRAM. Reguła kciuka: bf16 około 2 GB na miliard parametrów, 8-bit około 1 GB, 4-bit około 0,5–0,6 GB, plus 15–25% na KV-cache, aktywacje i kontekst CUDA. Bielik 11B i PLLuM 12B: około 22–24 GB w bf16, około 6,5–7 GB w 4-bit.
  • Sprzęt w UE. Hetzner GEX131 (RTX PRO 6000 Blackwell Max-Q, 96 GB GDDR7, 256 GB DDR5 ECC) od 889,00 EUR miesięcznie, poprzednik GEX130 838,00 EUR miesięcznie plus 79,00 EUR opłaty jednorazowej (komunikaty prasowe Hetznera, grudzień 2025 i wrzesień 2024, ceny bez VAT).
  • Licencje. Bielik jest na Apache 2.0 w całej sprawdzonej rodzinie. PLLuM ma trzy reżimy: warianty 4B i 12B na Apache 2.0, Llama-PLLuM 8B i 70B na licencji społecznościowej Llama 3.1, a warianty z -nc- na CC-BY-NC-4.0, czyli bez zastosowań komercyjnych (karty modeli na HuggingFace i pllum.org.pl, odczyt 7 sierpnia 2026).
  • Praca inżynierska po stronie Syntalith: automatyzacje AI od 15 000 zł netto, aplikacje i agenci AI od 25 000 zł netto, typowe pełne wdrożenia 25 000–150 000 zł netto, utrzymanie wyceniane indywidualnie. Sam serwer GPU to osobna, powtarzalna pozycja w budżecie.

Start jest bezpłatny: skan procesów (0 zł) to 30 minut rozmowy z inżynierem i pisemne podsumowanie w 2 dni robocze. Jeśli przed decyzją sprzętową chcesz przenośny dokument z architekturą i stałą wyceną, Specyfikacja wdrożenia kosztuje 4 990 zł netto. Jeśli zlecisz nam budowę systemu, koszt Specyfikacji zaliczymy na poczet wdrożenia. Który model w ogóle wybrać, rozkładamy w przewodniku po polskich modelach językowych dla firm.

Ile VRAM naprawdę zajmuje model?

Tyle, ile ważą wagi w wybranej precyzji, powiększone o zapas na kontekst. To arytmetyka, którą warto przeliczyć samodzielnie, zanim ktokolwiek wystawi ofertę na sprzęt.

Wagi modelu to liczby. W bf16 każda zajmuje 2 bajty, więc model o 11 miliardach parametrów potrzebuje około 22 GB tylko na wagi. Kwantyzacja zapisuje te same liczby z mniejszą precyzją: 8-bit to jeden bajt na parametr, 4-bit około pół bajta. Do wyniku dolicz 15–25% na KV-cache (pamięć na kontekst rozmowy), aktywacje i narzut sterownika.

Modelbf168-bit4-bit (klasa Q4_K_M)Mieści się na 24 GB?
Bielik 4.5B~9 GB~4,5 GB~2,7 GBtak, nawet w bf16
PLLuM 8B / Llama-PLLuM 8B~16 GB~8 GB~4,7 GBbf16 ciasno przy krótkim kontekście, 4-bit swobodnie
Bielik 11B / PLLuM 12B~22–24 GB~11–12 GB~6,5–7 GBbf16 nie mieści się z użytecznym kontekstem, 4-bit swobodnie
PLLuM 8x7B (47B MoE)~94 GB~47 GB~26–28 GBnie; 4-bit wymaga 2× 24 GB albo 1× 48 GB
Llama-PLLuM 70B~140 GB~70 GB~40–43 GBnie; realnie 48–80 GB w 4-bit

Praktyczny wniosek jest jeden: karta 24 GB, czyli najtańsza dedykowana półka GPU w Europie, obsługuje w 4-bit cały użyteczny środek obu rodzin. Dopiero 70B wypycha projekt na sprzęt za kilkaset euro miesięcznie więcej.

Skąd różnica między ~48 GB w tabeli PLLuM a ~7 GB w 4-bit?

Z różnicy w założeniach. Obie liczby są prawdziwe i opisują dwa różne wdrożenia.

Sekcja infrastruktura na pllum.org.pl (odczyt 7 sierpnia 2026) podaje wymagania dla serwowania produkcyjnego: generator 8B około 34 GB, generator 12B około 48 GB, generator 24B około 70 GB, 8×7B około 134 GB, 70B około 168 GB. Do tego osobno retrieval i reranker: 24–48 GB. Rekomendowane karty to A10, V100, L40, A6000, A100, H100 i GH200.

Te liczby zakładają serwowanie bez kwantyzacji, z zapasem na KV-cache i na równoległe zapytania. Strona nie wspomina ani o kwantyzacji, ani o llama.cpp, Ollamie czy formacie GGUF. To rozsądny wybór dla instytucji publicznej, która kupuje sprzęt raz i chce mieć pewność wydajności przy wielu użytkownikach jednocześnie. Dla firmy, która chce najpierw sprawdzić, czy model w ogóle nadaje się do jej dokumentów, ta sama tabela zawyża wymagany budżet o rząd wielkości.

Uczciwa druga strona: kwantyzacja kosztuje jakość. Dla Bielika i PLLuM nie ma opublikowanego, datowanego pomiaru tego kosztu, więc żaden dostawca nie powinien obiecywać Ci „tylko kilku procent straty”. Jedyna sensowna procedura to własny zestaw ewaluacyjny: kilkadziesiąt realnych zadań z Twojego procesu, uruchomionych na bf16 i na 4-bit, i porównanie wyników. To praca na dzień lub dwa i rozstrzyga sprawę dla Twojego przypadku, zamiast dla cudzego benchmarku.

Na czym uruchomić model?

Na stosie, który autor modelu faktycznie wspiera, bo to skraca wdrożenie z tygodni do dni.

  • Ollama. Wsparcie pierwszej klasy dla Bielika: SpeakLeash publikuje modele we własnej przestrzeni ollama.com/SpeakLeash. Najkrótsza droga od pobrania do działającego endpointu, dobra na pilota i na wewnętrzne narzędzie o umiarkowanym ruchu.
  • llama.cpp i GGUF. Oficjalne buildy, w tym warianty IQ z kalibracją imatrix. Bielik-11B-v3.0-Instruct ma 17 wariantów kwantyzowanych celujących w llama.cpp, LM Studio, Jana i Ollamę (karta modelu, odczyt 7 sierpnia 2026). To ścieżka na CPU plus GPU i na sprzęt spoza półki NVIDIA.
  • FP8 na Ada Lovelace i Hopper. Dla Bielik-11B-v2.3-Instruct istnieją oficjalne buildy FP8 obok GGUF (Q4_K_M, Q5_K_M, Q6_K, Q8_0) i GPTQ 4-bit. Jeśli masz L40S albo H100, FP8 daje kompromis między jakością bf16 a zajętością pamięci.
  • Spekulatywne dekodowanie. Bielik-11B-v3.0-DFlash to model draftujący o wielkości około 1B, opublikowany 24 czerwca 2026, przeznaczony wyłącznie do przyspieszania modelu 11B. Nie działa samodzielnie.
  • Serwery wysokiej przepustowości. Bielik i PLLuM to standardowe architektury (Mistral, Mistral-Nemo, Llama 3.1, pochodne Qwen2.5), więc serwuje się je tak jak ich modele bazowe. Żadna ze stron projektów nie wymienia jednak vLLM z nazwy, więc traktuj to jako właściwość architektury, a nie zadeklarowane wsparcie.

Ile kosztuje serwer GPU w UE?

Tyle, ile najtańsza karta, która mieści Twój model z zapasem na kontekst. Publikować da się tylko ceny, które dostawca podał oficjalnie.

WariantSprzętCenaŹródło
Hetzner GEX131RTX PRO 6000 Blackwell Max-Q, 96 GB GDDR7, 256 GB DDR5 ECC, 2× 960 GB NVMeod 889,00 EUR / mies. (1,4247 EUR / godz.)komunikat prasowy Hetznera, 11 grudnia 2025
Hetzner GEX130poprzednia generacja838,00 EUR / mies. plus 79,00 EUR jednorazowokomunikat prasowy Hetznera, 24 września 2024
Hetzner GEX44RTX 4000 SFF Ada, 20 GB GDDR6 ECC, 64 GB DDR4pozycjonowany przez Hetznera pod inferencję AI; cenę sprawdź w konfiguratorzestrona produktowa, odczyt 7 sierpnia 2026
OVHcloudinstancje H100 do 4 GPU, 80 GB HBM3 na kartę; region Warszawa, rozliczenie godzinowe i miesięcznecennik GPU sprawdź na stronie OVHcloud w dniu decyzjiovhcloud.com/pl, odczyt 7 sierpnia 2026

Ceny bez VAT. Świadomie nie podajemy tu stawki godzinowej OVH ani ceny GEX44, bo dostępne źródła są rozbieżne albo wtórne. Przy tej klasie decyzji jedna liczba wzięta z drugiej ręki potrafi przesunąć budżet o kilkadziesiąt procent, więc obie pozycje sprawdza się w konfiguratorze dostawcy w dniu zakupu. Warto też zweryfikować, czy nowsze karty są dostępne w regionie warszawskim; hosting we Francji lub w Niemczech pozostaje w EOG i z perspektywy RODO jest równoważny.

Do rachunku dolicz to, czego cennik karty nie obejmuje: dysk na modele i indeks wektorowy, backup, monitoring, oraz drugą maszynę, jeśli potrzebujesz środowiska testowego obok produkcji.

Kiedy własny serwer wychodzi taniej niż API?

Powyżej progu wolumenu, który liczysz sam. Poniżej to jest zabawa w administratora za własne pieniądze.

Scenariusz modelowany. Poniższe liczby ilustrują metodę i nie pochodzą z żadnego wdrożenia u klienta. Podstaw własne.

Miesięczny wolumen tokenów =
  liczba dokumentów miesięcznie
  x (tokeny wejścia na dokument + tokeny wyjścia na dokument)

Miesięczny koszt API =
  wolumen tokenów / 1 000 000
  x aktualna stawka dostawcy za milion tokenów

Próg opłacalności serwera =
  miesięczny koszt serwera GPU / (wolumen tokenów / 1 000 000)

Załóżmy 20 000 dokumentów miesięcznie po 3 000 tokenów wejścia i 1 000 tokenów wyjścia. To 80 milionów tokenów miesięcznie. Przy serwerze za 889 EUR miesięcznie próg wynosi 889 / 80, czyli około 11,1 EUR za milion tokenów. Jeśli mieszana stawka Twojego dostawcy jest wyraźnie niższa, API wygrywa. Jeśli wyższa, warto liczyć dalej.

Świadomie nie podajemy tu cen żadnego dostawcy API. Stawki zmieniają się kilka razy w roku, a artykuł z zeszłego kwartału jest w tej kwestii gorszym źródłem niż cennik otwarty w przeglądarce. Wejdź na stronę cenową swojego dostawcy, weź stawkę dla modelu, którego realnie używasz, i podstaw ją do wzoru powyżej.

Do kosztu serwera dolicz jeszcze pracę: wdrożenie, ewaluacje, monitoring i utrzymanie. Rachunek „serwer kontra API” jest uczciwy dopiero wtedy, gdy po stronie własnego hostingu stoi też etat lub umowa utrzymaniowa. Szerzej tę decyzję rozkładamy w tekście polski model językowy czy API: jak wybrać.

Co z RODO?

On-premise rozwiązuje problem transferu danych i zostawia całą resztę obowiązków.

Wdrożenie na własnej infrastrukturze. PLLuM stawia to wprost jako założenie architektury: wdrożenie jest w całości on-premise, a dane pozostają w infrastrukturze instytucji (pllum.org.pl, odczyt 7 sierpnia 2026). To najmocniejsza polskojęzyczna referencja dla argumentu „dane zostają u nas”, bo pochodzi od projektu państwowego, a nie od dostawcy. W tym układzie nie ma powierzenia przetwarzania na zewnątrz, bo nie ma zewnętrznego podmiotu.

Hosting w UE u zewnętrznego dostawcy. Tu powierzenie występuje i potrzebujesz umowy z art. 28 RODO. Hetzner oferuje opcjonalną umowę powierzenia i centra danych w UE, bez minimalnego okresu obowiązywania (strona produktowa, odczyt 7 sierpnia 2026). To warunek wejścia, a nie formalność do dopięcia po starcie.

Czego własny serwer nie załatwia. Rejestr czynności przetwarzania, podstawa prawna, ocena skutków tam, gdzie jest wymagana, kontrola dostępu, retencja logów i szkolenie zespołu pozostają Twoje. Jeśli asystent czyta dokumenty kadrowe, model działający we własnej serwerowni nie zmienia tego, kto ma prawo je zobaczyć. Warstwy izolacji od chmury po air-gap rozkładamy w tekście on-prem i air-gap: poziomy izolacji, a samą umowę powierzenia w tekście RODO i DPA przy wdrożeniu AI.

Czego nie widać w wycenie sprzętu

Utrzymania. To jest miejsce, w którym wdrożenia Bielika i PLLuM najczęściej się rozjeżdżają.

Tempo wydań. PLLuM przeszedł ze znacznika 2412 przez 2508 i 2512 do partii jedenastu modeli ogłoszonej 21 maja 2026. Bielik: v2, v2.3, v3, następnie warianty z dedykowanym polskim tokenizerem 15 kwietnia 2026, model draftujący DFlash 24 czerwca 2026 i zapowiedziana wersja v3.1. Każda podmiana modelu to ponowna kwantyzacja, ponowne uruchomienie zestawu ewaluacyjnego i sprawdzenie, czy prompty nadal działają. Bez tego aktualizacja jest hazardem.

Generator to nie cały system. Tabela PLLuM przewiduje osobne 24–48 GB na retrieval i reranker. W praktyce oznacza to drugi komponent do utrzymania, z własnym cyklem indeksowania dokumentów i własnymi regresjami jakości wyszukiwania.

Self-hosting to nie jest zarządzana infrastruktura ML. Konfiguracja, sterowniki, aktualizacje CUDA i zarządzanie instancją są po stronie klienta, co dostawcy chmury zapisują wprost w dokumentacji. Kupujesz sprzęt i sieć, obsługa modelu zostaje u Ciebie albo u partnera, który to prowadzi.

To jest dokładnie ta praca, którą Syntalith dostarcza: wdrożenie modelu, ewaluacje na Twoich zadaniach, monitoring jakości odpowiedzi i utrzymanie po starcie. Wyceniamy ją jak każdą inną automatyzację lub aplikację (od 15 000 zł i od 25 000 zł netto), a utrzymanie indywidualnie, bo zależy od tego, ile modeli utrzymujesz i jak często je podmieniasz. Pełne stawki są w cenniku.

Kiedy NIE hostować Bielika ani PLLuM u siebie

Uczciwie: w większości firm pierwsza wersja procesu nie powinna stać na własnym GPU.

  • Mały wolumen. Kilkaset dokumentów miesięcznie nie zbliża się do progu z powyższego rachunku. Stały koszt serwera przegrywa z rozliczeniem za użycie, zanim policzysz pracę inżynierską.
  • Zadanie wymaga twardego rozumowania. Modele 4–12B nie są w tej samej klasie co modele frontier na złożonym rozumowaniu i kodzie. Niezależny test Oxido opublikowany 17 marca 2026 (relacja Bankier.pl) obejmował 20 zadań w 10 kategoriach; wygrał model Google, a Bielik i PLLuM znalazły się w dolnej części zestawienia. To jeden test, ale datowany, niezależny i polski, więc lepszy punkt odniesienia niż deklaracja dowolnego dostawcy.
  • Nie masz kto tego utrzyma. Jeśli w firmie nie ma nikogo od infrastruktury, a partner utrzymaniowy nie jest przewidziany w budżecie, model zestarzeje się na serwerze razem ze sterownikami.
  • Potrzebujesz jednego eksperymentu. Do sprawdzenia, czy pomysł w ogóle działa, API jest szybsze i tańsze. Migracja na Bielika albo PLLuM u siebie ma sens, gdy proces jest już zdefiniowany, a wolumen znany.
  • Dane nie są wrażliwe. Jeśli nic nie blokuje przetwarzania u dostawcy z umową powierzenia i hostingiem w UE, argument regulacyjny odpada, a zostaje sam rachunek kosztów.

Jeśli któryś punkt pasuje do Twojej sytuacji, powiemy to na skanie, zanim wydasz złotówkę na sprzęt. Co każdy z tych modeli daje w praktyce, rozkładamy osobno dla PLLuM i dla Bielika. Jeśli szukasz lżejszego wariantu na jednym serwerze, zobacz też własny agent AI na VPS.

Jak zacząć

Najtańszy sensowny pierwszy krok to policzyć wolumen i zdefiniować zadanie. Zakup karty przychodzi później.

  1. Umów bezpłatny skan procesów: 30 minut z inżynierem i pisemne podsumowanie w 2 dni robocze. Bez prezentacji sprzedażowej, rozmawiasz z inżynierem, który będzie budował.
  2. Przygotuj: ile dokumentów miesięcznie, jakiej długości, jakie zadanie ma wykonać model, jakie dane w tym siedzą i czy jest wymóg, żeby nie opuszczały Twojego środowiska.
  3. Po rozmowie dostaniesz rekomendację: polski model z konkretną kartą i stosem, model przez API, Specyfikacja wdrożenia albo uczciwe „przy tym wolumenie własny serwer się nie zwróci”.

Umów bezpłatny skan procesów | Zobacz cennik | Czym jest agent AI

Powiązane artykuły

Najczęstsze pytania

Ile VRAM potrzeba, żeby uruchomić Bielika 11B albo PLLuM 12B?
W bf16 same wagi zajmują około 22–24 GB, więc karta 24 GB nie zostawia miejsca na kontekst. W kwantyzacji 8-bit to około 11–12 GB, a w 4-bit około 6,5–7 GB, plus 15–25% zapasu na KV-cache i narzut. To arytmetyka z reguły „2 GB na miliard parametrów w bf16”, którą możesz przeliczyć sam, a nie pomiar.
Dlaczego oficjalna tabela PLLuM mówi o 48 GB dla modelu 12B?
Bo sekcja infrastruktura na pllum.org.pl (odczyt 7 sierpnia 2026) zakłada serwowanie bez kwantyzacji, z zapasem na KV-cache i produkcyjny RAG, i w ogóle nie wspomina o kwantyzacji ani o llama.cpp czy Ollamie. Obie liczby są prawdziwe: ~48 GB opisuje inny scenariusz niż ~7 GB w 4-bit. Kwantyzacja kosztuje jakość, a dla tych modeli nie ma opublikowanego, datowanego pomiaru tego kosztu.
Ile kosztuje serwer GPU w Unii Europejskiej?
Hetzner podaje dla GEX131 (RTX PRO 6000 Blackwell Max-Q, 96 GB GDDR7) cenę od 889,00 EUR miesięcznie, a dla poprzednika GEX130 838,00 EUR miesięcznie plus 79,00 EUR opłaty jednorazowej (komunikaty prasowe Hetznera, grudzień 2025 i wrzesień 2024, ceny bez VAT). Model 11–12B w 4-bit zmieści się na dużo tańszej karcie 20–24 GB.
Czy polski model na własnym serwerze załatwia RODO?
Wdrożenie on-premise oznacza, że dane pozostają w infrastrukturze instytucji, co PLLuM wprost stawia jako założenie swojej architektury. Hosting w UE u zewnętrznego dostawcy to nadal powierzenie przetwarzania: potrzebujesz umowy z art. 28 RODO. Hetzner taką umowę oferuje. Bielik albo PLLuM u siebie upraszcza kwestię transferu danych i nie zwalnia z rejestru czynności, analizy ryzyka ani kontroli dostępu.

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

Bez prezentacji sprzedażowej i bez zobowiązań. Jeśli automatyzacja nie ma sensu, też to napiszemy.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze