Przejdź do treści
Wróć do bloga
Polskie modele AIBielik dla biznesu - 2026

Bielik: polski model językowy dla biznesu. Rodzina modeli, licencja, sprzęt i uczciwe benchmarki (2026)

Bielik to otwarta rodzina polskich modeli językowych od SpeakLeash i ACK Cyfronet AGH, wydana w całości na licencji Apache 2.0, więc wolno jej używać komercyjnie. Wersja 11B po kwantyzacji 4-bit mieści się na jednej karcie 24 GB. Wdrożenie zaczyna się od 15 000 zł netto.

Bielik to otwarty polski model językowy na licencji Apache 2.0, trenowany na superkomputerach ACK Cyfronet AGH. Ten tekst pokazuje rodzinę modeli, realne wymagania sprzętowe, benchmarki bez lukru i sytuacje, w których Bielik jest złym wyborem.

12 min czytania

Bielik to otwarta rodzina polskich modeli językowych budowana przez fundację SpeakLeash i ACK Cyfronet AGH, wydana w całości na licencji Apache 2.0, więc wolno jej używać komercyjnie bez opłat licencyjnych. Warianty mają od 1,5 do 11 miliardów parametrów, a wersja 11B po kwantyzacji 4-bit mieści się na jednej karcie 24 GB. Wdrożenie w Syntalith zaczyna się od 15 000 zł netto.

Szybka odpowiedź

Bielik jest dziś najprostszym otwartym modelem polskojęzycznym do postawienia u siebie, bo licencja nie stawia żadnych warunków biznesowych, a autorzy sami publikują wersje skwantyzowane pod popularne silniki. Decyzję warto oprzeć na pięciu faktach:

  • Licencja: Apache 2.0 w całej sprawdzonej rodzinie (karty modeli HuggingFace, 7 sierpnia 2026). Użycie komercyjne, modyfikacja, wdrożenie u klienta, bez progu przychodowego i bez polityki dopuszczalnego użycia narzuconej przez dostawcę.
  • Sprzęt: karta 24 GB wystarcza dla 11B w 4-bit. To arytmetyka do powtórzenia u siebie: około 0,5–0,6 GB na miliard parametrów plus 15–25% zapasu na KV-cache i kontekst.
  • Jakość: zależy od zadania. Własny leaderboard SpeakLeash pokazuje 65,71 średniej dla 11B v2.3. Niezależny test Oxido opisany przez Bankier.pl 17 marca 2026 umieścił Bielika w dolnej części stawki. Obie liczby są prawdziwe i mierzą co innego.
  • Kontekst: 32 768 tokenów potwierdzone tylko dla wersji v2. Dla serii v3 karty modeli nie podają tej wartości, więc nie zakładamy jej z góry.
  • Koszt wdrożenia w Syntalith, netto: automatyzacje AI od 15 000 zł, aplikacje AI i agenci AI od 25 000 zł, typowe pełne wdrożenia 25 000–150 000 zł, utrzymanie wyceniane indywidualnie.

Start jest bezpłatny: skan procesów (0 zł) to 30 minut rozmowy z inżynierem i pisemne podsumowanie w 2 dni robocze. Bez prezentacji sprzedażowej, rozmawiasz z inżynierem, który będzie budował. Szerszy obraz obu polskich rodzin modeli jest w tekście polskie modele językowe PLLuM i Bielik dla firm.

Kto buduje Bielika i na czym go trenowano?

Bielik powstaje we współpracy dwóch podmiotów: fundacji SpeakLeash (znanej też jako Spichlerz), która prowadzi projekt otwartoźródłowo, oraz ACK Cyfronet AGH, akademickiego centrum superkomputerowego w Krakowie. Ten skład jest podany na każdej karcie modelu na HuggingFace (odczyt 7 sierpnia 2026).

Trening odbywa się na superkomputerach Athena i Helios w Cyfronecie, w ramach grantów obliczeniowych PLGrid; karta modelu Bielik-11B-v3.0-Instruct wskazuje grant PLG/2024/016951. Najlepiej udokumentowany przebieg dotyczy wariantu Bielik-4.5B-v3: trenowany na Heliosie na 256 kartach NVIDIA GH200, na 292 miliardach tokenów przez 1,2 epoki, zainicjalizowany z Qwen2.5 3B, we własnym frameworku SpeakLeash o nazwie ALLaMo.

To ma znaczenie dla kupującego z dwóch powodów. Po pierwsze, budżet obliczeniowy jest jawny, więc widać skalę: to projekt akademicko-społecznościowy, a nie laboratorium frontierowe. Po drugie, infrastruktura jest polska i publiczna, co bardzo ułatwia rozmowę o pochodzeniu modelu w organizacjach, które muszą to udokumentować.

Wokół projektu wyrosło zaplecze biznesowe. Prezesem Bielik.AI jest Sebastian Kondracki, który w rozmowie z Bankier.pl (28 czerwca 2026) podawał 2,8 mln pobrań modeli i wskazywał ochronę zdrowia oraz finanse jako sektory, w których dane nie mogą trafiać na serwery chmurowe. Na 26 listopada 2026 zapowiedziano Bielik Summit. Te liczby pochodzą z jednego źródła prasowego i tak je traktujemy.

Jakie modele są w rodzinie Bielik w 2026?

Rodzina jest szersza, niż sugeruje nazwa. Poniżej stan na 7 sierpnia 2026, z kart modeli i bloga SpeakLeash.

ModelParametryLicencjaCo to jest
Bielik-11B-v211BApache 2.0baza z Mistral-7B-v0.2 pogłębiona o dodatkowe warstwy, 400 mld tokenów, kontekst 32 768
Bielik-11B-v2.3-Instruct11BApache 2.0liniowe scalenie wariantów v2.0–v2.2, ponad 20 mln instrukcji, DPO-Positive
Bielik-4.5B-v34,6BApache 2.0baza z Qwen2.5 3B, 292 mld tokenów, trening na 256× GH200
Bielik-11B-v3-Base-2025073011BApache 2.0baza serii v3, datowana 30 lipca 2025
Bielik-11B-v3.0-Instruct11BApache 2.032 języki europejskie, SFT → DPO-Positive (114 tys. par) → RL metodami GRPO i Dr.GRPO
Bielik-PL-Minitron-7B-v3.0-Instruct7BApache 2.0przycięty i destylowany z 11B, około 50% szybszy przy około 90% zachowanej jakości
Bielik-11B-v3.0-DFlash~1BApache 2.0model roboczy do dekodowania spekulatywnego, nie działa samodzielnie

Seria v3 wyszła w rozmiarach 1,5B, 4,5B i 11B. Dwie daty z 2026 roku warto zapamiętać:

  • 15 kwietnia 2026: Bielik-PL-11B-v3.0-Instruct i Bielik-PL-Minitron-7B-v3.0-Instruct, pierwsze warianty z dedykowanym tokenizerem zoptymalizowanym pod polszczyznę. Towarzyszy im praca „Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series" (arXiv 2604.10799, 12 kwietnia 2026). Autorzy raportują, że modele z polskim tokenizerem utrzymują wynik na dziewięciu benchmarkach polskich i wielojęzycznych, a na CPTUB i Polish EQ-Bench przewyższają oryginały, przy zachowanej sprawności w angielskim.
  • 24 czerwca 2026: Bielik-11B-v3.0-DFlash, model roboczy około 1B do dekodowania spekulatywnego. W praktyce mały model proponuje ciąg tokenów, a duży go weryfikuje, co skraca czas odpowiedzi bez zmiany modelu głównego.

Wersja v3.1 rozszerzająca zasięg z 30 do 50 języków była zapowiadana na czerwiec 2026 (Bankier.pl, 28 czerwca 2026), ale na 7 sierpnia 2026 nie widzieliśmy jej na liście modeli SpeakLeash. Traktujemy ją jako zapowiedzianą i niepotwierdzoną.

Dedykowany tokenizer i model DFlash to dwie rzeczy, które w praktyce robią większą różnicę niż kolejny punkt na benchmarku: pierwszy obniża liczbę tokenów na to samo polskie zdanie, drugi obniża opóźnienie. Oba przekładają się wprost na koszt jednego zapytania na Twoim GPU.

Co realnie daje licencja Apache 2.0?

To jest najmocniejszy argument Bielika i warto go rozumieć dokładnie. Apache 2.0 pozwala używać modelu komercyjnie, modyfikować go, dostrajać na własnych danych i wdrażać u klienta, bez opłat licencyjnych, bez progu liczby użytkowników i bez polityki dopuszczalnego użycia narzucanej przez dostawcę. Cała sprawdzona przez nas rodzina Bielika jest na tej licencji.

Kontrast z PLLuM pokazuje, dlaczego to nie jest formalność:

RodzinaWariantyLicencjaUżycie komercyjne
Bielikwszystkie sprawdzone (1,5B–11B, Minitron, DFlash)Apache 2.0tak, bez warunków dodatkowych
PLLuMPLLuM-4B-, PLLuM-12B- (2512)Apache 2.0tak
PLLuMLlama-PLLuM-8B-, Llama-PLLuM-70B-Llama 3.1 Community Licensetak, ale na warunkach Meta (polityka użycia, atrybucja, klauzula 700 mln MAU)
PLLuMwszystkie warianty -nc-, w tym PLLuM-8x7B-nc-instructCC-BY-NC-4.0nie, wyłącznie badania

Źródło: karty modeli i listing organizacji na HuggingFace oraz pllum.org.pl, odczyt 7 sierpnia 2026.

Haczyk po stronie PLLuM jest podwójny, bo warianty -nc- widziały w kontynuowanym pretreningu około 150 mld tokenów polskiego tekstu, a warianty otwarte tylko 28–30 mld (podzbiór wolny od problemów prawnoautorskich). Najlepiej wytrenowane wersje są więc równocześnie tymi, których nie wolno użyć w produkcie. U Bielika ten kompromis nie występuje: wersja, którą można wdrożyć u klienta, jest tą samą, którą autorzy pokazują na benchmarkach. Jak to wygląda od strony wdrożeniowej PLLuM, rozkładamy w tekście o wdrożeniu PLLuM w firmie.

Jedno zastrzeżenie: licencja modelu nie jest zgodnością z RODO. Otwarta waga rozwiązuje kwestię prawa do użycia, a nie kwestię umowy powierzenia, lokalizacji danych i rejestru czynności. To osobna praca, opisana w tekście o RODO i DPA przy wdrożeniu AI.

Ile sprzętu potrzeba, żeby uruchomić Bielika?

Poniżej arytmetyka, którą możesz powtórzyć samodzielnie, a nie zmierzony wynik. Reguła: w bf16 model zajmuje mniej więcej 2 GB na miliard parametrów, w 8 bitach około 1 GB, w 4 bitach około 0,5–0,6 GB. Do tego doliczasz 15–25% na KV-cache, aktywacje i kontekst CUDA.

Wariantbf168-bit4-bitKarta 24 GB (RTX 4090 / A10 / L4)
Bielik 1,5B~3 GB~1,5 GB~0,9 GBtak, z dużym zapasem
Bielik 4,5B~9 GB~4,5 GB~2,7 GBtak, nawet w bf16
Bielik Minitron 7B~14 GB~7 GB~4 GBbf16 ciasno przy krótkim kontekście, 4-bit swobodnie
Bielik 11B~22 GB~11 GB~6,5–7 GBbf16 nie mieści się z użytecznym kontekstem, 4-bit mieści się z zapasem

Wniosek jest prosty: 11B w 4 bitach zajmuje około 7 GB wagi i pracuje wygodnie na jednej karcie 24 GB. Dla porównania, oficjalna tabela infrastrukturalna PLLuM (pllum.org.pl, odczyt 7 sierpnia 2026) mówi o około 48 GB dla generatora 12B, bo zakłada serwowanie w fp16 z zapasem produkcyjnym i osobny stos retrieval z rerankerem na 24–48 GB. Obie liczby są uczciwe, tylko opisują inne wdrożenia.

Kwantyzacja ma cenę i tu trzeba być precyzyjnym: nie istnieje opublikowany, datowany pomiar spadku jakości Bielika przy Q4 względem bf16, więc nikt nie powinien podawać Ci procentu. Deklaracja SpeakLeash o zachowaniu około 90% jakości dotyczy Minitrona, czyli przycinania i destylacji, a nie kwantyzacji. Jeśli sprzedawca miesza te dwie rzeczy, wiesz już, ile warta jest reszta jego liczb.

Po stronie uruchomienia droga jest krótka. SpeakLeash publikuje oficjalne kwantyzacje: dla Bielik-11B-v2.3-Instruct są to GGUF (Q4_K_M, Q5_K_M, Q6_K, Q8_0), GPTQ 4-bit i FP8 dla kart Ada Lovelace oraz Hopper, plus eksperymentalne warianty IQ z kalibracją imatrix. Wariant Bielik-11B-v3.0-Instruct ma 17 wersji skwantyzowanych przygotowanych pod llama.cpp, LM Studio, Jan i Ollama, a oficjalna przestrzeń w Ollamie to ollama.com/SpeakLeash. Architektury są standardowe (pochodne Mistrala i Qwena), więc serwuje je vLLM tak samo jak modele bazowe, choć SpeakLeash nie wymienia vLLM jako oficjalnie wspieranego celu.

Rachunek hostingowy, jako scenariusz modelowany: karta klasy 24 GB w europejskim centrum danych to najtańszy sensowny próg dla Bielika 11B w 4-bit. Jeśli potrzebujesz zapasu na większy kontekst, równoległe sesje albo model 70B z innej rodziny, u Hetznera w Niemczech maszyna GEX131 z kartą RTX PRO 6000 Blackwell Max-Q i 96 GB VRAM kosztuje od 889 EUR miesięcznie netto (komunikat prasowy Hetznera z 11 grudnia 2025). Hetzner oferuje umowę powierzenia w trybie art. 28 RODO bez minimalnego okresu. Własne liczby podstawiasz sam: miesięczny koszt serwera podzielony przez liczbę zapytań daje koszt jednostkowy do porównania ze stawką za tokeny u dostawcy API. Pełny rachunek sprzętu, prądu i utrzymania rozkładamy w tekście o wdrożeniu polskiego LLM: sprzęt, koszty, RODO.

Jak dobrze Bielik wypada w testach?

Tu potrzebna jest ostrożność, bo krążą dwa zestawy liczb i oba są prawdziwe.

Liczby autorów. Bielik-11B-v2.3-Instruct ma 65,71 średniej na Open PL LLM Leaderboard, a Bielik-11B-v3.0-Instruct 65,93 w trybie 5-shot; Bielik-PL-Minitron-7B-v3.0-Instruct osiąga 61,66 (karta modelu i blog speakleash.org z 15 kwietnia 2026). SpeakLeash podaje też, że wersja v3.0-Instruct wyprzedza na tym zestawie Meta-Llama-3.1-70B-Instruct. Ten leaderboard prowadzi sam SpeakLeash i to trzeba powiedzieć wprost. Nie znaczy to, że liczby są nieprawdziwe; znaczy, że pochodzą od strony zainteresowanej i mierzą baterię 29 polskich zadań NLP, a nie otwarte rozumowanie, kod czy trzymanie się złożonych instrukcji.

Liczby niezależne. Test firmy Oxido opisany przez Bankier.pl 17 marca 2026 objął 20 zadań w 10 kategoriach: pisanie maili, doradztwo biznesowe, poprawność językowa, historia i kultura polska (z recytacją pierwszych dwunastu wersów inwokacji „Pana Tadeusza"), pytania prawne i podatkowe, marketing. Wygrał model Google, na podium znalazły się też Qwen i Llama od Mety, a Bielik i PLLuM wylądowały w dolnej części stawki. W zadaniu z „Panem Tadeuszem" Bielik zajął ósme miejsce, PLLuM trzecie od końca. Autor testu Marek Jeleśniański określił wynik Bielika jako przyzwoity biorąc pod uwagę nieporównywalnie mniejsze zasoby.

Te dwa obrazy da się pogodzić. Benchmarki polskie mierzą klasyfikację, rozumienie tekstu i zadania językowe, gdzie model dostrojony na polszczyźnie realnie wygrywa z większym modelem ogólnym. Testy w stylu Oxido mierzą otwarte zadania użytkowe, gdzie decyduje surowa pojemność modelu. Przy 4–11 miliardach parametrów Bielik nie jest w tej samej klasie wagowej co modele frontierowe w rozumowaniu i kodzie, i żaden opublikowany polski benchmark temu nie przeczy. Nie znaleźliśmy też publicznych porównań Bielika z GPT, Claude czy Gemini na GSM8K, MATH czy HumanEval, więc nie podajemy wielkości tej różnicy. Kto ją podaje, zgaduje.

Ostatnia rzecz do sprawdzenia w każdej ofercie: kontekst 32 768 tokenów jest potwierdzony wyłącznie dla Bielika 11B v2. Karty serii v3 tej wartości nie podają. 32k wystarcza do RAG na pociętych dokumentach, ale jest daleko od 200k–1M oferowanych przez dzisiejsze API frontierowe. Jeśli Twój proces wymaga wrzucenia całej umowy albo kwartału korespondencji w jedno zapytanie, to jest twarde ograniczenie architektury, opisane szerzej przy asystencie wiedzy AI opartym o RAG.

Kiedy Bielik NIE jest właściwym wyborem?

Uczciwie: w większości procesów, które oglądamy na skanie, własny serwer z modelem nie jest pierwszym wyborem. Bielik odpada w co najmniej pięciu sytuacjach.

  • Proces wymaga twardego rozumowania albo generowania kodu. Analiza wielostopniowa, wnioskowanie prawne z długiego materiału, pisanie i poprawianie kodu: tu model frontierowy przez API jest wyraźnie mocniejszy, a różnicy nie nadrobi się promptem.
  • Wolumen jest mały. Kilkaset zapytań miesięcznie nie zwróci kosztu serwera GPU i utrzymania. Rachunek robi się prosty: miesięczny koszt hostingu i opieki kontra ta sama liczba zapytań rozliczona po stawkach API. Kryteria tego wyboru rozkładamy w tekście polski model językowy czy API.
  • Potrzebujesz długiego kontekstu. 32k na wersji v2 zamyka scenariusze, w których proces polega na jednorazowym podaniu bardzo dużego materiału.
  • Nie ma kto tego utrzymywać. Tempo wydań jest wysokie: v2 → v2.3 → v3 → wersje z polskim tokenizerem w kwietniu 2026 → DFlash w czerwcu 2026 → zapowiedziana v3.1. Każda podmiana to ponowna ewaluacja, ponowna kwantyzacja i regresja promptów oraz testów. Ktoś musi mieć to w zakresie obowiązków.
  • Zadanie jest wielojęzyczne poza Europą. v3.0-Instruct deklaruje 32 języki europejskie. Poza tym zbiorem model ogólny wypadnie lepiej.

Bielik ma sens wtedy, gdy dane naprawdę nie mogą opuścić Twojej infrastruktury (albo wymaga tego regulator, jak przy DORA i wymogu prawa do audytu dostawcy ICT), gdy wolumen jest duży i rozliczanie za tokeny przestaje się opłacać, albo gdy zadanie jest wąskie i powtarzalne: klasyfikacja zgłoszeń, ekstrakcja pól z polskich dokumentów, streszczanie, przepisywanie. Poziomy izolacji, od chmury po air gap, opisujemy w tekście o on-prem i air gap.

Jak wygląda wdrożenie w Syntalith?

Budujemy systemy AI dla firm i to obejmuje rozwiązania oparte na Bieliku, uruchamiane na infrastrukturze klienta albo w hostingu w UE, kiedy wymagania danych, postawa RODO albo profil kosztowy tego wymagają. Pracujemy też z modelami przez API i mówimy wprost, że w trudnym rozumowaniu są mocniejsze. Wybór modelu jest decyzją inżynierską, podejmowaną osobno dla każdego procesu, a nie deklaracją światopoglądową. Nie mamy publicznej, nazwanej wdrożeniowej referencji na Bieliku i nie będziemy takiej sugerować.

Ceny, netto: automatyzacje AI od 15 000 zł, aplikacje AI i agenci AI od 25 000 zł, typowe pełne wdrożenia 25 000–150 000 zł, utrzymanie wyceniane indywidualnie. Jeśli przed większą decyzją potrzebujesz przenośnego dokumentu z architekturą i stałą wyceną, Specyfikacja wdrożenia kosztuje 4 990 zł netto i możesz z nią pójść do dowolnego wykonawcy. Jeśli zlecisz nam budowę systemu, koszt Specyfikacji zaliczymy na poczet wdrożenia. Pełny cennik jest na stronie.

Na skanie sprawdzamy trzy rzeczy w tej kolejności: czy proces w ogóle wymaga własnego modelu, czy zadanie mieści się w możliwościach modelu 11B, i ile realnie kosztuje utrzymanie w porównaniu z API przy Twoim wolumenie. Jeśli odpowiedź brzmi „użyj API", powiemy to.

Jak zacząć

  1. Umów bezpłatny skan procesów: 30 minut z inżynierem i pisemne podsumowanie w 2 dni robocze.
  2. Przygotuj trzy liczby: ile zapytań miesięcznie, jakie dane wchodzą do modelu i czy istnieje wymóg, żeby nie opuszczały Twojego środowiska.
  3. Po rozmowie dostaniesz rekomendację: Bielik na Twoim sprzęcie, model przez API, wariant mieszany albo uczciwe „ten proces nie potrzebuje modelu".

Umów bezpłatny skan procesów | Zobacz cennik | Czym jest agent AI

Powiązane artykuły

Najczęstsze pytania

Czym jest Bielik i kto go tworzy?
Bielik to rodzina otwartych polskich modeli językowych rozwijana wspólnie przez fundację SpeakLeash (Spichlerz) i ACK Cyfronet AGH. Modele trenowano na superkomputerach Athena i Helios w ramach grantów obliczeniowych PLGrid. Rodzina obejmuje warianty od 1,5B do 11B parametrów, plus model Minitron 7B i model roboczy DFlash do dekodowania spekulatywnego (dane z kart modeli na HuggingFace, sierpień 2026).
Czy Bielika można używać komercyjnie?
Tak. Wszystkie sprawdzone przez nas warianty Bielika są wydane na licencji Apache 2.0, która pozwala na użycie komercyjne, modyfikację i wdrożenie na własnej infrastrukturze bez opłat licencyjnych (karty modeli HuggingFace, stan na 7 sierpnia 2026). To odróżnia Bielika od PLLuM, gdzie najlepiej wytrenowane warianty z oznaczeniem -nc- mają licencję CC-BY-NC-4.0 i są przeznaczone wyłącznie do badań.
Jaki sprzęt jest potrzebny do uruchomienia Bielika 11B?
To arytmetyka, którą można powtórzyć: w bf16 waga 11B zajmuje około 22 GB, czyli na karcie 24 GB zabraknie miejsca na kontekst. Po kwantyzacji 4-bit (Q4_K_M) waga schodzi do około 6,5–7 GB i model mieści się na karcie 24 GB z zapasem na KV-cache. SpeakLeash publikuje oficjalne kwantyzacje GGUF, GPTQ 4-bit i FP8.
Czy Bielik jest lepszy od ChatGPT w polskim?
Nie w każdym zadaniu. Na leaderboardzie Open PL LLM wariant 11B v2.3 ma średnią 65,71, ale leaderboard prowadzi sam SpeakLeash. W niezależnym teście Oxido opisanym przez Bankier.pl 17 marca 2026 Bielik i PLLuM znalazły się w dolnej części stawki, a wygrał model Google. Uczciwa odpowiedź brzmi: przy 4–11 miliardach parametrów Bielik nie jest w tej samej klasie co modele frontierowe w rozumowaniu i kodzie.
Ile kosztuje wdrożenie systemu opartego na Bieliku?
W Syntalith automatyzacje AI zaczynają się od 15 000 zł netto, a aplikacje i agenci AI od 25 000 zł netto; typowe pełne wdrożenia mieszczą się w 25 000–150 000 zł netto. Do tego dochodzi hosting GPU: karta 24 GB w europejskim centrum danych to najtańszy sensowny próg, a klasa 96 GB u Hetznera zaczyna się od 889 EUR miesięcznie netto (cennik z grudnia 2025).

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

Bez prezentacji sprzedażowej i bez zobowiązań. Jeśli automatyzacja nie ma sensu, też to napiszemy.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze