Qwen, DeepSeek, Kimi i GLM: co wdrożyć lokalnie?
Porównanie Qwen3.8, DeepSeek V4.1, Kimi K3 i GLM-5.3. Wagi, sprzęt i wybór modelu do prywatnego wdrożenia w polskiej firmie z Syntalith.
Syntalith
Qwen na komputerze pracownika i Kimi na klastrze GPU mogą oba korzystać z otwartych wag. Różnią się jednak budżetem, obsługą i zakresem zastosowań. Dlatego przegląd modeli zaczynamy od pytania, gdzie ma działać system i jaką pracę ma wykonać.
Poniższy wybór opiera się na materiałach producentów sprawdzonych 28 września 2026. To przegląd kandydatów do testu. Nie wykonaliśmy wspólnego benchmarku tych modeli na danych klientów.
Co jest dostępne w nowych rodzinach
| Rodzina i wersja | Co wynika z oficjalnego źródła | Konsekwencja dla wdrożenia |
|---|---|---|
| Qwen3.8-27B | Model z dostępnymi wagami; mniejszy wariant rodziny Qwen3.8 | Kandydat do kontrolowanej instalacji na jednej karcie po kwantyzacji |
| Qwen3.8-Flash-Next | 125B parametrów części głównej, 6B aktywnych, dodatkowo embeddingi n-gram i MTP | Aktywne 6B nie oznacza rozmiaru plików ani pamięci potrzebnej na cały model |
| DeepSeek-V4.1-Flash | Multimodalny MoE, 552B parametrów części głównej, licencja MIT | Oceniaj pełny model i obsługę jego architektury przez serwer |
| Kimi K3 | 2,8T parametrów, 104B aktywnych, własna licencja Kimi K3 | Wdrożenie wymaga infrastruktury adekwatnej do bardzo dużych wag |
| GLM-5.3 i GLM-5.3-Flash | Repozytorium podaje warianty 744B-A40B i 320B-A18B oraz ścieżki lokalnego serwowania | Wersję, precyzję i licencję sprawdzaj dla pobieranego artefaktu |
Oficjalny projekt Qwen opublikował też raport Qwen3.8-Omni, dotyczący pracy z tekstem, obrazem, dźwiękiem i wideo. Publikacja raportu oraz narzędzi nie jest sama w sobie potwierdzeniem, że wszystkie opisane modele można pobrać i uruchomić lokalnie. Do wyceny potrzebujemy rzeczywistych wag i działającego silnika.
Mniejsze modele też trafiają do porównania
Na liście warto zostawić Gemma 4 12B, Mistral Small 4 i gpt-oss. Reprezentują różne rozmiary i architektury. Nazwa Small nie określa wymagań domowego komputera: Mistral Small 4 ma 119B parametrów łącznie i 6,5B aktywnych.
Dla polskich dokumentów dodajemy Bielika i PLLuM. Porównanie z Qwenem opisuje konkretne warianty i ograniczenia licencyjne. Język polski w nazwie lub materiałach modelu jest powodem, aby włączyć go do próby. Jakość firmowej terminologii sprawdzamy na rzeczywistych pytaniach.
Open source, otwarte wagi i prywatne dane
Dostęp do wag pozwala wybrać miejsce uruchomienia. Licencja określa zakres dozwolonego użycia, modyfikacji i dystrybucji. Kod serwera może mieć inną licencję niż sam model. W projekcie zapisujemy identyfikator modelu, rewizję i warunki obowiązujące dla używanego pliku.
Prywatność zależy także od aplikacji. Lokalny model połączony z chmurowym OCR nadal wysyła dokument do zewnętrznej usługi. Osobnego sprawdzenia wymagają embeddingi, kopie zapasowe i diagnostyka. Opis wdrożenia prywatnego LLM obejmuje te elementy razem.
Jak wybieramy model w Syntalith
Dla help desku mierzymy trafność przypisania sprawy i liczbę potrzebnych poprawek. Dla kancelarii ważne są poprawne odwołania do klauzul i odmowa przy braku dokumentu. W repozytorium kodu sprawdzamy działającą zmianę oraz testy. Jeden ogólny ranking nie odpowie na wszystkie te pytania.
Zaczynamy od małego zestawu kandydatów mieszczących się w budżecie. Dostają te same materiały i kryteria. Porównanie obejmuje wynik, opóźnienie przy docelowym obciążeniu i koszt poprawnie zakończonej sprawy. Model, który potrzebuje mniej poprawek, może uzasadnić wyższy koszt obliczeń.
Jeśli chcesz wybrać model dla firmy lub własnego komputera, prześlij zastosowanie, wymagania dotyczące danych i specyfikację sprzętu. Syntalith przygotuje zakres porównania, a potem może zająć się instalacją, hostingiem i dostrojeniem wybranego wariantu.
Oceńmy prywatne AI w warunkach Twojej firmy
Pomagamy firmom i osobom prywatnym dobrać sprzęt, uruchomić model i sprawdzić go na własnych zadaniach. Możesz zacząć od komputera, który już masz, albo od rozmowy przed zakupem.
Prywatne modele LLM i fine-tuning