Qwen3.8-27B: architektura, możliwości i wymagania
Co to jest Qwen3.8-27B: 27 mld parametrów, 64 warstwy, obraz i wideo, 262k kontekstu, tryb rozumowania, narzędzia oraz wymagania sprzętowe.
Syntalith
Qwen3.8-27B to otwarty model językowo-wizyjny do kodowania, pracy z narzędziami, analizy dokumentów, obrazów i wideo oraz długich zadań wieloetapowych. Część językowa ma 27 mld parametrów i 64 warstwy. Model przyjmuje natywnie do 262 144 tokenów, ma wbudowany tryb rozumowania i licencję Apache 2.0.
Model jest gęsty, więc przy każdym tokenie pracuje cała część językowa. Warstwy tworzą powtarzany układ trzech bloków Gated DeltaNet z atencją liniową i jednego bloku pełnej atencji. Ten kompromis ogranicza koszt bardzo długich wejść. Osobny 27-warstwowy enkoder pozwala analizować obrazy i wideo.
W kwantyzacji 4-bit uruchomiliśmy Qwen3.8-27B na jednej karcie RTX 3090 z 24 GB VRAM. Model naprawił błąd w projekcie Go w 8 min 22 s, pominął walidację w imporcie CSV i zbudował efektowny, ale wadliwy interfejs z 251 327 elementami DOM. Te przykłady pokazują zarówno możliwości, jak i potrzebę niezależnego odbioru.
Co Qwen3.8-27B potrafi w praktyce
Wszystkie poniższe przebiegi używały Qwen3.8-27B lokalnie. Wybrany profil działał przez Qwen Code na zamrożonym, zewnętrznie zmodyfikowanym stosie vLLM, z kontekstem 150k, W4A16 AutoRound, pamięcią kontekstu FP8 i MTP-3. To był eksperyment po godzinach na domowym PC, z jedną aktywną sesją.
| Zadanie | Obserwowany wynik | Czas | Odbiór |
|---|---|---|---|
naprawa dwóch ścieżek json.Marshal w Go | poprawny, deterministyczne zachowanie awaryjne i testy regresji | 8:22 | przyjęte, 100/100 w naszej rubryce |
| import użytkowników z CSV | 12/12 testów publicznych, 4/5 ukrytych | 1:33 | odrzucone do poprawki, brak walidacji pustego imienia i roli |
| interfejs ATS od pustego katalogu | 2028 linii HTML, CSS, JS i opisu produktu | 26:03 | wizualnie ciekawy, technicznie niegotowy |
Pierwszy wynik pokazuje, co ta konfiguracja potrafiła zrobić w długim zadaniu. Drugi przypomina, że nawet mały błąd w wymaganiach unieważnia zielony wynik publicznych testów. Trzeci ujawnia różnicę między wygenerowaniem interfejsu a dostarczeniem wersji, która naprawdę działa. Naprawa i dodatkowa kontrola wizualna podniosły łączny czas modelu do 48:25.
Każde zadanie uruchomiliśmy raz. Zapis opisuje obserwacje. Nie estymuje prawdopodobieństwa sukcesu.
Co oznacza nazwa Qwen3.8-27B
Według oficjalnej karty modelu jest to model językowo-wizyjny o 27 miliardach parametrów, 64 warstwach i licencji Apache 2.0. Układ warstw powtarza szesnaście razy sekwencję trzech bloków Gated DeltaNet i jednego bloku Gated Attention. Daje to 48 bloków DeltaNet i 16 bloków pełnej, bramkowanej uwagi. Model ma też głowicę Multi-Token Prediction, czyli MTP.
Producent deklaruje natywny kontekst 262 144 tokenów i rozszerzenie do miliona przez YaRN. To maksymalna długość wejścia, a nie obietnica szybkiej pracy. W naszym teście model miał odnaleźć trzy fakty umieszczone na początku, w środku i na końcu długiego tekstu. Przy 230 085 tokenach zwrócił wszystkie trzy, ale odpowiedź zajęła 563,4 s. Przy 50 059 tokenach ta sama próba trwała 59,3 s.
Krótka karta faktów
| Fakt | Status | Co z niego wynika |
|---|---|---|
| 27B parametrów, 64 warstwy | deklaracja producenta | model jest znacznie cięższy od lokalnych modeli 4B–12B |
| 48 DeltaNet + 16 Gated Attention | deklaracja producenta | długi kontekst ma architektoniczne wsparcie, nadal kosztuje czas i pamięć |
| natywny obraz i wideo | deklaracja producenta | potrzebny jest osobny test multimodalny |
| 262 144 tokeny natywnie | deklaracja producenta | serwer, pamięć kontekstu i program kliencki muszą obsłużyć ten sam limit |
| Apache 2.0 | oficjalna licencja pliku wag | pozostają obowiązki dotyczące całego stosu i danych |
Jak 27B zmieściło się w 24 GB
Nie używaliśmy wag BF16, które same potrzebują około 55 GB. Wybrany profil miał czterobitowe wagi W4A16 i ośmiobitową pamięć kontekstu FP8. W długim zadaniu Go telemetria pokazała 22 539 MiB szczytowego użycia VRAM. Został mały margines, dlatego serwer działał z jednym slotem i bez równoległych agentów.
To ważne rozróżnienie: plik wag może mieścić się na karcie, a cały profil może się nie mieścić. Dochodzi pamięć kontekstu, bufory serwera, grafy CUDA i spekulatywne dekodowanie. Zmiana jednej z tych pozycji wpływa na maksymalny kontekst, szybkość albo stabilność.
Na tym samym komputerze zachowaliśmy prostsze rozwiązanie zapasowe llama.cpp z GGUF Dynamic V3 Q4_K_M i kontekstem 120k. W dopasowanym zadaniu cały profil vLLM był szybszy, ale porównanie obejmowało jednocześnie inne wagi, pamięć kontekstu, silnik i limit kontekstu. Nie jest dowodem, że jeden format kwantyzacji ma zawsze wyższą jakość.
Zakres tego wyniku
Artykuł opisuje trzy wykonane zadania tekstowe i kodowe. Wynik z Go nie przenosi się automatycznie na księgowość, prawo albo obsługę klienta. Nawet w kodzie wynik zależał od programu sterującego. Ten sam lokalny model przez Codex wykonał długie zadanie w 19:10, ale dodał niedeterministyczne zachowanie awaryjne i został odrzucony. Claude Code wykonał je poprawnie w 28:52.
Kiedy ten model ma sens do pierwszego testu
Qwen3.8-27B jest ciekawym kandydatem, gdy zadanie wymaga czytania repozytorium, wieloetapowej pracy z narzędziami albo dużego, zamkniętego pakietu dokumentów. Lokalne API daje kontrolę nad miejscem przetwarzania i kosztem użycia po uruchomieniu. Nadal trzeba utrzymywać serwer, aktualizacje i ewaluacje.
Przy prostym, stabilnym schemacie ekstrakcji warto najpierw sprawdzić mniejszy model, klasyczny program odczytujący dane lub zarządzane API. Dobór zaczyna się od kosztu błędu i czasu odpowiedzi. Liczba parametrów jest dopiero kolejnym wejściem.
Co możemy zrobić z takim wynikiem dla firmy
Syntalith może zbudować repozytoryjny lub dokumentowy zestaw odbiorowy: naturalne polecenia, ukryte kontrole, pomiar czasu, przegląd wyniku oraz porównanie wariantu lokalnego z API. Otrzymujesz tabelę decyzji z konkretnymi wersjami modeli i profilem sprzętowym. Jeżeli Qwen przegrywa, rekomendacja nie próbuje go ratować marketingiem.
Płatny Audyt procesu AI zaczyna się od 4990 zł netto. Dla zespołu, który chce samodzielnie oceniać lokalne modele i agentów kodowych, prowadzimy też Kursy AI-Native na jego własnych zadaniach.
Pełny zapis sprzętu, czasu, wyników i porażek znajduje się w indeksie eksperymentu Qwen3.8-27B.
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces