Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Qwen3.8-27B: architektura, możliwości i wymagania

Co to jest Qwen3.8-27B: 27 mld parametrów, 64 warstwy, obraz i wideo, 262k kontekstu, tryb rozumowania, narzędzia oraz wymagania sprzętowe.

Autor

Syntalith

Opublikowano Zaktualizowano 4 min czytania

Qwen3.8-27B to otwarty model językowo-wizyjny do kodowania, pracy z narzędziami, analizy dokumentów, obrazów i wideo oraz długich zadań wieloetapowych. Część językowa ma 27 mld parametrów i 64 warstwy. Model przyjmuje natywnie do 262 144 tokenów, ma wbudowany tryb rozumowania i licencję Apache 2.0.

Model jest gęsty, więc przy każdym tokenie pracuje cała część językowa. Warstwy tworzą powtarzany układ trzech bloków Gated DeltaNet z atencją liniową i jednego bloku pełnej atencji. Ten kompromis ogranicza koszt bardzo długich wejść. Osobny 27-warstwowy enkoder pozwala analizować obrazy i wideo.

W kwantyzacji 4-bit uruchomiliśmy Qwen3.8-27B na jednej karcie RTX 3090 z 24 GB VRAM. Model naprawił błąd w projekcie Go w 8 min 22 s, pominął walidację w imporcie CSV i zbudował efektowny, ale wadliwy interfejs z 251 327 elementami DOM. Te przykłady pokazują zarówno możliwości, jak i potrzebę niezależnego odbioru.

Co Qwen3.8-27B potrafi w praktyce

Wszystkie poniższe przebiegi używały Qwen3.8-27B lokalnie. Wybrany profil działał przez Qwen Code na zamrożonym, zewnętrznie zmodyfikowanym stosie vLLM, z kontekstem 150k, W4A16 AutoRound, pamięcią kontekstu FP8 i MTP-3. To był eksperyment po godzinach na domowym PC, z jedną aktywną sesją.

ZadanieObserwowany wynikCzasOdbiór
naprawa dwóch ścieżek json.Marshal w Gopoprawny, deterministyczne zachowanie awaryjne i testy regresji8:22przyjęte, 100/100 w naszej rubryce
import użytkowników z CSV12/12 testów publicznych, 4/5 ukrytych1:33odrzucone do poprawki, brak walidacji pustego imienia i roli
interfejs ATS od pustego katalogu2028 linii HTML, CSS, JS i opisu produktu26:03wizualnie ciekawy, technicznie niegotowy

Pierwszy wynik pokazuje, co ta konfiguracja potrafiła zrobić w długim zadaniu. Drugi przypomina, że nawet mały błąd w wymaganiach unieważnia zielony wynik publicznych testów. Trzeci ujawnia różnicę między wygenerowaniem interfejsu a dostarczeniem wersji, która naprawdę działa. Naprawa i dodatkowa kontrola wizualna podniosły łączny czas modelu do 48:25.

Każde zadanie uruchomiliśmy raz. Zapis opisuje obserwacje. Nie estymuje prawdopodobieństwa sukcesu.

Co oznacza nazwa Qwen3.8-27B

Według oficjalnej karty modelu jest to model językowo-wizyjny o 27 miliardach parametrów, 64 warstwach i licencji Apache 2.0. Układ warstw powtarza szesnaście razy sekwencję trzech bloków Gated DeltaNet i jednego bloku Gated Attention. Daje to 48 bloków DeltaNet i 16 bloków pełnej, bramkowanej uwagi. Model ma też głowicę Multi-Token Prediction, czyli MTP.

Producent deklaruje natywny kontekst 262 144 tokenów i rozszerzenie do miliona przez YaRN. To maksymalna długość wejścia, a nie obietnica szybkiej pracy. W naszym teście model miał odnaleźć trzy fakty umieszczone na początku, w środku i na końcu długiego tekstu. Przy 230 085 tokenach zwrócił wszystkie trzy, ale odpowiedź zajęła 563,4 s. Przy 50 059 tokenach ta sama próba trwała 59,3 s.

Krótka karta faktów

FaktStatusCo z niego wynika
27B parametrów, 64 warstwydeklaracja producentamodel jest znacznie cięższy od lokalnych modeli 4B–12B
48 DeltaNet + 16 Gated Attentiondeklaracja producentadługi kontekst ma architektoniczne wsparcie, nadal kosztuje czas i pamięć
natywny obraz i wideodeklaracja producentapotrzebny jest osobny test multimodalny
262 144 tokeny natywniedeklaracja producentaserwer, pamięć kontekstu i program kliencki muszą obsłużyć ten sam limit
Apache 2.0oficjalna licencja pliku wagpozostają obowiązki dotyczące całego stosu i danych

Jak 27B zmieściło się w 24 GB

Nie używaliśmy wag BF16, które same potrzebują około 55 GB. Wybrany profil miał czterobitowe wagi W4A16 i ośmiobitową pamięć kontekstu FP8. W długim zadaniu Go telemetria pokazała 22 539 MiB szczytowego użycia VRAM. Został mały margines, dlatego serwer działał z jednym slotem i bez równoległych agentów.

To ważne rozróżnienie: plik wag może mieścić się na karcie, a cały profil może się nie mieścić. Dochodzi pamięć kontekstu, bufory serwera, grafy CUDA i spekulatywne dekodowanie. Zmiana jednej z tych pozycji wpływa na maksymalny kontekst, szybkość albo stabilność.

Na tym samym komputerze zachowaliśmy prostsze rozwiązanie zapasowe llama.cpp z GGUF Dynamic V3 Q4_K_M i kontekstem 120k. W dopasowanym zadaniu cały profil vLLM był szybszy, ale porównanie obejmowało jednocześnie inne wagi, pamięć kontekstu, silnik i limit kontekstu. Nie jest dowodem, że jeden format kwantyzacji ma zawsze wyższą jakość.

Zakres tego wyniku

Artykuł opisuje trzy wykonane zadania tekstowe i kodowe. Wynik z Go nie przenosi się automatycznie na księgowość, prawo albo obsługę klienta. Nawet w kodzie wynik zależał od programu sterującego. Ten sam lokalny model przez Codex wykonał długie zadanie w 19:10, ale dodał niedeterministyczne zachowanie awaryjne i został odrzucony. Claude Code wykonał je poprawnie w 28:52.

Kiedy ten model ma sens do pierwszego testu

Qwen3.8-27B jest ciekawym kandydatem, gdy zadanie wymaga czytania repozytorium, wieloetapowej pracy z narzędziami albo dużego, zamkniętego pakietu dokumentów. Lokalne API daje kontrolę nad miejscem przetwarzania i kosztem użycia po uruchomieniu. Nadal trzeba utrzymywać serwer, aktualizacje i ewaluacje.

Przy prostym, stabilnym schemacie ekstrakcji warto najpierw sprawdzić mniejszy model, klasyczny program odczytujący dane lub zarządzane API. Dobór zaczyna się od kosztu błędu i czasu odpowiedzi. Liczba parametrów jest dopiero kolejnym wejściem.

Co możemy zrobić z takim wynikiem dla firmy

Syntalith może zbudować repozytoryjny lub dokumentowy zestaw odbiorowy: naturalne polecenia, ukryte kontrole, pomiar czasu, przegląd wyniku oraz porównanie wariantu lokalnego z API. Otrzymujesz tabelę decyzji z konkretnymi wersjami modeli i profilem sprzętowym. Jeżeli Qwen przegrywa, rekomendacja nie próbuje go ratować marketingiem.

Płatny Audyt procesu AI zaczyna się od 4990 zł netto. Dla zespołu, który chce samodzielnie oceniać lokalne modele i agentów kodowych, prowadzimy też Kursy AI-Native na jego własnych zadaniach.

Pełny zapis sprzętu, czasu, wyników i porażek znajduje się w indeksie eksperymentu Qwen3.8-27B.

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze