Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Qwen3.8-27B: co to za model i do czego służy

Qwen3.8-27B ma 27 mld parametrów, natywny kontekst 262 144 tokenów i wejście obrazowe. Sprawdzamy zastosowania, sprzęt i wyniki lokalnego testu dla zespołu.

Autor

Syntalith

Opublikowano Zaktualizowano 3 min czytania

Qwen3.8-27B jest gęstym modelem językowo-wizyjnym. Służy do rozmowy, kodowania, pracy z narzędziami oraz analizy tekstu, obrazów i wideo. Część językowa ma 27 mld parametrów i 64 warstwy. Karta modelu deklaruje natywny kontekst 262 144 tokenów, tryb rozumowania i licencję Apache 2.0.

Te dane opisują możliwości modelu. Nie mówią jeszcze, czy model spełni wymagania konkretnej firmy. Na domowej karcie RTX 3090 uruchomiliśmy skwantyzowany profil i sprawdziliśmy trzy praktyczne zadania: poprawkę w Go, import CSV oraz interfejs ATS. Model wykonał poprawną poprawkę w Go, przeoczył jedną regułę walidacji w imporcie i wygenerował interfejs, który wymagał naprawy. To użyteczniejszy obraz niż sama lista funkcji.

Co oznacza Qwen3.8-27B

Liczba 27B oznacza około 27 miliardów parametrów w części językowej. Model jest gęsty, więc ta część bierze udział w przetwarzaniu każdego tokena. Liczba parametrów nie jest oceną jakości. Jest za to ważną wskazówką dotyczącą pamięci, szybkości i kosztu uruchomienia.

Według oficjalnej karty modelu układ językowy ma 64 warstwy. Powtarza szesnaście razy sekwencję trzech bloków Gated DeltaNet oraz jednego bloku Gated Attention. W sumie daje to 48 bloków DeltaNet i 16 bloków pełnej, bramkowanej atencji. Model ma też Multi-Token Prediction, czyli MTP.

Qwen deklaruje natywne okno 262 144 tokenów oraz możliwość rozszerzenia do miliona tokenów przez YaRN. To limit techniczny. Nie gwarantuje krótkiego czasu odpowiedzi. W naszym teście trzy fakty umieszczone na początku, w środku i na końcu syntetycznego tekstu zostały zwrócone przy wejściu 50 059, 115 074 i 230 085 tokenów. Czas wyniósł odpowiednio 59,3 s, 172,6 s i 563,4 s.

Model ma także osobny enkoder obrazu. Karta opisuje obsługę obrazu i wideo. Przed użyciem skanów, wykresów albo nagrań w procesie firmy trzeba sprawdzić dokładnie tę ścieżkę na własnych danych.

Co sprawdziliśmy lokalnie

Wszystkie trzy zadania działały na Qwen3.8-27B przez Qwen Code. Profil wykorzystał zamrożony, zewnętrznie zmodyfikowany stos vLLM, limit 150k, wagi W4A16 AutoRound, pamięć KV FP8 i MTP-3. Był to eksperyment po godzinach na domowym komputerze z jedną aktywną sesją.

ZadanieWynikCzasWniosek
naprawa dwóch ścieżek json.Marshal w Gotesty regresji i kompilacja przeszły; Codex przyznał 100/100 według arkusza kryteriów Syntalith8:22dobry wynik pojedynczej poprawki
import użytkowników z CSV12/12 testów publicznych i 4/5 ukrytych; zabrakło odrzucania pustego imienia i roli1:33testy widoczne dla modelu nie wystarczyły
panel ATS z pustego katalogu2028 linii kodu i opisu; później znaleziono wadliwą wirtualizację tabeli26:03wygenerowany interfejs wymagał kontroli przeglądarkowej

W pierwszej wersji panel wyrenderował 8652 wiersze, 251 327 elementów DOM i dokument o wysokości 485 065 px. Po naprawie niezależna kontrola zmierzyła 722 węzły, 15 widocznych wierszy, 900 px wysokości i brak poziomego przepełnienia. To przykład różnicy między kodem, który wygląda przekonująco, a kodem sprawdzonym w działającej przeglądarce.

Każde zadanie wykonaliśmy raz. Liczby opisują te przebiegi i nie są estymacją odsetka udanych prób.

Ile pamięci potrzeba

Na karcie RTX 3090 jest 24 GB VRAM. W naszym profilu czterobitowe wagi pozwoliły uruchomić model na jednej takiej karcie. W zadaniu Go szczytowe użycie wyniosło 22 539 MiB. Oprócz wag pamięć zajmują pamięć kontekstu, bufory serwera, grafy CUDA i dekodowanie spekulatywne.

Wagi BF16 dla 27 mld parametrów wymagałyby około 54 GB przed doliczeniem pozostałych elementów. Z tego powodu uruchomienie na karcie 24 GB wymaga wyboru formatu, limitu kontekstu i ustawień serwera. Profil obsługujący jedno żądanie naraz nie jest dowodem przepustowości dla zespołu.

Na tym samym komputerze zachowaliśmy llama.cpp z GGUF Dynamic V3 Q4_K_M i kontekstem 120k. W dopasowanym zadaniu profil vLLM był szybszy, ale jednocześnie zmieniły się wagi, pamięć kontekstu, silnik i limit kontekstu. Ten przebieg nie rozstrzyga jakości pojedynczego formatu kwantyzacji.

Zadania do sprawdzenia

Jako przypadki do testu Qwen3.8-27B wybierz zadania, w których jedna sesja ma czytać duże repozytorium, używać wielu narzędzi, pracować z obrazem albo utrzymywać plan przez dłuższe zadanie. Lokalny adres API może ograniczyć trasę danych i po uruchomieniu daje przewidywalny koszt kolejnych tokenów. Dopiero pomiar na własnym procesie pokaże, czy model spełnia wymagania.

Model może być zbyt duży do krótkiej klasyfikacji, prostego wydobywania pól albo kilku zdań po polsku. W takich przypadkach porównaj mniejszy model, deterministyczny program i zarządzane API. Zacznij od kosztu błędu, wymaganej szybkości i zasad dotyczących danych. Liczba parametrów pomaga zawęzić wybór, lecz go nie podejmuje.

Co oznacza wynik Codex

Po zadaniu Go Codex przyznał 100/100 według arkusza kryteriów Syntalith. Punkty obejmowały poprawność obsługi błędów (40), testy regresji (20), zgodność dotychczasowego API (15), zakres zmiany (10), weryfikację testami i kompilacją (10) oraz dokumentację (5). Ocenę wykonał model Codex po jednym przebiegu. Nie był to werdykt niezależnego laboratorium. W innym przebiegu ten sam lokalny Qwen otrzymał 87/100, gdy prowadził go klient Codex, oraz 98/100 w eksperymencie zgodności z Claude Code. Zmienił się klient prowadzący model przez repozytorium.

Pełne czasy, profile, metryki i porażki są w wynikach eksperymentu na RTX 3090. Dane źródłowe zapisaliśmy w zestawieniu prób, metrykach zadania Go oraz teście długiego kontekstu.

Jeśli chcesz sprawdzić lokalny model na własnych dokumentach lub repozytorium, bezpłatny skan procesu pomaga ustalić przypadki testowe, próg jakości i sensowne alternatywy. Wdrożenie może zakończyć się wyborem Qwena, mniejszego modelu albo API.

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze