Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Kwantyzacja Qwen3.8-27B: Q4, Q5 czy W4A16?

Kwantyzacja zmniejsza pamięć potrzebną na wagi kosztem części precyzji. Wyjaśniamy Q4, Q5 i W4A16 oraz pokazujemy profile mieszczące się w 24 GB VRAM.

Autor

Syntalith

Opublikowano Zaktualizowano 4 min czytania

Kwantyzacja zapisuje wagi modelu z mniejszą precyzją. Dzięki temu model zajmuje mniej pamięci i może zostawić więcej miejsca na kontekst, ale część odpowiedzi może stracić na jakości. Q4 używa mniej bitów niż Q5. W4A16 oznacza 4-bitowe wagi i 16-bitowe aktywacje, a w naszym teście wymagało innego silnika.

Na domowej RTX 3090 Q5 zabierało więcej miejsca i ograniczało długi kontekst. Q4 zwalniało miejsce na pamięć KV, czyli pamięć kontekstu. W4A16 AutoRound dało najlepszy wynik całego systemu w jednym zadaniu, lecz ten przebieg nie izoluje jakości samych wag.

Jeżeli dostawca obiecuje „prawie brak straty”, poproś o wynik na Twoich zadaniach i dokładny skrót pliku.

Różnicę oceniamy dopiero na identycznym zestawie dokumentów i zadań, mierząc jakość odpowiedzi, zużycie pamięci, czas zakończenia oraz koszt poprawki przez człowieka w docelowym procesie firmy.

Co właściwie jest kompresowane

Model 27B w BF16 potrzebuje około 55 GB na wagi. Kwantyzacja zapisuje część wartości z mniejszą liczbą bitów. Zmniejsza pamięć i ruch pamięciowy, ale wprowadza przybliżenie.

W praktyce osobno wybierasz:

  • precyzję wag modelu;
  • precyzję pamięci KV, czyli pamięci kontekstu;
  • precyzję dodatkowej głowy MTP;
  • format i kernely wspierane przez serwer.

„4-bit” nie jest więc jedną technologią. GGUF Q4_K_M, AutoRound W4A16 i NVFP4 mają inne procedury, rozkład precyzji oraz środowisko wykonania.

Rozmiary oficjalnych plików Unsloth

Repozytorium GGUF Qwen3.8-27B podaje:

FormatRozmiar wagWniosek dla karty 24 GB
UD-Q4_K_M16,5 GBrozsądny zapas na pamięć kontekstu
UD-Q5_K_M19,8 GBciaśniejszy długi kontekst
UD-Q6_K22,0 GBmało miejsca na pamięć kontekstu i bufory
Q8_029,0 GBnie mieści się w całości
BF1654,7 GBwymaga większej lub wielu kart

W naszym llama.cpp profil 60k używał Q5_K_M i pamięci Q8. Profile 120k oraz 250k używały Q4_K_M. Przy 250k pamięć kontekstu musiała zejść do Q4, a wielkość paczki została znacznie zmniejszona. Dłuższe okno zostało kupione kilkoma kompromisami naraz.

Cztery profile, które rzeczywiście mieściły się w 24 GB

ProfilWagi / pamięć kontekstuKontekstSzczyt VRAMPozostało z 24 576 MiBObciążenie pomiarowe
llama.cpp 60kQ5_K_M / Q865 53622 287 MiB2289 MiBodtworzenie faktów z 50 059 tokenów
llama.cpp 120kQ4_K_M / Q8131 07222 649 MiB1927 MiBodtworzenie faktów ze 115 074 tokenów
llama.cpp 250kQ4_K_M / Q4250 00023 623 MiB953 MiBodtworzenie faktów z 230 085 tokenów
zmodyfikowany vLLM 150kW4A16 / FP8150 00022 539 MiB2037 MiBzadanie Go, Qwen Code

Pierwsze trzy wiersze pochodzą z tego samego testu pamięci. Ostatni z innego, długiego zadania agenta, więc nie porównuje bezpośrednio pamięci z profilem GGUF. Pokazuje rzeczywisty szczyt profilu wybranego do pracy.

Konfiguracja 250k mieściła się z niecałym 1 GiB wolnej pamięci, ale używała mniejszej paczki i pamięci kontekstu Q4. To za mały zapas, aby uznać ją za bezpieczną dla wielu sesji. Serwer nadal obsługiwał tylko jedną sesję naraz.

Czym różni się W4A16

W4A16 oznacza w przybliżeniu 4-bitowe wagi i 16-bitowe aktywacje. Nasz plik wag AutoRound był serwowany przez zamrożony, zewnętrznie zmodyfikowany vLLM, z pamięcią kontekstu FP8 i dodatkowymi zmianami dla RTX 3090. Nie jest zamiennikiem pliku GGUF w llama.cpp.

W tym samym zadaniu naprawy kodu konfiguracja W4A16/vLLM dostała od Codex 100/100 i pracowała 502,14 s. Dynamic V3 Q4_K_M/llama.cpp dostała 98/100 i pracowała 1468,76 s. Różniły się także serwerem, pamięcią kontekstu, sposobem generowania i limitem długości. Wynik wskazuje lepszą całą konfigurację do dalszych prób, ale nie dowodzi, że sam format W4A16 jest dokładniejszy.

Jak czytać deklaracje producenta

Unsloth opisuje Dynamic V3 jako zapewniające około 10% wyższą dokładność przy tym samym rozmiarze. To deklaracja producenta kwantyzacji, oparta na jego metodzie oceny. Nie przełożyliśmy jej na 10% wzrost jakości agenta.

Do takiego twierdzenia potrzebne byłyby:

  1. te same polecenia i silnik;
  2. kilka formatów wag przy zgodnych parametrach;
  3. wiele powtórzeń z niezmiennymi ustawieniami losowania;
  4. zestaw zadań reprezentujący proces;
  5. niezależna ocena odpowiedzi.

Nie potrzebowaliśmy takiego twierdzenia, aby wybrać konfigurację do dalszych prób: ocena Codex była co najmniej porównywalna, a różnica czasu całego zadania duża. To węższy wniosek zgodny z pomiarem.

Pamięć kontekstu potrafi zająć odzyskane miejsce

Długi kontekst przechowuje klucze i wartości dla poprzednich tokenów. Przy jednym użytkowniku może zająć kilka gigabajtów. Przy wielu równoległych sesjach rośnie z liczbą sekwencji. Plik wag 16,5 GB nie oznacza więc, że karta 24 GB ma 7,5 GB swobodnego budżetu na wszystko.

Obniżenie precyzji pamięci kontekstu z Q8 do Q4 zwiększa pojemność, lecz może zmienić jakość odwołań do długiego materiału. Tę właściwość sprawdza test z faktami w różnych miejscach oraz zadanie wymagające łączenia informacji; sam start serwera jej nie ujawni.

Procedura wyboru

  1. Zacznij od najwyższej precyzji, która mieści typowy kontekst.
  2. Uruchom zestaw akceptacyjny i zachowaj odpowiedzi.
  3. Zmniejsz precyzję wag lub pamięci kontekstu osobno, gdy to możliwe.
  4. Porównaj jakość, czas, VRAM i koszt poprawki.
  5. Ustal wymagany zapas VRAM i odrzuć profil, który regularnie go narusza.
  6. Zapisz skrót kryptograficzny zwycięskiego artefaktu.

W aplikacji dokumentowej różnica może pojawić się w liczbach i cytatach. W agencie kodowym w doborze zakresu, kontraktach i poprawności narzędzi. Jedna średnia perplexity nie zastąpi obu.

Syntalith wykonuje takie porównanie w Audycie procesu AI od 4990 zł netto lub jako część aplikacji AI. Dostajesz wariant wybrany, odrzucone alternatywy, dane z pomiaru i bramkę aktualizacji. Umów bezpłatny skan, jeżeli nie wiadomo jeszcze, czy problem wymaga modelu 27B.

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze