Kwantyzacja Qwen3.8-27B: Q4, Q5 czy W4A16?
Kwantyzacja zmniejsza pamięć potrzebną na wagi kosztem części precyzji. Wyjaśniamy Q4, Q5 i W4A16 oraz pokazujemy profile mieszczące się w 24 GB VRAM.
Syntalith
Kwantyzacja zapisuje wagi modelu z mniejszą precyzją. Dzięki temu model zajmuje mniej pamięci i może zostawić więcej miejsca na kontekst, ale część odpowiedzi może stracić na jakości. Q4 używa mniej bitów niż Q5. W4A16 oznacza 4-bitowe wagi i 16-bitowe aktywacje, a w naszym teście wymagało innego silnika.
Na domowej RTX 3090 Q5 zabierało więcej miejsca i ograniczało długi kontekst. Q4 zwalniało miejsce na pamięć KV, czyli pamięć kontekstu. W4A16 AutoRound dało najlepszy wynik całego systemu w jednym zadaniu, lecz ten przebieg nie izoluje jakości samych wag.
Jeżeli dostawca obiecuje „prawie brak straty”, poproś o wynik na Twoich zadaniach i dokładny skrót pliku.
Różnicę oceniamy dopiero na identycznym zestawie dokumentów i zadań, mierząc jakość odpowiedzi, zużycie pamięci, czas zakończenia oraz koszt poprawki przez człowieka w docelowym procesie firmy.
Co właściwie jest kompresowane
Model 27B w BF16 potrzebuje około 55 GB na wagi. Kwantyzacja zapisuje część wartości z mniejszą liczbą bitów. Zmniejsza pamięć i ruch pamięciowy, ale wprowadza przybliżenie.
W praktyce osobno wybierasz:
- precyzję wag modelu;
- precyzję pamięci KV, czyli pamięci kontekstu;
- precyzję dodatkowej głowy MTP;
- format i kernely wspierane przez serwer.
„4-bit” nie jest więc jedną technologią. GGUF Q4_K_M, AutoRound W4A16 i NVFP4 mają inne procedury, rozkład precyzji oraz środowisko wykonania.
Rozmiary oficjalnych plików Unsloth
Repozytorium GGUF Qwen3.8-27B podaje:
| Format | Rozmiar wag | Wniosek dla karty 24 GB |
|---|---|---|
| UD-Q4_K_M | 16,5 GB | rozsądny zapas na pamięć kontekstu |
| UD-Q5_K_M | 19,8 GB | ciaśniejszy długi kontekst |
| UD-Q6_K | 22,0 GB | mało miejsca na pamięć kontekstu i bufory |
| Q8_0 | 29,0 GB | nie mieści się w całości |
| BF16 | 54,7 GB | wymaga większej lub wielu kart |
W naszym llama.cpp profil 60k używał Q5_K_M i pamięci Q8. Profile 120k oraz 250k używały Q4_K_M. Przy 250k pamięć kontekstu musiała zejść do Q4, a wielkość paczki została znacznie zmniejszona. Dłuższe okno zostało kupione kilkoma kompromisami naraz.
Cztery profile, które rzeczywiście mieściły się w 24 GB
| Profil | Wagi / pamięć kontekstu | Kontekst | Szczyt VRAM | Pozostało z 24 576 MiB | Obciążenie pomiarowe |
|---|---|---|---|---|---|
llama.cpp 60k | Q5_K_M / Q8 | 65 536 | 22 287 MiB | 2289 MiB | odtworzenie faktów z 50 059 tokenów |
llama.cpp 120k | Q4_K_M / Q8 | 131 072 | 22 649 MiB | 1927 MiB | odtworzenie faktów ze 115 074 tokenów |
llama.cpp 250k | Q4_K_M / Q4 | 250 000 | 23 623 MiB | 953 MiB | odtworzenie faktów z 230 085 tokenów |
| zmodyfikowany vLLM 150k | W4A16 / FP8 | 150 000 | 22 539 MiB | 2037 MiB | zadanie Go, Qwen Code |
Pierwsze trzy wiersze pochodzą z tego samego testu pamięci. Ostatni z innego, długiego zadania agenta, więc nie porównuje bezpośrednio pamięci z profilem GGUF. Pokazuje rzeczywisty szczyt profilu wybranego do pracy.
Konfiguracja 250k mieściła się z niecałym 1 GiB wolnej pamięci, ale używała mniejszej paczki i pamięci kontekstu Q4. To za mały zapas, aby uznać ją za bezpieczną dla wielu sesji. Serwer nadal obsługiwał tylko jedną sesję naraz.
Czym różni się W4A16
W4A16 oznacza w przybliżeniu 4-bitowe wagi i 16-bitowe aktywacje. Nasz plik wag AutoRound był serwowany przez zamrożony, zewnętrznie zmodyfikowany vLLM, z pamięcią kontekstu FP8 i dodatkowymi zmianami dla RTX 3090. Nie jest zamiennikiem pliku GGUF w llama.cpp.
W tym samym zadaniu naprawy kodu konfiguracja W4A16/vLLM dostała od Codex 100/100 i pracowała 502,14 s. Dynamic V3 Q4_K_M/llama.cpp dostała 98/100 i pracowała 1468,76 s. Różniły się także serwerem, pamięcią kontekstu, sposobem generowania i limitem długości. Wynik wskazuje lepszą całą konfigurację do dalszych prób, ale nie dowodzi, że sam format W4A16 jest dokładniejszy.
Jak czytać deklaracje producenta
Unsloth opisuje Dynamic V3 jako zapewniające około 10% wyższą dokładność przy tym samym rozmiarze. To deklaracja producenta kwantyzacji, oparta na jego metodzie oceny. Nie przełożyliśmy jej na 10% wzrost jakości agenta.
Do takiego twierdzenia potrzebne byłyby:
- te same polecenia i silnik;
- kilka formatów wag przy zgodnych parametrach;
- wiele powtórzeń z niezmiennymi ustawieniami losowania;
- zestaw zadań reprezentujący proces;
- niezależna ocena odpowiedzi.
Nie potrzebowaliśmy takiego twierdzenia, aby wybrać konfigurację do dalszych prób: ocena Codex była co najmniej porównywalna, a różnica czasu całego zadania duża. To węższy wniosek zgodny z pomiarem.
Pamięć kontekstu potrafi zająć odzyskane miejsce
Długi kontekst przechowuje klucze i wartości dla poprzednich tokenów. Przy jednym użytkowniku może zająć kilka gigabajtów. Przy wielu równoległych sesjach rośnie z liczbą sekwencji. Plik wag 16,5 GB nie oznacza więc, że karta 24 GB ma 7,5 GB swobodnego budżetu na wszystko.
Obniżenie precyzji pamięci kontekstu z Q8 do Q4 zwiększa pojemność, lecz może zmienić jakość odwołań do długiego materiału. Tę właściwość sprawdza test z faktami w różnych miejscach oraz zadanie wymagające łączenia informacji; sam start serwera jej nie ujawni.
Procedura wyboru
- Zacznij od najwyższej precyzji, która mieści typowy kontekst.
- Uruchom zestaw akceptacyjny i zachowaj odpowiedzi.
- Zmniejsz precyzję wag lub pamięci kontekstu osobno, gdy to możliwe.
- Porównaj jakość, czas, VRAM i koszt poprawki.
- Ustal wymagany zapas VRAM i odrzuć profil, który regularnie go narusza.
- Zapisz skrót kryptograficzny zwycięskiego artefaktu.
W aplikacji dokumentowej różnica może pojawić się w liczbach i cytatach. W agencie kodowym w doborze zakresu, kontraktach i poprawności narzędzi. Jedna średnia perplexity nie zastąpi obu.
Syntalith wykonuje takie porównanie w Audycie procesu AI od 4990 zł netto lub jako część aplikacji AI. Dostajesz wariant wybrany, odrzucone alternatywy, dane z pomiaru i bramkę aktualizacji. Umów bezpłatny skan, jeżeli nie wiadomo jeszcze, czy problem wymaga modelu 27B.
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces