Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Ile kontekstu potrzebuje Qwen: 60k, 120k, 150k czy 250k?

Okno kontekstu określa, ile tekstu model może dostać naraz. Wszystkie profile odtworzyły fakty, ale 250k było prawie dziesięć razy wolniejsze od 60k.

Autor

Syntalith

Opublikowano Zaktualizowano 4 min czytania

Największe okno nie okazało się najbardziej użyteczne w eksperymencie na domowym komputerze. Qwen3.8-27B odtworzył po jednym fakcie z początku, środka i końca wejść o długości 50k, 115k oraz 230k tokenów. Przebieg 230k trwał 563,4 s, a 50k 59,3 s. W odrębnym zadaniu naprawy kodu konfiguracja 150k na zmodyfikowanym vLLM zakończyła pracę znacznie szybciej niż konfiguracja 120k na llama.cpp.

Każdy wiersz poniżej opisuje jeden przebieg na jednej karcie. „Profil” to konkretna konfiguracja serwera, wag, pamięci KV i paczki. Taki zestaw parametrów trzeba oceniać razem. Długość kontekstu warto dobierać do zadania. Najwyższa liczba z karty modelu nie jest celem samym w sobie.

Oficjalne 262k a nasze konfiguracje lokalne

Qwen3.8-27B ma natywne okno 262 144 tokenów. Karta modelu opisuje też rozszerzenie do miliona tokenów przez YaRN. Na RTX 3090 nie uruchamialiśmy wariantu milionowego, dlatego nie wliczamy tego rozszerzenia do wyniku eksperymentu.

W ścieżce llama.cpp użyliśmy trzech praktycznych konfiguracji:

Konfiguracja lokalnaWagiLimit kontekstuPamięć KVbatch / ubatch
60kQ5_K_M65 536Q82048 / 512
120kQ4_K_M131 072Q82048 / 512
250kQ4_K_M250 000Q4128 / 64

To porównanie odpowiada na pytanie, co mieści się na jednej karcie 24 GB. Nie izoluje samego limitu kontekstu, ponieważ konfiguracje różnią się formatem wag, precyzją pamięci KV i wielkością paczki. Te parametry dobraliśmy razem, aby uruchomić każdy wariant na tym samym GPU.

Odnajdywanie faktów w długim wejściu

W syntetycznym materiale umieściliśmy dokładne wartości blisko początku, środka i końca. Zadanie wymagało zwrócenia wszystkich trzech wartości. „Fakty zwrócone” w tabeli to liczba poprawnie odtworzonych wartości z trzech, a 3/3 oznacza, że ta konkretna próba wyszukiwania zakończyła się powodzeniem. Taki wynik pokazuje odnalezienie przygotowanych faktów. Nie mówi, jak model poradzi sobie z dowolnym długim dokumentem.

KonfiguracjaTokeny wejściaPrzetwarzanie wejścia, tok./sGenerowanie, tok./sCzas całkowityMaks. VRAMFakty zwrócone
60k50 059890,749,2459,3 s22 287 MiB3/3
120k115 074681,640,46172,6 s22 649 MiB3/3
250k230 085412,428,05563,4 s23 623 MiB3/3

„Tokeny wejścia” to liczba tokenów przed odpowiedzią. Przetwarzanie wejścia mierzy szybkość przygotowania tego materiału, generowanie mierzy szybkość tworzenia odpowiedzi, a czas całkowity obejmuje cały przebieg. Maks. VRAM to najwyższe zaobserwowane zużycie pamięci karty. Wariant 250k miał 4,6 razy więcej tokenów niż 60k, a trwał 9,5 razy dłużej i zużył 23 623 MiB z 24 GB.

Co kompresja historii zmienia w pracy agenta

Długie zadanie programistyczne może zapełnić okno szybciej niż sugeruje sam rozmiar repozytorium. Historia agenta obejmuje instrukcje systemowe, definicje narzędzi, wywołania, ich wyniki oraz odpowiedzi. Po przekroczeniu użytecznego limitu system kompresuje wcześniejszy przebieg, a agent może ponownie czytać pliki i odtwarzać zależności.

W jednym zapisanym przebiegu agentowym Codex przyznał 87 ze 100 punktów według kryteriów Syntalith: za poprawność, testy regresji, zgodność, dyscyplinę zakresu, weryfikację i dokumentację. Ocena wskazywała na istotną, niedeterministyczną wadę ścieżki awaryjnej. To wynik jednej pracy według konkretnych kryteriów i nie jest procentem niezawodności modelu. Sama kompresja nie przesądza o błędzie; koszt pojawia się wtedy, gdy trzeba wielokrotnie odbudowywać ten sam kontekst.

Dlaczego 250k nie rozstrzyga wyboru

W teście wyszukiwania każda konfiguracja zwróciła 3/3 przygotowanych faktów. Najdłuższa konfiguracja osiągnęła jednak 28,05 tok./s generowania i 563,4 s czasu całkowitego, wobec 49,24 tok./s i 59,3 s przy 60k. Poza tym testem nie mierzyliśmy jakości odpowiedzi na dowolnych dokumentach, więc wynik nie uzasadnia tezy, że większe okno poprawia jakość inżynierską.

Większe okno może także zwiększyć koszt wyszukiwania w historii. Sesję warto kontynuować, gdy poprzednie rozumowanie jest potrzebne, a niezależne zadanie rozpoczynać od świeżego kontekstu.

Dlaczego zachowaliśmy 150k do kolejnych prób

Wybrana konfiguracja zmodyfikowanego vLLM przyjmowała do 150 000 tokenów i używała Qwen Code 0.21.13 przy medium. W zadaniu naprawy dwóch ścieżek obsługi błędów json.Marshal zakończyła pracę bez kompresji w 502,14 s. OpenAI Codex ocenił zmianę na 100 ze 100 punktów według kryteriów Syntalith: poprawność 40/40, testy regresji 20/20, zgodność 15/15, dyscyplina zakresu 10/10, weryfikacja 10/10 i dokumentacja 5/5. Oznacza to brak odjęć w tej pojedynczej ocenie; nie jest to audyt zewnętrzny ani miara powtarzalności.

To samo polecenie i ta sama baza na konfiguracji llama.cpp 120k otrzymały od Codex 98 z 100 punktów, wykonały jedną kompresję i trwały 1468,76 s. Porównujemy tu całe konfiguracje: silnik, format wag, pamięć KV, ścieżkę serwowania i limit kontekstu. To praktyczne porównanie dwóch gotowych stosów. Nie izoluje wpływu zmiany 120k na 150k.

Jak dobrać okno w firmie

Najpierw zmierz rzeczywisty pakiet wejściowy:

kontekst zadania = instrukcje systemowe
  + definicje narzędzi
  + dokumenty lub kod wejściowy
  + historia odpowiedzi i wyników narzędzi
  + zapas na odpowiedź

Wybierz najmniejsze okno, które obejmuje 95. percentyl długości pakietu oraz bezpieczny zapas. Powtarzalna analiza dokumentów może mieścić się w 60k. Długa zmiana w repozytorium może wymagać 120k albo kompresji. System wiedzy firmy często zyska więcej na wyszukaniu kilku trafnych fragmentów niż na ładowaniu 250k przy każdym pytaniu.

Co mierzy Syntalith

W Audycie procesu AI mierzymy rozkład długości wejść, jakość po przycięciu i czas oczekiwania w kolejce. Na tej podstawie wskazujemy konfigurację, wariant zapasowy oraz próg zmiany sprzętu. Cena zaczyna się od 4990 zł netto.

Jeśli nie znasz jeszcze wolumenu ani typowego dokumentu, umów bezpłatny skan procesu. Sam napis „262k” nie wystarcza do wyboru GPU.

Pełny zestaw pomiarów znajduje się w publicznym zestawieniu JSON.

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze