Ile kontekstu potrzebuje Qwen: 60k, 120k, 150k czy 250k?
Okno kontekstu określa, ile tekstu model może dostać naraz. Wszystkie profile odtworzyły fakty, ale 250k było prawie dziesięć razy wolniejsze od 60k.
Syntalith
Największe okno nie okazało się najbardziej użyteczne w eksperymencie na domowym komputerze. Qwen3.8-27B odtworzył po jednym fakcie z początku, środka i końca wejść o długości 50k, 115k oraz 230k tokenów. Przebieg 230k trwał 563,4 s, a 50k 59,3 s. W odrębnym zadaniu naprawy kodu konfiguracja 150k na zmodyfikowanym vLLM zakończyła pracę znacznie szybciej niż konfiguracja 120k na llama.cpp.
Każdy wiersz poniżej opisuje jeden przebieg na jednej karcie. „Profil” to konkretna konfiguracja serwera, wag, pamięci KV i paczki. Taki zestaw parametrów trzeba oceniać razem. Długość kontekstu warto dobierać do zadania. Najwyższa liczba z karty modelu nie jest celem samym w sobie.
Oficjalne 262k a nasze konfiguracje lokalne
Qwen3.8-27B ma natywne okno 262 144 tokenów. Karta modelu opisuje też rozszerzenie do miliona tokenów przez YaRN. Na RTX 3090 nie uruchamialiśmy wariantu milionowego, dlatego nie wliczamy tego rozszerzenia do wyniku eksperymentu.
W ścieżce llama.cpp użyliśmy trzech praktycznych konfiguracji:
| Konfiguracja lokalna | Wagi | Limit kontekstu | Pamięć KV | batch / ubatch |
|---|---|---|---|---|
| 60k | Q5_K_M | 65 536 | Q8 | 2048 / 512 |
| 120k | Q4_K_M | 131 072 | Q8 | 2048 / 512 |
| 250k | Q4_K_M | 250 000 | Q4 | 128 / 64 |
To porównanie odpowiada na pytanie, co mieści się na jednej karcie 24 GB. Nie izoluje samego limitu kontekstu, ponieważ konfiguracje różnią się formatem wag, precyzją pamięci KV i wielkością paczki. Te parametry dobraliśmy razem, aby uruchomić każdy wariant na tym samym GPU.
Odnajdywanie faktów w długim wejściu
W syntetycznym materiale umieściliśmy dokładne wartości blisko początku, środka i końca. Zadanie wymagało zwrócenia wszystkich trzech wartości. „Fakty zwrócone” w tabeli to liczba poprawnie odtworzonych wartości z trzech, a 3/3 oznacza, że ta konkretna próba wyszukiwania zakończyła się powodzeniem. Taki wynik pokazuje odnalezienie przygotowanych faktów. Nie mówi, jak model poradzi sobie z dowolnym długim dokumentem.
| Konfiguracja | Tokeny wejścia | Przetwarzanie wejścia, tok./s | Generowanie, tok./s | Czas całkowity | Maks. VRAM | Fakty zwrócone |
|---|---|---|---|---|---|---|
| 60k | 50 059 | 890,7 | 49,24 | 59,3 s | 22 287 MiB | 3/3 |
| 120k | 115 074 | 681,6 | 40,46 | 172,6 s | 22 649 MiB | 3/3 |
| 250k | 230 085 | 412,4 | 28,05 | 563,4 s | 23 623 MiB | 3/3 |
„Tokeny wejścia” to liczba tokenów przed odpowiedzią. Przetwarzanie wejścia mierzy szybkość przygotowania tego materiału, generowanie mierzy szybkość tworzenia odpowiedzi, a czas całkowity obejmuje cały przebieg. Maks. VRAM to najwyższe zaobserwowane zużycie pamięci karty. Wariant 250k miał 4,6 razy więcej tokenów niż 60k, a trwał 9,5 razy dłużej i zużył 23 623 MiB z 24 GB.
Co kompresja historii zmienia w pracy agenta
Długie zadanie programistyczne może zapełnić okno szybciej niż sugeruje sam rozmiar repozytorium. Historia agenta obejmuje instrukcje systemowe, definicje narzędzi, wywołania, ich wyniki oraz odpowiedzi. Po przekroczeniu użytecznego limitu system kompresuje wcześniejszy przebieg, a agent może ponownie czytać pliki i odtwarzać zależności.
W jednym zapisanym przebiegu agentowym Codex przyznał 87 ze 100 punktów według kryteriów Syntalith: za poprawność, testy regresji, zgodność, dyscyplinę zakresu, weryfikację i dokumentację. Ocena wskazywała na istotną, niedeterministyczną wadę ścieżki awaryjnej. To wynik jednej pracy według konkretnych kryteriów i nie jest procentem niezawodności modelu. Sama kompresja nie przesądza o błędzie; koszt pojawia się wtedy, gdy trzeba wielokrotnie odbudowywać ten sam kontekst.
Dlaczego 250k nie rozstrzyga wyboru
W teście wyszukiwania każda konfiguracja zwróciła 3/3 przygotowanych faktów. Najdłuższa konfiguracja osiągnęła jednak 28,05 tok./s generowania i 563,4 s czasu całkowitego, wobec 49,24 tok./s i 59,3 s przy 60k. Poza tym testem nie mierzyliśmy jakości odpowiedzi na dowolnych dokumentach, więc wynik nie uzasadnia tezy, że większe okno poprawia jakość inżynierską.
Większe okno może także zwiększyć koszt wyszukiwania w historii. Sesję warto kontynuować, gdy poprzednie rozumowanie jest potrzebne, a niezależne zadanie rozpoczynać od świeżego kontekstu.
Dlaczego zachowaliśmy 150k do kolejnych prób
Wybrana konfiguracja zmodyfikowanego vLLM przyjmowała do 150 000 tokenów i używała Qwen Code 0.21.13 przy medium. W zadaniu naprawy dwóch ścieżek obsługi błędów json.Marshal zakończyła pracę bez kompresji w 502,14 s. OpenAI Codex ocenił zmianę na 100 ze 100 punktów według kryteriów Syntalith: poprawność 40/40, testy regresji 20/20, zgodność 15/15, dyscyplina zakresu 10/10, weryfikacja 10/10 i dokumentacja 5/5. Oznacza to brak odjęć w tej pojedynczej ocenie; nie jest to audyt zewnętrzny ani miara powtarzalności.
To samo polecenie i ta sama baza na konfiguracji llama.cpp 120k otrzymały od Codex 98 z 100 punktów, wykonały jedną kompresję i trwały 1468,76 s. Porównujemy tu całe konfiguracje: silnik, format wag, pamięć KV, ścieżkę serwowania i limit kontekstu. To praktyczne porównanie dwóch gotowych stosów. Nie izoluje wpływu zmiany 120k na 150k.
Jak dobrać okno w firmie
Najpierw zmierz rzeczywisty pakiet wejściowy:
kontekst zadania = instrukcje systemowe
+ definicje narzędzi
+ dokumenty lub kod wejściowy
+ historia odpowiedzi i wyników narzędzi
+ zapas na odpowiedź
Wybierz najmniejsze okno, które obejmuje 95. percentyl długości pakietu oraz bezpieczny zapas. Powtarzalna analiza dokumentów może mieścić się w 60k. Długa zmiana w repozytorium może wymagać 120k albo kompresji. System wiedzy firmy często zyska więcej na wyszukaniu kilku trafnych fragmentów niż na ładowaniu 250k przy każdym pytaniu.
Co mierzy Syntalith
W Audycie procesu AI mierzymy rozkład długości wejść, jakość po przycięciu i czas oczekiwania w kolejce. Na tej podstawie wskazujemy konfigurację, wariant zapasowy oraz próg zmiany sprzętu. Cena zaczyna się od 4990 zł netto.
Jeśli nie znasz jeszcze wolumenu ani typowego dokumentu, umów bezpłatny skan procesu. Sam napis „262k” nie wystarcza do wyboru GPU.
Pełny zestaw pomiarów znajduje się w publicznym zestawieniu JSON.
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces