Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Ile kontekstu potrzebuje Qwen: 60k, 120k, 150k czy 250k?

Okno kontekstu określa, ile tekstu model może dostać naraz. Wszystkie profile odtworzyły fakty, ale 250k było prawie dziesięć razy wolniejsze od 60k.

Autor

Syntalith

Opublikowano Zaktualizowano 3 min czytania

Okno kontekstu określa, ile tokenów wejścia i wcześniejszej rozmowy model może przetworzyć w jednym żądaniu. Większe okno pozwala dołączyć więcej plików, ale zużywa więcej pamięci i wyraźnie wydłuża czas przetwarzania całego zadania.

Qwen3.8-27B poprawnie odnalazł trzy fakty umieszczone na początku, w środku i na końcu wejść 50k, 115k i 230k. Próba 230k trwała jednak 563,4 s, a próba 50k tylko 59,3 s. Profil 150k na zmodyfikowanym vLLM nie musiał skracać historii i zakończył długie zadanie znacznie szybciej niż profil 120k na llama.cpp.

Kontekst musi wynikać z zadania; najwyższa liczba z karty modelu nie jest celem.

Oficjalne 262k a nasze profile

Qwen3.8-27B ma natywny kontekst 262 144 tokenów. Producent opisuje również rozszerzenie do miliona tokenów przez YaRN. Nie testowaliśmy miliona tokenów na RTX 3090 i nie traktujemy takiego rozszerzenia jako bezkosztowej właściwości.

W torze llama.cpp zbudowaliśmy trzy profile:

ProfilWagiLimit kontekstuPamięć KVbatch / ubatch
60kQ5_K_M65 536Q82048 / 512
120kQ4_K_M131 072Q82048 / 512
250kQ4_K_M250 000Q4128 / 64

To nie jest idealny test samej długości. Profile różnią się wagami, precyzją pamięci kontekstu oraz wielkością paczki, ponieważ miały zmieścić się na jednej karcie 24 GB. Tabela odpowiada na praktyczne pytanie „co da się uruchomić”. Izolowanego wpływu jednego parametru nie mierzy.

Odnajdywanie faktów w długim tekście

Wstawiliśmy dokładne fakty na początku, w środku i na końcu długiego materiału. Każdy profil musiał je zwrócić.

ProfilTokeny wejściaPrzetwarzanie wejścia, tok./sGenerowanie tok./sCzasVRAMWynik pamięci
60k50 059890,749,2459,3 s22 287 MiBzaliczony
120k115 074681,640,46172,6 s22 649 MiBzaliczony
250k230 085412,428,05563,4 s23 623 MiBzaliczony

Funkcjonalnie 250k działało. Operacyjnie koszt jednego pytania był już inny. Wejście miało 4,6 razy więcej tokenów niż 60k, a czas wzrósł 9,5 razy. Profil zbliżył się też do pełnych 24 GB VRAM.

Dlaczego 60k było za małe dla długiego agenta

Krótki profil miał szybsze tokeny i dokładniejsze wagi Q5, ale długie zadanie kodowe przekraczało jego użyteczne okno. Agent kompresował historię, ponownie czytał pliki i tracił czas na odbudowę kontekstu. Ukończona praca wraz z kontynuacją zajęła 42,77 min i uzyskała 87/100.

Kompresja sama w sobie nie jest błędem. Problem pojawia się, gdy system kilkukrotnie płaci za ponowne odnalezienie tych samych zależności. Przy agencie ważny jest łączny kontekst instrukcji, odpowiedzi, wywołań narzędzi i wyników. Sam rozmiar repozytorium nie wystarcza.

Dlaczego 250k także nie wygrało

Profil 250k unikał kompresji, lecz generował wolniej, używał pamięci KV w Q4 i w zadaniu inżynierskim nie dał lepszego wyniku. Dwa główne programy sterujące pominęły ustalony przypadek zgodności pustej odpowiedzi.

Wypełnienie okna danymi może nawet zaszkodzić: agent ma więcej materiału do przeszukania, a stary ślad narzędzi konkuruje z aktualnym zadaniem. Sesje powinny być zadaniowe. Kontynuujemy je, gdy potrzebne jest poprzednie rozumowanie; nową, niezależną pracę zaczynamy świeżo.

Dlaczego do kolejnych prób zachowaliśmy 150k

Wybrany profil zmodyfikowanego vLLM miał limit 150 000 tokenów i Qwen Code ustawiony na medium. W zadaniu naprawy dwóch błędów obsługi JSON zakończył pracę bez skracania historii w 502,14 s. Codex ocenił zmianę na 100/100 według kryteriów Syntalith; nie była to ocena zewnętrznego audytora.

To samo polecenie i ten sam kod na llama.cpp 120k zakończyły się wynikiem 98/100, jedną kompresją i czasem 1468,76 s. Porównujemy tu całe profile. Nie jest to czysta próba 120k kontra 150k. Wynik pokazuje jednak, że dostępny zapas kontekstu wraz z serwerem i pamięcią kontekstu wpływa na czas ukończonej pracy.

Jak dobrać okno w firmie

Najpierw policz rzeczywisty pakiet:

kontekst zadania = instrukcje systemowe
  + definicje narzędzi
  + dokumenty lub kod wejściowy
  + historia odpowiedzi i wyników narzędzi
  + zapas na odpowiedź

Następnie wybierz najmniejsze okno, które mieści 95. percentyl z bezpiecznym zapasem. Dla powtarzalnej analizy dokumentów może to być 60k. Dla długiej zmiany w repozytorium 120k może wymagać kompresji. Dla firmowego mózgu ładowanie 250k przy każdym pytaniu zwykle przegra z wyszukiwaniem kilku właściwych fragmentów.

Co kupuje klient

W Audycie procesu AI Syntalith mierzy rozkład długości wejść, jakość odpowiedzi po przycięciu i czas kolejki. Dokument wskazuje profil, alternatywę i próg, przy którym trzeba zmienić sprzęt. Cena zaczyna się od 4990 zł netto.

Jeśli nie znasz jeszcze wolumenu i typowego dokumentu, umów bezpłatny skan procesu. Nie kupuj GPU na podstawie samego napisu „262k”.

Pełny zestaw pomiarów znajduje się w zanonimizowanym zestawieniu JSON.

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze