Przejdź do treści
Wróć do bloga
qwen3.8Artykuł

Ilu użytkowników obsłuży Qwen na jednej RTX 3090?

Jedna karta może obsługiwać zapytania kolejno albo równolegle. Zestawiamy nasze czasy z publicznym testem 1, 2, 4 i 8 jednoczesnych strumieni.

Autor

Syntalith

Opublikowano Zaktualizowano 3 min czytania

Czy jeden RTX 3090 wystarczy zespołowi? Odpowiedź zależy od długości wejścia, długości odpowiedzi, liczby jednoczesnych użytkowników i dopuszczalnego czasu oczekiwania. Nasz domowy profil wykonywał jedno zapytanie naraz, więc pokazuje czas obsługi pojedynczej osoby. Publiczny test na tej samej klasie karty uzupełnia obraz o ruch równoległy.

Mamy dwa uczciwe źródła. Pierwsze to nasze zmierzone czasy obsługi pojedynczych agentów. Drugie to publiczny test Qwen3.8-27B na jednej RTX 3090, wykonany specjalnie dla 1, 2, 4 i 8 równoległych strumieni. Razem pokazują, gdzie kończy się pojemność modelu, a zaczyna projektowanie usługi.

Co naprawdę pokazał nasz jeden slot

Na domowym PC uruchamialiśmy jedno zapytanie naraz. Dodatkowi agenci czekali w kolejce. Zmierzone czasy mocno różniły się między zadaniami:

PrzebiegCzasWynik odbioru
eksport CSV, Qwen Code38,24 s3/3 testy ukryte
import CSV, Qwen Code93,14 s4/5 testów ukrytych
paginacja, Qwen Code264,53 s3/3 testy ukryte
długa naprawa Go, Qwen Code502,14 s100/100
pierwsza generacja interfejsu1563,22 snieprzyjęta, zatrzymana przez detektor pętli

Wynik 100/100 wystawił Codex według kryteriów Syntalith po zakończeniu pracy Qwen Code. To nie jest ocena niezależnego laboratorium.

To są realne pojedyncze przebiegi. Nie mówią, ile takich zadań system wykona w godzinę pod obciążeniem. Nie obejmują równoczesnego przetwarzania wejść, przełączania profili, kolejek ani powtórzeń po błędzie.

Publiczny test współbieżności na tej samej klasie GPU

Repozytorium syv-ai/qwen38-27b-rtx3090 publikuje test jednej RTX 3090 z Qwen3.8-27B i poprawionym stosem vLLM. Każdy strumień dostawał inne wejście długości 4k tokenów i generował 256 tokenów. Serwer dopuszczał maksymalnie osiem sekwencji.

W profilu MTP autor zmierzył:

Równoległe strumienieTempo na strumieńTempo łączneCzas kroku forward
1126 tok/s124 tok/s24,8 ms
2103 tok/s212 tok/s29,8 ms
446 tok/s280 tok/s43,1 ms
823 tok/s383 tok/s62,3 ms

Łączna przepustowość rosła, ale odpowiedź pojedynczego użytkownika zwalniała. Przy ośmiu strumieniach każdy dostawał 23 tok/s zamiast 126 tok/s. To właśnie kompromis, którego nie widać w pojedynczym wyniku tokens/s.

Profil DFlash2 osiągnął 137 tok/s dla jednego strumienia, 97 dla dwóch i 46 dla czterech. Przy próbie ośmiu tylko pięć sekwencji mieściło się równocześnie, więc autor nie uzyskał stabilnego wyniku C8. Szybszy profil pojedynczego użytkownika nie okazał się profilem o największej pojemności.

Długie wejście zmienia wynik bardziej niż liczba użytkowników

W tym samym publicznym repozytorium uruchomiono osiem niezależnych wejść po 16k tokenów. Łączne tempo całej próby spadło do 15,8 tok./s, a średni czas do pierwszego tokena wyniósł 71,7 s. Przetworzenie około 131k tokenów wejścia zdominowało pracę.

Gdy osiem żądań współdzieliło ten sam prefiks 16k i można było użyć pamięci podręcznej wspólnego prefiksu, dla dwóch strumieni zmierzono 128,4 tok/s łącznie oraz 1,3 s średniego TTFT. Dla czterech było to 147,8 tok/s i 2,6 s. Te liczby nie są obietnicą dla czatu firmowego. Pokazują, że rozkład długości wejść i współdzielenie prefiksu należą do parametrów pojemności. Nie są detalem implementacji.

Dlaczego nie kopiujemy tych liczb do oferty

Publiczny benchmark używa dopracowanego, zmodyfikowanego zestawu serwera i wag, krótkich odpowiedzi po 256 tokenów oraz ściśle opisanych wejść. Nasza konfiguracja miała inny serwer i wieloetapowe zadania z użyciem narzędzi. Tych wyników nie wolno wkładać do jednej tabeli bez tego zastrzeżenia.

Przed wdrożeniem zespołowym trzeba zmierzyć na docelowym serwerze:

  • czas do pierwszego tokena i czas całego zadania dla każdej klasy pracy;
  • tempo na użytkownika oraz tempo łączne przy 1, 2, 4 i 8 równoległych żądaniach;
  • liczbę sekwencji mieszczących się przed błędem pamięci;
  • wpływ długiego przetwarzania wejścia i pamięci podręcznej wspólnego prefiksu;
  • 95. centyl czasu oczekiwania w rzeczywistym ruchu;
  • odsetek zadań zaakceptowanych, bo szybki błędny wynik nie zwiększa przepustowości biznesowej.

Co można zdecydować już teraz

Jedna RTX 3090 potrafi obsłużyć więcej niż jedną krótką sekwencję, ale spadek tempa na użytkownika jest mierzalny, a pojemność zależy od profilu. Nasz jeden slot był właściwy dla eksperymentu programistycznego. Nie dostarcza dowodu dla architektury zespołowej. Publiczny test pokazuje, że MTP może utrzymać osiem krótkich strumieni w konkretnym stosie, a DFlash2 zatrzymał się na pięciu rezydentnych sekwencjach.

Próg zakupu drugiej karty powinien wynikać z docelowego TTFT, długości kolejki i odsetka zaakceptowanych wyników. Nie z liczby pracowników zapisanej w tabeli marketingowej.

Jak Syntalith przygotowuje taki pilot

Możemy uruchomić model na sprzęcie klienta albo zbudować odizolowane środowisko pilotażowe, odtworzyć szczyt ruchu i oddać wykresy opóźnienia, przepustowości, VRAM oraz jakości. Projekt obejmuje kolejkę, limit współbieżności, klasy danych, kontrolowane rozwiązanie zapasowe i konkretny próg skalowania.

Audyt procesu AI zaczyna się od 4990 zł netto. Jeżeli test uzasadnia lokalny system, Aplikacje AI obejmują wykonanie API, panelu, monitoringu i procedury aktualizacji. Pierwszym krokiem może być bezpłatny skan procesu.

Bezpłatny skan procesów

Zacznij od bezpłatnego skanu procesów.

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.

0 zł

30 minut · pisemne podsumowanie w 2 dni robocze