Ilu użytkowników obsłuży Qwen na jednej RTX 3090?
Jedna karta może obsługiwać zapytania kolejno albo równolegle. Zestawiamy nasze czasy z publicznym testem 1, 2, 4 i 8 jednoczesnych strumieni.
Syntalith
Czy jeden RTX 3090 wystarczy zespołowi? Odpowiedź zależy od długości wejścia, długości odpowiedzi, liczby jednoczesnych użytkowników i dopuszczalnego czasu oczekiwania. Nasz domowy profil wykonywał jedno zapytanie naraz, więc pokazuje czas obsługi pojedynczej osoby. Publiczny test na tej samej klasie karty uzupełnia obraz o ruch równoległy.
Mamy dwa uczciwe źródła. Pierwsze to nasze zmierzone czasy obsługi pojedynczych agentów. Drugie to publiczny test Qwen3.8-27B na jednej RTX 3090, wykonany specjalnie dla 1, 2, 4 i 8 równoległych strumieni. Razem pokazują, gdzie kończy się pojemność modelu, a zaczyna projektowanie usługi.
Co naprawdę pokazał nasz jeden slot
Na domowym PC uruchamialiśmy jedno zapytanie naraz. Dodatkowi agenci czekali w kolejce. Zmierzone czasy mocno różniły się między zadaniami:
| Przebieg | Czas | Wynik odbioru |
|---|---|---|
| eksport CSV, Qwen Code | 38,24 s | 3/3 testy ukryte |
| import CSV, Qwen Code | 93,14 s | 4/5 testów ukrytych |
| paginacja, Qwen Code | 264,53 s | 3/3 testy ukryte |
| długa naprawa Go, Qwen Code | 502,14 s | 100/100 |
| pierwsza generacja interfejsu | 1563,22 s | nieprzyjęta, zatrzymana przez detektor pętli |
Wynik 100/100 wystawił Codex według kryteriów Syntalith po zakończeniu pracy Qwen Code. To nie jest ocena niezależnego laboratorium.
To są realne pojedyncze przebiegi. Nie mówią, ile takich zadań system wykona w godzinę pod obciążeniem. Nie obejmują równoczesnego przetwarzania wejść, przełączania profili, kolejek ani powtórzeń po błędzie.
Publiczny test współbieżności na tej samej klasie GPU
Repozytorium syv-ai/qwen38-27b-rtx3090 publikuje test jednej RTX 3090 z Qwen3.8-27B i poprawionym stosem vLLM. Każdy strumień dostawał inne wejście długości 4k tokenów i generował 256 tokenów. Serwer dopuszczał maksymalnie osiem sekwencji.
W profilu MTP autor zmierzył:
| Równoległe strumienie | Tempo na strumień | Tempo łączne | Czas kroku forward |
|---|---|---|---|
| 1 | 126 tok/s | 124 tok/s | 24,8 ms |
| 2 | 103 tok/s | 212 tok/s | 29,8 ms |
| 4 | 46 tok/s | 280 tok/s | 43,1 ms |
| 8 | 23 tok/s | 383 tok/s | 62,3 ms |
Łączna przepustowość rosła, ale odpowiedź pojedynczego użytkownika zwalniała. Przy ośmiu strumieniach każdy dostawał 23 tok/s zamiast 126 tok/s. To właśnie kompromis, którego nie widać w pojedynczym wyniku tokens/s.
Profil DFlash2 osiągnął 137 tok/s dla jednego strumienia, 97 dla dwóch i 46 dla czterech. Przy próbie ośmiu tylko pięć sekwencji mieściło się równocześnie, więc autor nie uzyskał stabilnego wyniku C8. Szybszy profil pojedynczego użytkownika nie okazał się profilem o największej pojemności.
Długie wejście zmienia wynik bardziej niż liczba użytkowników
W tym samym publicznym repozytorium uruchomiono osiem niezależnych wejść po 16k tokenów. Łączne tempo całej próby spadło do 15,8 tok./s, a średni czas do pierwszego tokena wyniósł 71,7 s. Przetworzenie około 131k tokenów wejścia zdominowało pracę.
Gdy osiem żądań współdzieliło ten sam prefiks 16k i można było użyć pamięci podręcznej wspólnego prefiksu, dla dwóch strumieni zmierzono 128,4 tok/s łącznie oraz 1,3 s średniego TTFT. Dla czterech było to 147,8 tok/s i 2,6 s. Te liczby nie są obietnicą dla czatu firmowego. Pokazują, że rozkład długości wejść i współdzielenie prefiksu należą do parametrów pojemności. Nie są detalem implementacji.
Dlaczego nie kopiujemy tych liczb do oferty
Publiczny benchmark używa dopracowanego, zmodyfikowanego zestawu serwera i wag, krótkich odpowiedzi po 256 tokenów oraz ściśle opisanych wejść. Nasza konfiguracja miała inny serwer i wieloetapowe zadania z użyciem narzędzi. Tych wyników nie wolno wkładać do jednej tabeli bez tego zastrzeżenia.
Przed wdrożeniem zespołowym trzeba zmierzyć na docelowym serwerze:
- czas do pierwszego tokena i czas całego zadania dla każdej klasy pracy;
- tempo na użytkownika oraz tempo łączne przy 1, 2, 4 i 8 równoległych żądaniach;
- liczbę sekwencji mieszczących się przed błędem pamięci;
- wpływ długiego przetwarzania wejścia i pamięci podręcznej wspólnego prefiksu;
- 95. centyl czasu oczekiwania w rzeczywistym ruchu;
- odsetek zadań zaakceptowanych, bo szybki błędny wynik nie zwiększa przepustowości biznesowej.
Co można zdecydować już teraz
Jedna RTX 3090 potrafi obsłużyć więcej niż jedną krótką sekwencję, ale spadek tempa na użytkownika jest mierzalny, a pojemność zależy od profilu. Nasz jeden slot był właściwy dla eksperymentu programistycznego. Nie dostarcza dowodu dla architektury zespołowej. Publiczny test pokazuje, że MTP może utrzymać osiem krótkich strumieni w konkretnym stosie, a DFlash2 zatrzymał się na pięciu rezydentnych sekwencjach.
Próg zakupu drugiej karty powinien wynikać z docelowego TTFT, długości kolejki i odsetka zaakceptowanych wyników. Nie z liczby pracowników zapisanej w tabeli marketingowej.
Jak Syntalith przygotowuje taki pilot
Możemy uruchomić model na sprzęcie klienta albo zbudować odizolowane środowisko pilotażowe, odtworzyć szczyt ruchu i oddać wykresy opóźnienia, przepustowości, VRAM oraz jakości. Projekt obejmuje kolejkę, limit współbieżności, klasy danych, kontrolowane rozwiązanie zapasowe i konkretny próg skalowania.
Audyt procesu AI zaczyna się od 4990 zł netto. Jeżeli test uzasadnia lokalny system, Aplikacje AI obejmują wykonanie API, panelu, monitoringu i procedury aktualizacji. Pierwszym krokiem może być bezpłatny skan procesu.
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces