Kiedy nie wdrażać Qwena lokalnie: pięć wyników, które zatrzymałyby projekt
Pięć sygnałów do zatrzymania projektu: zadanie bez końca, powtarzane przetwarzanie kontekstu, kosztowne 250k, brak walidacji i wadliwy interfejs.
Syntalith
W lokalnym eksperymencie jedno uruchomienie trwało 121 min 38 s i nie przyniosło działającej zmiany. W innej konfiguracji przebieg trwał ponad trzy godziny i wymagał dwóch interwencji użytkownika, a mimo to naruszył istniejący kontrakt. Taki wynik wystarcza, by odrzucić konfigurację nawet wtedy, gdy model mieści się w pamięci karty i dobrze wypada w krótkiej prezentacji.
Poniższe przypadki pochodzą z eksperymentu na domowym komputerze z RTX 3090. Każdy opisuje zapisany przebieg i prowadzi do konkretnej decyzji, którą warto podjąć przed zakupem infrastruktury. Pojedyncze przebiegi pokazują ryzyka do sprawdzenia. Powtarzalność modelu wymaga osobnych powtórzeń.
Przed zakupem infrastruktury trzeba przejść przez cały przebieg na własnych danych, z kontrolą zakresu zmian, przypadków brzegowych, kosztu i sposobu eskalacji do człowieka w sytuacji awarii.
Wynik 1. 121 minut, 4,28 mln tokenów wejściowych i brak ukończenia
Claude Code 2.1.235 połączyliśmy z Qwen3.8-27B przez lokalny interfejs zgodny z formatem Anthropic. W konfiguracji llama.cpp ustawiliśmy kontekst 120k i średni poziom rozumowania. Agent korzystał ze standardowych narzędzi Bash, Edit, Read, Write, Glob i Grep oraz z czystej, zapisywalnej kopii repozytorium.
Przebieg nie miał sztucznego limitu czasu. Po 7298,5 s klient wysłał do serwera 131 265 tokenów, choć jego limit wynosił 131 072. Serwer odpowiedział HTTP 400. Wcześniej warstwa koordynująca wykonała 66 wywołań narzędzi i wielokrotnie przesyłała te same fragmenty, co dało łącznie 4 283 936 tokenów wejściowych. Powstał plik 16 testów, który się nie kompilował. Dokumentacja pozostała bez zmian, a raport końcowy nie powstał.
Ten przebieg wskazał problem w połączeniu warstwy koordynującej, interfejsu i okna 120k. Nie pozwala oceniać samego Qwena ani Claude Code używanego z modelami Claude. Dlatego tę konfigurację odrzuciliśmy jako punkt odniesienia dla eksperymentu.
Decyzja wdrożeniowa: gdy reprezentatywne zadanie nie kończy się samo, sprawdź najpierw zarządzanie kontekstem, powtórne przetwarzanie wejścia, protokół i warstwę koordynującą. Dopiero potem rozważaj mocniejszy sprzęt. Właściwym rozwiązaniem może być inny klient albo zarządzane API.
Wynik 2. Małe okno kontekstu zmieniło zadanie w trzygodzinną sesję
Qwen Code w trybie medium, uruchomiony na poprawionej konfiguracji 60k, dostał zwykłe zadanie naprawy błędu w przekazywaniu danych. Pierwsza tura trwała 152,99 min i powtarzała taki cykl:
wygenerowanie całego pliku testów
-> limit wyjścia lub kontekstu
-> automatyczne podsumowanie
-> utrata informacji o tym, co już odczytano przed zapisem
-> ponowny odczyt
-> ponowne wygenerowanie całego pliku
Dwie zwykłe korekty użytkownika doprowadziły sesję do końca. Łącznie zajęła około 192,1 min i zużyła 1069,1 Wh energii, czyli 1069,1 watogodzin. Zakres zmian stał się uporządkowany dopiero po wyraźnej prośbie o przywrócenie plików spoza zadania. Program nadal odrzucał puste ciało żądania REST, mimo że wcześniejszy kontrakt je dopuszczał. Po zakończeniu Codex przyznał zmianie 78/100 według kryteriów Syntalith. W skali 100 punktów oceniano poprawność (40 pkt), testy regresji (20), zgodność (15), zakres zmian (10), weryfikację (10) i dokumentację (5). Codex pełnił tu rolę oceniającego, bez udziału zewnętrznego audytora.
Ten sam rodzaj zadania na konfiguracji 120k/medium zakończył się znacznie szybciej. Większe okno nie zapewnia jakości, lecz zbyt małe może zużyć czas agenta na kompresowanie i ponowne czytanie materiału.
Decyzja wdrożeniowa: jeśli sesja wielokrotnie kompresuje kontekst przed pierwszą istotną zmianą, wstrzymaj wdrożenie tej konfiguracji. Zapisuj liczbę kompresji, ponownych odczytów i interwencji użytkownika razem z szybkością generowania tokenów.
Wynik 3. Maksymalne okno zwiększyło koszt bez poprawy jakości
W konfiguracji 250k udało się uniknąć kompresji i zachować około 119k aktywnego kontekstu. Zadanie zakończyło się po 30 min 19 s, a szczytowe użycie VRAM wyniosło 23 179 MiB. Wynik wyglądał obiecująco, lecz obsługa pustego ciała żądania nadal była błędna, a Codex przyznał 80/100. Wynik konfiguracji 120k/medium zachował zgodność z istniejącym zachowaniem i był lepszym wyborem.
W osobnym teście model miał odnaleźć trzy fakty umieszczone na początku, w środku i na końcu długiego wejścia. Zwrócił wszystkie trzy fakty zarówno dla 230 085, jak i dla 50 059 tokenów. Dłuższy przebieg trwał 563,4 s, krótszy 59,3 s.
Decyzja wdrożeniowa: gdy duże okno nie poprawia wyniku procesu, skróć pakiet, dodaj wyszukiwanie albo podziel pracę. Samo przyjęcie przez serwer 250k tokenów nie uzasadnia kosztu takiej konfiguracji.
Wynik 4. Testy publiczne przeszły, ukryta kontrola znalazła błąd
W zadaniu importu CSV Qwen Code w trybie medium zakończył pracę po 93,14 s. Przeszedł 12/12 testów publicznych, ale tylko 4/5 kontroli ukrytych, ponieważ nie odrzucił pustej nazwy ani pustej roli. Codex i OpenCode, sterując tym samym lokalnym modelem, przeszły wszystkie kontrole tego zadania.
W małym projekcie testowym to drobna usterka. W procesie zakładania kont mogłaby tworzyć niepoprawne rekordy, wymagać ręcznej naprawy i utrudniać późniejszy audyt.
Decyzja wdrożeniowa: bez przypadków brzegowych nie ma dowodu gotowości produkcyjnej. Jeżeli kosztownego błędu nie można wykryć automatycznie albo szybko sprawdzić przez człowieka, zawęź system, wybierz mocniejszy model lub przenieś regułę do kodu deterministycznego.
Wynik 5. Efektowny interfejs nie przeszedł sprawdzenia w przeglądarce
Qwen Code wygenerował interfejs systemu rekrutacyjnego od pustego katalogu w 26:03. Dodał wyszukiwanie, sortowanie, etapy, panel szczegółów i 10 000 syntetycznych kandydatów. Lista nie miała ograniczonego obszaru przewijania, więc przeglądarka wyrenderowała 8652 pasujące wiersze i 251 327 elementów DOM. Pierwsze uruchomienie zakończyło się również fałszywym sygnałem detektora pętli, zanim można było wykonać pełne sprawdzenie w przeglądarce.
Naprawa sześciu usterek i późniejsza korekta dwóch problemów wizualnych podniosły łączny czas pracy modelu do 48:25. Niezależne sprawdzenie potwierdziło dopiero wtedy ograniczoną liczbę wierszy, brak przewijania całej strony na boki oraz poprawną geometrię na komputerze i telefonie. DOM, czyli drzewo elementów strony, jest tu miarą rozmiaru wyrenderowanego interfejsu.
Decyzja wdrożeniowa: interfejs bez testu zachowania i skutku pozostaje prototypem. Dla UI trzeba sprawdzić zachowanie, wydajność, responsywność i wygląd. W systemie dokumentowym odpowiednie kontrole obejmują cytaty, reakcję na brak źródła i uprawnienia.
Tabela decyzji o zatrzymaniu pilotażu
| Sygnał z pilota | Działanie przed dalszą inwestycją |
|---|---|
| zadanie nie kończy się lub przepełnia kontekst | zmień warstwę koordynującą, konfigurację albo model i powtórz ten sam test |
| kompresje i ponowne odczyty zajmują większość czasu | zwiększ użyteczne okno albo ogranicz narzędzia i materiały |
| dłuższy kontekst nie poprawia wyniku | dodaj wyszukiwanie, podziel materiał lub skróć proces |
| błąd brzegowy ma wysoki koszt | rozszerz zestaw kontroli albo użyj komponentu deterministycznego |
| wynik wygląda dobrze, lecz nie ma testu skutku | wstrzymaj dostęp użytkowników |
| brak właściciela aktualizacji i incydentów | wybierz usługę zarządzaną albo zakończ projekt |
Co firma dostaje przed decyzją o budowie
Syntalith może przeprowadzić krótką ocenę nastawioną na wykrywanie powodów do rezygnacji. Wybieramy jeden proces, budujemy 20–50 przypadków, porównujemy lokalną konfigurację Qwena z rozsądną bazą API i mierzymy czas, koszt, poprawki oraz ryzyko. Wynik może wskazać lokalnego Qwena, mniejszy model, kod deterministyczny, API albo rezygnację z projektu.
Bezpłatny skan procesu pomaga wybrać przypadek. Audyt procesu AI od 4990 zł netto obejmuje porównanie, kryteria akceptacji, architekturę i stałą wycenę. Firma podejmuje decyzję przed zakupem infrastruktury na podstawie pomiaru. Wcześniej wybrany model nie dostaje taryfy ulgowej.
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces