Kiedy nie wdrażać Qwena lokalnie: pięć wyników, które zatrzymałyby projekt
Pięć sygnałów zatrzymania projektu: zadanie bez końca, powtarzane przetwarzanie kontekstu, kosztowne 250k, brak walidacji i wadliwy interfejs.
Syntalith
W lokalnym eksperymencie zobaczyliśmy przebieg, który trwał 121 min 38 s i nie dostarczył działającej zmiany. Inny profil potrzebował ponad trzech godzin i dwóch interwencji, a na końcu nadal złamał istniejący kontrakt. To są wystarczające powody, by nie wdrażać danego układu, nawet jeżeli model mieści się na karcie i imponuje w krótszym demo.
Poniżej nie ma ogólnej listy wad lokalnych LLM. Są rzeczywiste wyniki z domowego PC z RTX 3090 oraz decyzje, jakie powinny uruchomić w projekcie klienta.
Wynik 1. 121 minut, 4,28 mln tokenów wejścia i brak ukończenia
Claude Code 2.1.235 został podłączony do Qwen3.8-27B przez lokalny serwer zgodny z API Anthropic. Profil llama.cpp miał kontekst 120k i średni poziom rozumowania. Agent dostał narzędzia Bash, Edit, Read, Write, Glob i Grep oraz czystą, zapisywalną kopię repozytorium.
Przebieg nie miał sztucznego limitu czasu. Po 7298,5 s klient wysłał żądanie 131 265 tokenów do serwera o limicie 131 072. Serwer zwrócił HTTP 400. Wcześniej agent wykonał 66 wywołań narzędzi, a suma ponownie przesyłanego wejścia osiągnęła 4 283 936 tokenów. Powstał plik 16 testów, który nie kompilował się. Dokumentacja pozostała bez zmian, a raport końcowy nie powstał.
To nie był dowód przeciwko modelowi Qwen ani przeciwko Claude Code z modelami Claude. Był to dowód przeciwko temu konkretnemu, nieobsługiwanemu połączeniu programu sterującego, interfejsu sieciowego i okna 120k. Odrzuciliśmy je jako profil referencyjny eksperymentu.
Decyzja wdrożeniowa: jeżeli reprezentatywne zadanie nie kończy się naturalnie, najpierw trzeba sprawdzić zarządzanie kontekstem, wielokrotne przetwarzanie tego samego wejścia, protokół i klienta. Dopiero potem ocenia się potrzebę mocniejszego sprzętu. Czasem właściwą decyzją jest zmiana klienta lub API.
Wynik 2. Mały kontekst zamienił zadanie w trzygodzinną sesję
Qwen Code medium na poprawionym profilu 60k dostał zwykłe zadanie naprawy błędów handoffu. Pierwsza tura trwała 152,99 min i utknęła w cyklu:
generowanie całego testu
-> limit wyjścia lub kontekstu
-> automatyczne podsumowanie
-> utrata stanu read-before-write
-> ponowny odczyt
-> generowanie całego testu od początku
Dwie naturalne korekty użytkownika doprowadziły sesję do końca. Łącznie zajęło to około 192,1 min i 1069,1 Wh energii. Ostateczny zestaw zmian był wąski dopiero po jawnym poleceniu cofnięcia plików spoza zakresu. Nadal odrzucał puste ciało żądania REST, które wcześniej było poprawnym wejściem. Po zakończeniu Codex ocenił zmianę na 78/100 według kryteriów Syntalith. Nie był to audyt zewnętrzny.
Ten sam typ zadania w lepszym profilu 120k/medium zakończył się znacznie szybciej. Większy kontekst nie gwarantuje jakości, ale zbyt małe okno może zniszczyć czas pracy agenta.
Decyzja wdrożeniowa: jeśli sesja regularnie kompresuje się przed pierwszą istotną poprawką, profil nie jest gotowy. Mierz liczbę kompresji, ponownych odczytów i interwencji. Same tokeny na sekundę nie opisują skuteczności agenta.
Wynik 3. Maksymalny kontekst zwiększył koszt bez poprawy jakości
Profil 250k ominął kompresję i zachował około 119k żywego kontekstu. Ukończył zadanie w 30 min 19 s i osiągnął 23 179 MiB VRAM. Brzmiał jak naturalny zwycięzca, lecz również zepsuł obsługę pustego ciała żądania i dostał 80/100. Profil 120k/medium zachował zgodność i pozostał lepszą decyzją.
W osobnym teście model miał odnaleźć trzy fakty umieszczone na początku, w środku i na końcu długiego tekstu. Znalazł wszystkie trzy zarówno przy 230 085, jak i przy 50 059 tokenach. Dłuższy przebieg trwał jednak 563,4 s, a krótszy 59,3 s, czyli niemal dziesięć razy krócej.
Decyzja wdrożeniowa: jeśli duże okno nie podnosi wyniku procesu, skróć pakiet, użyj wyszukiwania lub podziel zadanie. Nie płać za 250k tylko dlatego, że model je przyjmuje.
Wynik 4. Publiczne testy były zielone, ukryta walidacja zawiodła
W zadaniu importu CSV Qwen Code medium ukończył pracę w 93,14 s, przeszedł 12/12 testów publicznych i tylko 4/5 kontroli ukrytych. Nie odrzucił pustego imienia i roli. Codex oraz OpenCode z tym samym lokalnym modelem przeszły komplet kontroli tego zadania.
To mały błąd w małym projekcie testowym. W procesie zakładania kont może oznaczać wadliwe rekordy, późniejszą ręczną naprawę i trudny audyt.
Decyzja wdrożeniowa: brak zestawu przypadków brzegowych oznacza brak podstawy do produkcji. Jeżeli błędu nie da się wykryć automatycznie lub niedrogo przejrzeć, wybierz węższy system, mocniejszy model albo klasyczny kod.
Wynik 5. Efektowna generacja nie przeszła odbioru przeglądarkowego
Qwen Code wygenerował interfejs systemu rekrutacyjnego od pustego katalogu w 26:03. Strona miała wyszukiwanie, sortowanie, etapy, panel szczegółów i 10 000 syntetycznych kandydatów. Lista nie miała ograniczonego obszaru przewijania, więc przeglądarka renderowała 8652 pasujące wiersze i 251 327 elementów DOM. Pierwsza generacja zakończyła się także fałszywym alarmem wykrywacza pętli przed pełnym testem w przeglądarce.
Naprawa sześciu usterek oraz późniejsza korekta dwóch problemów wizualnych podniosły łączny czas modelu do 48:25. Dopiero wtedy niezależny odbiór potwierdził ograniczoną liczbę wierszy, brak overflow i poprawną geometrię desktop/mobile.
Decyzja wdrożeniowa: demo bez testu skutku jest prototypem. W UI potrzebne są zachowania, wydajność, responsywność i przegląd obrazu. W procesie dokumentowym odpowiednikami są cytaty, odmowa przy braku źródła i test uprawnień.
Tabela zatrzymania projektu
| Sygnał z pilota | Działanie przed dalszą inwestycją |
|---|---|
| zadanie nie kończy się lub przepełnia kontekst | zmień klienta, profil albo model; powtórz test na tym samym repozytorium |
| kompresje i ponowne odczyty dominują przebieg | zwiększ użyteczne okno lub zmniejsz pakiet narzędzi i źródeł |
| dłuższy kontekst nie poprawia odbioru | dodaj wyszukiwanie, podziel dokumenty na fragmenty lub skróć proces |
| błąd brzegowy ma wysoki koszt | rozszerz zestaw testów albo użyj deterministycznego komponentu |
| wynik wygląda dobrze, lecz nie ma testu skutku | nie dopuszczaj użytkowników |
| nikt nie jest właścicielem aktualizacji i incydentu | wybierz usługę zarządzaną lub nie uruchamiaj |
Co kupuje firma, która chce uniknąć złego wdrożenia
Syntalith może przeprowadzić krótki test odmowy: wybieramy proces, budujemy 20–50 przypadków, uruchamiamy lokalny model i sensowną bazę API, mierzymy czas, koszt, poprawki oraz ryzyko. Wynikiem może być lokalny Qwen, mniejszy model, kod deterministyczny, API albo zalecenie, by projektu nie budować.
Bezpłatny skan procesu służy do wyboru jednego przypadku. Audyt procesu AI od 4990 zł netto dostarcza porównanie, kryteria odbioru, architekturę i stałą wycenę. Klient otrzymuje rozstrzygnięcie przed zakupem infrastruktury. Z góry wybrany model nie dostaje taryfy ulgowej.
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces