Jak odizolowaliśmy eksperyment z lokalnym agentem Qwen
Czyste projekty testowe, osobne kopie repozytorium, ukryte kontrole, jawna lista narzędzi i pełny zapis zmian. Pokazujemy także ograniczenia izolacji.
Artykuły zebrane według problemu, branży i rodzaju systemu.
Czyste projekty testowe, osobne kopie repozytorium, ukryte kontrole, jawna lista narzędzi i pełny zapis zmian. Pokazujemy także ograniczenia izolacji.
OpenCode ma udokumentowane połączenie z modelem lokalnym. Claude Code wymaga zgodnej bramy, a Anthropic nie wspiera kierowania klienta do modeli innych niż Claude.
Codex pozwala wskazać własny serwer przez protokół Responses. Pokazujemy działającą konfigurację, granicę wsparcia i wynik lokalnego Qwena.
Dobry benchmark agenta kodowego ma polecenia napisane jak zwykłe zgłoszenia, czysty projekt, ukryte testy, telemetrię i niezależny przegląd. Pokazujemy metodę oceny poprawki przed jej przyjęciem.
Ten sam lokalny Qwen dał różne wyniki w czterech klientach do pracy z agentem. Porównujemy zadania, czas, ukryte testy i jakość zmian.
Lokalny Qwen zbudował panel rekrutacyjny od pustego katalogu. Pierwsza wersja wyglądała dobrze, ale miała 251 327 elementów DOM i sześć usterek.
Wyjaśniamy każde ustawienie profilu Qwen Code: poziom rozumowania, limit odpowiedzi, zachowanie toku myślenia, długość kontekstu i liczbę agentów.
Sprawdziliśmy eksport CSV, paginację i import użytkowników. Qwen wykonał dwie zmiany poprawnie, a w trzeciej pominął walidację wykrytą przez ukryty test.
Zapis jednego domowego eksperymentu z Qwen3.8-27B: profil serwera, czasy, tokeny, energia, VRAM, testy kodu i wykryte błędy wraz z ograniczeniami.
Automatyzacja prowadzi proces po ustalonej ścieżce. Agent AI wybiera część kolejnych kroków na podstawie kontekstu. Porównujemy koszt, czas, ryzyko i utrzymanie.
Aplikacja daje zespołowi miejsce do pracy, automatyzacja wykonuje ustalone kroki w tle, a agent podejmuje wybrane decyzje zależnie od sprawy.
ChatGPT jest ogólnym środowiskiem pracy z AI, Microsoft 365 Copilot działa w aplikacjach Microsoft 365, a osobisty agent to skonfigurowany operator procesu.
Zdjęcie o słabej jakości może prowadzić do danych, które wyglądają wiarygodnie i są błędne. Dlatego system mierzy jakość obrazu przed rozpoczęciem odczytu.
Oba warianty dostały ten sam model, dane, narzędzia i kryteria oceny. Na jednym zadaniu uzyskały tę samą jakość, ale różniły się czasem i kosztem wykonania.
Zmyślone sygnatury orzeczeń kończyły się sankcjami dla prawników. W opisanym systemie każda teza musi wskazywać dokładny fragment dokumentu źródłowego.
Wiarygodnie wyglądający dekret bez podstawy jest kosztownym błędem. System wskazuje wcześniejszy dekret dostawcy, a brak źródła kieruje fakturę do księgowej.
Model oceniający własny szkic może powtórzyć ten sam błąd. Pokazujemy monitoring należności, w którym szkic tworzy jeden model, a drugi ocenia wyłącznie gotowy tekst. System nie ma funkcji wysyłki.
Błędne nagranie trudniej odwołać niż tekst. Pokazujemy stół odsłuchu, w którym syntezę mowy może uruchomić wyłącznie wskazany recenzent, a każde nagranie zaczyna się od informacji, że mówi system.
Sześć środowisk wykonuje to samo zadanie z identyczną odpowiedzią wejściową. Test pokazuje różnice między narzędziami bez wpływu losowości generowania.
Zdjęcie, notatka głosowa i karta pracy mogą zawierać różne informacje. Pokazujemy akt terenowy, w którym sprzeczność pozostaje widoczna aż do decyzji człowieka, a sugestie modeli nie wpływają na ocenę bezpieczeństwa.