Zespół sprawdza sześć technologii na tych samych zadaniach, zanim wybierze podstawę nowego systemu.
Każda technologia dostaje te same 50 przypadków i te same zasady odpowiedzi. Osobny program mierzy czas, błędy i wymagane odmowy. Wynik pomaga wybrać dwa rozwiązania do pilotażu na prawdziwym procesie firmy.
Co sprawdziliśmy
Test na danych testowych obejmuje sześć podejść wykonujących to samo ustalone zadanie. Wynik pokazuje różnice, lecz nie zastępuje pilotażu na rzeczywistym procesie klienta.
- Zapisany test
- Co sprawdziliśmy
- Sześć podejść · wspólny zestaw zadań · wymagane odmowy
- Porównanie platform agentowych
- Zweryfikowano
- publiczny zapis testu
Problem, rozwiązanie i wynik
Problem
Porównania technologii często używają innych danych i zasad, dlatego trudno oprzeć na nich decyzję. Zły wybór ujawnia się późno i może oznaczać kosztowne przepisanie systemu.
Jak to działa
Sześć implementacji dostaje ten sam zestaw pięćdziesięciu przypadków i ten sam wymagany format odpowiedzi. Niezależny program mierzy pełny czas przejścia oraz zapisuje odmowy i błędy. Wynik służy jako punkt wyjścia do pilotażu na procesie klienta.
Co zapisał przebieg
Porównanie obejmuje sześć podejść wykonujących to samo ustalone zadanie. Wynik pokazuje różnice, lecz nie zastępuje pilotażu na rzeczywistym procesie klienta.
Dla kogo
Ten test ma sens, jeśli zespół wybiera technologię agentową na podstawie opinii dostawców, a zmiana podstawy po rozpoczęciu wdrożenia oznaczałaby tygodnie dodatkowej pracy.
Stały zestaw zadań → 6 adapterów → porównanie
- 01Sześć implementacji dostaje identyczne przypadki i ten sam punkt testowy
- 02Stałe odpowiedzi oddzielają czas integracji od czasu modelu
- 03Technologię wybiera zespół po pilotażu na własnym procesie
- Typ firmy
- Zespoły programistyczne i automatyzacji wybierające platformę agentową
- Wejście
- Ten sam ustalony zestaw 50 przypadków dla każdego podejścia, w tym 12 wymaganych odmów
- Stan testu
- Pole bez wyniku pokazuje „Nie sprawdzono”. Ostateczny wybór technologii wymaga pilotażu na procesie firmy
- Koszt
- Około 0,0019 zł za osobny zapisany przebieg potwierdzający połączenie.
- Bezpieczeństwo
- Każde podejście otrzymuje te same przypadki i zasady odmowy. Różnice pozostają widoczne w wyniku.
- Tempo
- Czas działania porównujemy na jednym stałym zestawie. Wynik z jednej maszyny wymaga potwierdzenia w pilotażu.
- Historia testów
- Historia zawiera warunki porównania, wyniki i wersję każdego badanego podejścia.
- Budowa podobnego systemu
- od 25 000 zł netto · 6–16 tygodni
Zakres wniosków
Ten test nie wybiera technologii za zespół
Porównanie sprawdza ustalone zadania na jednej maszynie. Nie obejmuje ruchu produkcyjnego, awarii usług zewnętrznych ani wszystkich integracji. Lider techniczny wybiera rozwiązanie dopiero po pilotażu na procesie i danych firmy.
- Koszt
- Około 0,0019 zł za osobny zapisany przebieg potwierdzający połączenie.
- Bezpieczeństwo
- Każde podejście otrzymuje te same przypadki i zasady odmowy. Różnice pozostają widoczne w wyniku.
- Tempo
- Czas działania porównujemy na jednym stałym zestawie. Wynik z jednej maszyny wymaga potwierdzenia w pilotażu.
Wynik obejmuje także rozwiązania używane przez nas
Porównanie pokazało wyraźne różnice czasu działania między sześcioma podejściami, w tym rozwiązaniami używanymi przez nas. Jedno uruchomienie nie wyjaśnia przyczyny różnicy. Wynik służy do wyboru dwóch kandydatów do pilotażu na rzeczywistym procesie klienta.
Szacowany efekt
Policz efekt na swoim wolumenie
To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Podczas pilotażu sprawdzamy go na danych procesu.
Dziś
Scenariusz osobnych PoC: 24 dni
Po uruchomieniu
Scenariusz wspólnego testu porównawczego: 8 dni
Oszczędność czasu lub kosztu
Scenariusz: 12-20 dni/decyzję, baza 16 dni
- Wolumen
- Scenariusz: 6 wariantów
- Formuła
- 24 dni - 8 dni
- Status wyliczenia
- niska
Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są testowe. Dane klientów pozostają prywatne. Wyniki dotyczą opisanego testu; wpływ produkcyjny sprawdzamy na danych klienta.
Ekrany
Lider techniczny porównuje sześć integracji jedną metodą i decyduje, które trafiają do pilotażu na własnym procesie.
Zespół dostaje jedną metodę porównania sześciu podejść: wspólny zestaw zadań i raport, w którym każde rozwiązanie jest oceniane tak samo. Pole bez wyniku pozostaje puste. Na danych klienta trzeba jeszcze sprawdzić zachowanie pod rzeczywistym obciążeniem, obsługę awarii i ograniczenia usług zewnętrznych.
Frame/Lab: metoda, implementacje i wspólny przebieg.
Metoda
Zestaw zadań, punkt testowy i kryteria są opisane przed wynikami. Tę samą próbę można później powtórzyć.
Sześć implementacji
Kod adapterów w przypiętych wersjach, każdy z identycznym zadaniem i wejściem.
Wspólny przebieg
300 obserwacji z czasami, odmowami i narzutem względem czystego Pythona.
Ekrany systemu
Zobacz, jak system działa w praktyce
To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.
- Ekrany
- 11
- px
- 1440 · 390
- 021440×3315
Historia testu z identyfikatorem i zakresem 300 obserwacji. - 031440×1100
Kontrolowana odmowa w widoku telefonu.
Otwórz archiwum pozostałych ekranów (8)
- 041440×1100
Przypadek zgodnej odpowiedzi - 051440×1100
Przypadek kontrolowanej odmowy - 061440×1100
Metoda testu - 071440×1100
Implementacje - 081440×1100
LangGraph: wersja, wynik i kod - 091440×1100
Claude Agent SDK: wynik i kod adaptera - 101440×1100
Jak powtórzyć test - 111440×1100
Historia zakończonego testu
Stos technologiczny
Prosty program testowy działa niezależnie od badanych technologii.
Porównanie adapterów używa lokalnej usługi ze stałymi odpowiedziami, aby oddzielić czas integracji od zachowania modelu. Osobno uruchamiamy test z rzeczywistym modelem i zapisujemy dane dostawcy. Wyników tych dwóch prób nie łączymy w jeden ranking.
- Program testowy w Pythonie 3.13
- przekazuje zadania do adapterów, ocenia wyniki i zapisuje każdą obserwację
- Lokalny punkt testowy (FastAPI)
- zwraca odpowiedź zależną tylko od numeru przypadku, z identycznym zużyciem i ceną 0 zł
- Sześć adapterów w przypiętych wersjach
- LangGraph 1.2.7, Claude Agent SDK 0.2.126, OpenAI Agents SDK 0.7.0, CrewAI 1.15.8, n8n 2.32.6 i Python 3.13.7
- PostgreSQL 17
- zapisuje przebiegi, kroki, decyzje i historię kontroli
- Next.js
- pokazuje raport bezpośrednio z zapisanych wyników, bez ręcznie wpisanych wartości
Publiczny materiał zawiera zestaw zadań, kod sześciu adapterów, program testowy i zapis przebiegu. Każdy może więc powtórzyć test i sprawdzić wynik. Całość działa lokalnie w Docker Compose i nie korzysta z danych ani poświadczeń klienta.
Szczegóły techniczne i wyniki testów
Pętla pracy
Metoda przed wynikiem. Inaczej wynik jest opinią z tabelką.
Najpierw zapisujemy stały zestaw, wspólny punkt testowy i kryteria oceny. Dopiero potem uruchamiamy porównanie. Dzięki tej kolejności nie da się po fakcie dopasować testu do tezy, także naszej.
Wspólny zestaw: 50 przypadków, w tym 12 oczekiwanych odmów
Sześć adapterów w przypiętych wersjach: LangGraph, Claude SDK, OpenAI SDK, CrewAI, n8n, czysty Python
Jeden lokalny punkt testowy ze stałymi odpowiedziami
Osobny program ocenia wynik i mierzy pełny czas przejścia
Raport: zgodność z wymaganym formatem, p95 każdej integracji i pola „Nie sprawdzono”
Architektura systemu
Stały zestaw zadań, sześć adapterów i niezależny program testowy.
Przypadki oraz kryteria są zapisane przed testem. Każda implementacja dostaje te same odpowiedzi, a osobny program zbiera wyniki wszystkich sześciu wariantów.
- 01
Zestaw
Przypadki i odmowy są zamrożone.
Pięćdziesiąt przypadków z wymaganym formatem odpowiedzi, w tym dwanaście odmów, jest zapisanych przed uruchomieniem. Żaden wariant nie dostaje łatwiejszej wersji zadania.
- 02
Adaptery
Sześć implementacji tego samego zadania.
LangGraph, Claude Agent SDK, OpenAI Agents SDK, CrewAI, n8n i czysty Python w przypiętych wersjach rozwiązują identyczny problem. Każda implementacja korzysta z typowego dla siebie sposobu budowy, więc różnice dotyczą badanej technologii.
- 03
Punkt testowy
Lokalna usługa zwraca stałe odpowiedzi.
Lokalny punkt końcowy zwraca wynik zależny tylko od numeru przypadku, z jednakowym zużyciem i ceną 0 zł. Dzięki temu test dotyczy integracji z daną technologią, bez wpływu dostawcy modelu.
- 04
Porównanie
Osobny program ocenia wszystkie warianty tak samo.
Program zapisuje zgodność z wymaganym formatem, czas i koszt. Raport pokazuje odsetek prawidłowych wyników oraz p95 każdej integracji na tle czystego Pythona.
Czysty Python jest punktem odniesienia dla sześciu technologii
Punktem odniesienia jest implementacja bez dodatkowego frameworka. Raport pokazuje różnicę dla każdego wariantu, w tym dla Claude Agent SDK, którego sami używamy. Pojedynczy przebieg nie rozdziela czasu między bibliotekę, proces, kontener i transport.
- Zestaw zadań i kryteria istnieją przed uruchomieniem
- Stałe odpowiedzi oddzielają czas integracji od czasu modelu
- Czysty Python jest wariantem bez dodatkowego frameworka
- W raporcie pokazujemy też wyniki narzędzi używanych przez nas
Chcesz sprawdzić podobny proces w swojej firmie?
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
Terminy zobaczysz w swojej strefie czasowej.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.