Zespół sprawdza sześć technologii na tych samych zadaniach, zanim wybierze podstawę nowego systemu.
Każda technologia dostaje te same 50 przypadków i te same zasady odpowiedzi. Osobny program mierzy czas, błędy i wymagane odmowy. Wynik pomaga wybrać dwa rozwiązania do pilotażu na prawdziwym procesie firmy.
Co zmierzyliśmy
Porównanie obejmuje sześć podejść wykonujących to samo ustalone zadanie. Wynik pokazuje różnice, lecz nie zastępuje pilotażu na rzeczywistym procesie klienta.
- Zapisany pomiar
- Co zmierzyliśmy
- Sześć podejść · wspólny zestaw zadań · wymagane odmowy
- Porównanie platform agentowych
- Zweryfikowano
- publiczna wersja pokazowa
Problem, rozwiązanie i wynik
Problem
Porównania technologii często używają innych danych i zasad, dlatego trudno oprzeć na nich decyzję. Zły wybór ujawnia się późno i może oznaczać kosztowne przepisanie systemu.
Jak to działa
Sześć implementacji dostaje ten sam zestaw pięćdziesięciu przypadków i wspólny kontrakt odpowiedzi. Niezależny program mierzy pełny czas przejścia oraz zapisuje odmowy i błędy. Wynik służy jako punkt wyjścia do pilotażu na procesie klienta.
Co zapisał przebieg
Porównanie obejmuje sześć podejść wykonujących to samo ustalone zadanie. Wynik pokazuje różnice, lecz nie zastępuje pilotażu na rzeczywistym procesie klienta.
Dla kogo
Ten test ma sens, jeśli zespół wybiera technologię agentową na podstawie opinii dostawców, a zmiana podstawy po rozpoczęciu wdrożenia oznaczałaby tygodnie dodatkowej pracy.
Golden set → 6 adapterów → pomiar
- 01Sześć implementacji dostaje identyczne przypadki i wspólny gateway
- 02Gateway usuwa z pomiaru wpływ modelu, zostaje sam framework
- 03Stos wybiera zespół po pilotażu na własnym przepływie
- Typ firmy
- Zespoły programistyczne i automatyzacji wybierające platformę agentową
- Wejście
- Ten sam ustalony zestaw 50 przypadków dla każdego podejścia, w tym 12 wymaganych odmów
- Granica
- Pole bez pomiaru pokazuje „Nie zmierzono”; test porównawczy nie wskaże stosu bez pilotażu na waszym przepływie
- Koszt
- Około 0,0019 zł za osobny zapisany przebieg potwierdzający połączenie.
- Bezpieczeństwo
- Każde podejście otrzymuje te same przypadki i zasady odmowy. Różnice pozostają widoczne w wyniku.
- Tempo
- Czas działania porównujemy na jednym stałym zestawie. Wynik z jednej maszyny wymaga potwierdzenia w pilotażu.
- Ślad
- Historia zawiera warunki porównania, wyniki i wersję każdego badanego podejścia.
- Budowa podobnego systemu
- od 25 000 zł netto · 6–16 tygodni
Granica wniosków
Ten test nie wybiera technologii za zespół
Porównanie mierzy ustalone zadania na jednej maszynie. Nie obejmuje ruchu produkcyjnego, awarii usług zewnętrznych ani wszystkich integracji. Lider techniczny wybiera rozwiązanie dopiero po pilotażu na procesie i danych firmy.
- Granica
- Pole bez pomiaru pokazuje „Nie zmierzono”; test porównawczy nie wskaże stosu bez pilotażu na waszym przepływie
- Koszt
- Około 0,0019 zł za osobny zapisany przebieg potwierdzający połączenie.
- Bezpieczeństwo
- Każde podejście otrzymuje te same przypadki i zasady odmowy. Różnice pozostają widoczne w wyniku.
- Tempo
- Czas działania porównujemy na jednym stałym zestawie. Wynik z jednej maszyny wymaga potwierdzenia w pilotażu.
Wynik obejmuje także rozwiązania używane przez nas
Porównanie pokazało wyraźne różnice czasu działania między sześcioma podejściami, w tym rozwiązaniami używanymi przez nas. Jedno uruchomienie nie wyjaśnia przyczyny różnicy. Wynik służy do wyboru dwóch kandydatów do pilotażu na rzeczywistym procesie klienta.
Szacowany efekt
Policz efekt na swoim wolumenie
To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Wynik potwierdzamy dopiero podczas pilotażu.
Dziś
Scenariusz osobnych PoC: 24 dni
Po uruchomieniu
Scenariusz wspólnego testu porównawczego: 8 dni
Oszczędność czasu lub kosztu
Scenariusz: 12-20 dni/decyzję, baza 16 dni
- Wolumen
- Scenariusz: 6 wariantów
- Formuła
- 24 dni - 8 dni
- Status wyliczenia
- niska
Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są syntetyczne. Dane klientów pozostają prywatne. Pomiary dotyczą opisanej wersji demonstracyjnej i są wyraźnie oddzielone od wyników produkcyjnych.
Powierzchnie pracy
Lider techniczny porównuje sześć integracji jedną metodą i decyduje, które trafiają do pilotażu na własnym procesie.
Zespół dostaje jedną metodę porównania sześciu podejść: wspólny zestaw zadań i raport, w którym każde rozwiązanie jest oceniane tak samo. Pole bez pomiaru pozostaje puste. Na danych klienta trzeba jeszcze sprawdzić zachowanie pod rzeczywistym obciążeniem, obsługę awarii i ograniczenia usług zewnętrznych.
Frame/Lab: metoda, implementacje i wspólny przebieg.
Metoda
Zestaw, gateway i rubryka opisane przed wynikami; z tej kolejności bierze się powtarzalność pomiaru.
Sześć implementacji
Kod adapterów w przypiętych wersjach, każdy z identycznym zadaniem i wejściem.
Wspólny przebieg
300 obserwacji z czasami, odmowami i narzutem względem czystego Pythona.
Ekrany systemu
Zobacz, jak system działa w praktyce
To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.
- Ekrany
- 11
- px
- 1440 · 390
- 021440×3315
Historia pomiaru z identyfikatorem, zakresem 300 obserwacji i śladem. - 031440×1100
Kontrolowana odmowa w kadrze telefonu.
Otwórz archiwum pozostałych ekranów (8)
- 041440×1100
Przypadek zgodnej odpowiedzi - 051440×1100
Przypadek kontrolowanej odmowy - 061440×1100
Metoda pomiaru - 071440×1100
Implementacje - 081440×1100
LangGraph: wersja, wynik i kod - 091440×1100
Claude Agent SDK: wynik i kod adaptera - 101440×1100
Jak powtórzyć pomiar - 111440×1100
Historia zakończonego pomiaru
Stos technologiczny
Warstwa pomiarowa jest celowo prostsza niż to, co mierzy.
Porównanie adapterów używa deterministycznej bramki, aby odizolować narzut platformy od zachowania modelu. Obok działa osobny przebieg z realnym modelem i śladem dostawcy. Te dwa pomiary odpowiadają na różne pytania i nie są mieszane w jednym rankingu.
- Runner w Pythonie 3.13
- prowadzi zestaw przez adaptery, ocenia z zewnątrz i zapisuje surowe obserwacje
- Deterministyczny gateway (FastAPI)
- zwraca odpowiedź zależną tylko od numeru przypadku, z identycznym zużyciem i ceną 0 zł
- Sześć adapterów w przypiętych wersjach
- LangGraph 1.2.7, Claude Agent SDK 0.2.126, OpenAI Agents SDK 0.7.0, CrewAI 1.15.8, n8n 2.32.6 i Python 3.13.7
- PostgreSQL 17
- zapisuje przebiegi, kroki, decyzje i zweryfikowany ślad audytowy
- Next.js
- renderuje raport wprost z wygenerowanego artefaktu, bez ręcznie wpisanych wartości
Test porównawczy jest publiczny w całości: golden set, kod sześciu adapterów, runner i surowy artefakt przebiegu, więc każdy może go powtórzyć i podważyć. Całość działa lokalnie w Docker Compose i nie dotyka danych ani poświadczeń klienta.
Szczegóły techniczne i pomiar
Pętla pracy
Metoda przed wynikiem. Inaczej wynik jest opinią z tabelką.
Najpierw zamrożony zestaw, wspólny gateway i rubryka oceny, dopiero potem uruchomienie. Ta kolejność odbiera możliwość dopasowania pomiaru do tezy, również naszej.
Wspólny zestaw: 50 przypadków, w tym 12 oczekiwanych odmów
Sześć adapterów w przypiętych wersjach: LangGraph, Claude SDK, OpenAI SDK, CrewAI, n8n, czysty Python
Jedna wspólna, deterministyczna bramka testowa
Osobny program ocenia wynik i mierzy pełny czas przejścia
Raport: zgodność z kontraktem, p95 każdej integracji, pola „Nie zmierzono”
Architektura systemu
Golden set, sześć adapterów, gateway i runner.
Zamrożone przypadki, sześć równorzędnych implementacji, deterministyczne odpowiedzi i sędzia pomiaru ustawiony poza badanymi wariantami.
- 01
Zestaw
Przypadki i odmowy są zamrożone.
Pięćdziesiąt przypadków z oczekiwanym kontraktem transportowym, w tym dwanaście odmów, istnieje przed uruchomieniem. Żaden wariant nie dostaje łatwiejszej wersji zadania.
- 02
Adaptery
Sześć implementacji tego samego zadania.
LangGraph, Claude Agent SDK, OpenAI Agents SDK, CrewAI, n8n i czysty Python w przypiętych wersjach rozwiązują identyczny problem, każda implementacja w swoim naturalnym kształcie. Różni się wyłącznie warstwa frameworka.
- 03
Gateway
Model zastąpiony deterministycznym echem.
Lokalny endpoint zwraca wynik zależny tylko od numeru przypadku, z jednakowym zużyciem i ceną 0 zł. Pomiar przestaje dotyczyć dostawcy modelu i zaczyna dotyczyć frameworka.
- 04
Runner
Sędzia stoi poza zawodnikami.
Zgodność z kontraktem gatewaya, czas, koszt i ślad zapisuje runner. Raport pokazuje rozstęp zgodności i p95 każdej integracji względem czystego Pythona.
Czysty Python jest punktem odniesienia dla sześciu frameworków
Punktem odniesienia jest implementacja bez frameworka. Raport pokazuje, czy każdy framework poprawia mierzony wymiar, oraz publikuje najwyższy zmierzony narzut w torze Claude Agent SDK, którego sami używamy. Pojedynczy przebieg nie rozdziela narzutu między framework, proces, kontener i transport.
- Golden set i rubryka istnieją przed uruchomieniem
- Deterministyczny gateway izoluje narzut frameworka
- Czysty Python gra rolę kontroli bez frameworka
- Wynik przeciwko własnemu stosowi też trafia do raportu
Chcesz sprawdzić podobny proces w swojej firmie?
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
Terminy zobaczysz w swojej strefie czasowej.
Bez prezentacji sprzedażowej i bez zobowiązań. Jeśli automatyzacja nie ma sensu, też to napiszemy.