Prompt injection w pracy agentów AI: na czym polega i jak się bronić w 2026
Prompt injection to atak, w którym treść czytana przez model podszywa się pod instrukcję i zmienia zachowanie agenta. OWASP opisuje go jako LLM01:2025.
Syntalith
Prompt injection polega na tym, że mail, dokument albo strona podszywa się pod instrukcję dla modelu. W agencie z dostępem do narzędzi może to uruchomić niechciane działanie. Ochrona wymaga ograniczonych uprawnień, kontroli każdej akcji i zgody człowieka przed trudnym do cofnięcia skutkiem.
Na czym polega prompt injection
W przypadku agentów skutkiem ataku może być także działanie w zewnętrznym systemie. Dlatego trzeba oceniać zarówno odporność modelu, jak i uprawnienia narzędzi oraz możliwość zatrzymania operacji przed jej wykonaniem.
Atak bezpośredni to instrukcja wpisana wprost przez użytkownika („zignoruj poprzednie polecenia i...”). Atak pośredni ukrywa instrukcję w treści, którą agent czyta po drodze: w mailu, dokumencie PDF, stronie WWW, zgłoszeniu klienta, opisie narzędzia albo pamięci z poprzedniej sesji. Model dostaje cudze polecenie jako część materiału do pracy.
OWASP odróżnia prompt injection od jailbreaku: jailbreak celuje w obejście zabezpieczeń modelu, a prompt injection zmienia działanie aplikacji. Dla firmy najważniejsze pytanie brzmi: czy model może wykonać akcję, której nie zlecił żaden człowiek?
OWASP klasyfikuje prompt injection jako LLM01:2025 i opisuje osobny Top 10 dla aplikacji agentowych na 2026 rok. To ryzyko architektoniczne: dopóki instrukcje i dane płyną jednym kanałem, skutki trzeba ograniczać wieloma niezależnymi kontrolami.
Dlaczego agenci podnoszą stawkę
W systemie agentowym skutki zwiększają trzy cechy:
- Instrukcje systemowe, wiadomość użytkownika, dokumenty, wyniki narzędzi i pamięć trafiają do jednego kontekstu bez technicznego rozdzielenia instrukcji od danych.
- Ukryte polecenie zapisane w pamięci, zbiorze RAG albo bazie wektorowej może wpływać na kolejne sesje korzystające z tego źródła.
- Model może uruchamiać pliki, pocztę, API, serwery MCP i inne narzędzia. Wtedy niechciane polecenie może spowodować zmianę poza oknem czatu.
OWASP opisuje powiązane ryzyko „Excessive Agency” (LLM06): szerokie uprawnienia zwiększają możliwy skutek udanego ataku. Przed wdrożeniem trzeba więc zapytać, co agent może zrobić po błędnej decyzji.
Czy agent AI może usunąć firmową bazę danych?
Scenariusz „agent AI usunął firmową bazę danych” jest możliwy tylko wtedy, gdy system dostał uprawnienie do usuwania i zabrakło warunku zatrzymania przed akcją nieodwracalną. Dlatego agent powinien mieć najmniejszy potrzebny zakres dostępu, wymagać zgody człowieka przed usunięciem oraz rejestrować każde wywołanie narzędzia. Sam prompt nie powinien wystarczyć do zmiany produkcyjnych danych.
Przykład pośredniego ataku
OWASP opisuje EchoLeak jako przykład ukrycia polecenia w mailu i użycia go do wyprowadzenia danych przez system produktywności. Treść, którą agent ma tylko przeczytać, staje się wtedy źródłem ataku. Ten przypadek pokazuje, dlaczego mail, dokument i strona nie mogą dostawać takich samych uprawnień jak instrukcja człowieka.
OWASP zaznacza, że nie ma obecnie niezawodnej metody całkowitego wyeliminowania prompt injection. Dlatego odbiór systemu obejmuje testy ataków, kontrolę uprawnień i sprawdzanie każdej akcji. Jednorazowy filtr przed modelem nie wystarczy.
Jak się przed tym bronić
Nie ma jednego filtra, który „wyłącza” prompt injection. Ryzyko ogranicza kilka niezależnych zabezpieczeń. Dziewięć kryteriów agenta pomaga wskazać, gdzie mają działać i jak sprawdzić je przed produkcją.
- Model mający dostęp do narzędzi nie powinien czytać niezaufanej treści bezpośrednio. Osobny model może analizować taką treść bez prawa do wykonywania działań.
- Agent dostaje tylko potrzebne akcje i dane. Klucz
service_roleomija zabezpieczenia na poziomie wiersza, więc nie powinien trafiać do modelu. - Każde wywołanie narzędzia jest porównywane z pierwotnym poleceniem człowieka oraz dozwolonym zakresem zadania.
- Wysyłka do klienta, zmiana w ERP, płatność i usunięcie danych wymagają zatwierdzenia.
- Każda decyzja oraz każde wywołanie narzędzia trafiają do historii, aby po incydencie można było odtworzyć zdarzenia.
- Dodatkowy filtr treści może pomóc, ale nie zastępuje reguł zapisanych w kodzie.
Każde wdrożenie agenta AI obejmuje ograniczenia, przekazywanie wyjątków, bezpieczeństwo, pomiar i historię działań. Kontrola uprawnień powinna działać poza modelem: osobna kontrola ocenia proponowaną akcję, może wymagać drugiej zgody i zatrzymuje wywołanie przed ERP, CRM lub DMS.
Co to znaczy przy wyborze wykonawcy
Odpowiedzi na pięć pytań pokażą, czy wykonawca uwzględnił to ryzyko:
- Co agent może zrobić sam, a co tylko przygotowuje do zatwierdzenia?
- Jakie dane i narzędzia widzi i czy ma najmniejsze potrzebne uprawnienia?
- Jak oddzielacie treść niezaufaną od instrukcji?
- Co jest logowane i czy po incydencie da się odtworzyć, co się stało?
- Gdzie działa agent i jak odizolowane są jego narzędzia?
Brak konkretnych odpowiedzi na te pytania oznacza, że zakres bezpieczeństwa nie został jeszcze zdefiniowany. Jak czytać pełny zestaw wymagań krok po kroku, tłumaczymy w przewodniku czym jest agent AI.
Prompt injection a AI Act
Od 2 sierpnia 2026 stosuje się obowiązki przejrzystości z art. 50 AI Act. Wytyczne Komisji Europejskiej obejmują między innymi informowanie osób, że wchodzą w interakcję z systemem AI. To odrębny obowiązek od ochrony przed prompt injection. W projekcie trzeba więc osobno opisać przejrzystość wobec użytkownika i kontrolę działań systemu.
Najpierw sprawdź proces
Jeśli planujesz agenta, który ma sięgać do Twoich systemów, zacznij od bezpłatnego skanu procesów. W 30 minut z inżynierem ustalimy, co agent ma robić, czego mu nie wolno i gdzie wchodzi człowiek. To samo myślenie, które ogranicza prompt injection, ogranicza też koszt i ryzyko wdrożenia.
Porównaj aktualny zakres i cenę wdrożenia, a następnie umów bezpłatny skan procesów. Podczas rozmowy rozpiszemy jedną akcję, potrzebne uprawnienia, warunek zatrzymania i decyzję człowieka.
Źródła
- OWASP LLM01:2025 Prompt Injection
- OWASP Top 10 for Agentic Applications for 2026
- Komisja Europejska: wytyczne do art. 50 AI Act
Powiązane artykuły
Najczęstsze pytania
- Czym jest prompt injection?
- To podatność, w której treść czytana przez model, na przykład mail, dokument lub strona, zawiera ukryte polecenie i zmienia zachowanie modelu. W agencie z dostępem do narzędzi może prowadzić zarówno do złej odpowiedzi, jak i do niechcianej akcji.
- Czym prompt injection różni się od jailbreaku?
- Jailbreak celuje w obejście zabezpieczeń modelu, a prompt injection zmienia działanie aplikacji przez treść, którą model ma przeczytać. Dla firmy skutkiem może być niechciana akcja w systemie.
- Czy można w pełni zabezpieczyć agenta przed prompt injection?
- Nie ma jednego filtra, który eliminuje ten atak. Ryzyko ogranicza kilka niezależnych zabezpieczeń: rozdzielenie treści od instrukcji, najmniejsze uprawnienia, kontrola akcji, zgoda człowieka i historia wywołań narzędzi.
- Jak Syntalith ogranicza prompt injection?
- Agent dostaje najmniejsze potrzebne uprawnienia i działa w odizolowanym środowisku. Nieodwracalne akcje wymagają zgody człowieka, a każde wywołanie narzędzia jest zapisywane.
Bezpłatny skan procesów
Zacznij od bezpłatnego skanu procesów.
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: możliwy kierunek, brakujące informacje i następny krok.
W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.
0 zł
30 minut · pisemne podsumowanie w 2 dni robocze
Terminy zobaczysz w swojej strefie czasowej.
Wolisz napisać? Opisz proces