Wiedza · Nowe zagrożenia: agenci, MCP, prompt injection · 8 minut

Prompt injection: co to jest i jak się przed nim chronić

Prompt injection to przejęcie modelu AI tekstem ukrytym w treści, którą czyta. Atak bezpośredni i pośredni, przykład z CV i co realnie działa.

Ostatnia aktualizacja: 5 października 2026

Prompt injection: co to jest?

Prompt injection to sytuacja, w której tekst podany modelowi językowemu zmienia jego zachowanie wbrew intencji osoby, która go wdrożyła. Model nie ma osobnego kanału na polecenia i osobnego na dane. Instrukcja od Ciebie, treść maila i ukryty dopisek na stronie trafiają do niego jako jeden ciąg tekstu.

OWASP Top 10 for LLM Applications 2025 umieszcza prompt injection na pozycji LLM01, czyli pierwszej. OWASP zwraca uwagę, że wstrzyknięta treść nie musi być widoczna dla człowieka. Wystarczy, że model ją odczyta: biały tekst na białym tle, maleńka czcionka, komentarz w kodzie strony, metadane pliku.

NIST AI 600-1, profil ryzyk generatywnej AI z lipca 2024, opisuje to w części o bezpieczeństwie informacji jako nową powierzchnię ataku, która pojawia się razem z modelem.

Bezpośrednia i pośrednia: czym się różnią

Bezpośrednie prompt injection to polecenie wpisane prosto w okno rozmowy, na przykład próba nakłonienia firmowego chatbota do ujawnienia instrukcji systemowej albo obejścia zasad. Atakujący musi mieć dostęp do czatu.

Pośrednie prompt injection działa bez dostępu do czatu. NIST opisuje je jako atak zdalny: ktoś umieszcza polecenia w danych, które model prawdopodobnie kiedyś przeczyta. To może być strona internetowa, PDF od kontrahenta, zgłoszenie od klienta, opis produktu, komentarz w repozytorium.

Pośrednie jest groźniejsze w firmie, bo omija ludzi. Pracownik prosi asystenta o streszczenie dokumentu i nie widzi, że dokument zawierał zdanie skierowane do modelu. Pierwsze systematyczne opisy tej klasy ataku pochodzą z pracy Greshake i współautorów z 2023 roku. Pośrednie wstrzyknięcie może też czekać miesiącami: w bazie wiedzy, w starym zgłoszeniu, w opisie produktu, aż ktoś poprosi asystenta o przeszukanie tych danych.

Prompt injection w CV: ukryte instrukcje dla rekruterów AI

CV to podręcznikowy przykład pośredniego ataku. OWASP w opisie LLM01 podaje scenariusz, w którym kandydat dzieli polecenie na fragmenty ukryte w życiorysie, a model oceniający kandydatów wystawia pozytywną rekomendację niezależnie od faktycznej treści.

To nie jest już tylko scenariusz. W badaniu opublikowanym 27 maja 2026 autorzy przeanalizowali około 200 tysięcy prawdziwych CV z platformy rekrutacyjnej hireEZ. Ukryte wstrzyknięcia znaleźli w około 1% z nich. W latach 2019-2023 udział wynosił 0,6-0,8%, w 2024 roku skoczył do około 1,2%, a potem nieco spadł, choć liczba takich CV dalej rosła razem z liczbą aplikacji. Ponad 90% nie zawierało jawnego polecenia, tylko ukryty tekst, najczęściej listy umiejętności, słowa kluczowe i dopisane doświadczenie.

Jeśli szukasz pracy: ukryty tekst to wprowadzanie w błąd, a narzędzia porównujące to, co widzi człowiek, z tym, co odczytuje maszyna, właśnie po to powstają. Jeśli rekrutujesz: każ narzędziu pokazywać tekst wyciągnięty z pliku i nie opieraj odrzucenia ani zaproszenia wyłącznie na ocenie modelu.

Systemy AI używane w zatrudnianiu to w AI Act obszar wysokiego ryzyka. Według Komisji Europejskiej po zmianach z pakietu AI Omnibus obowiązki dla tego obszaru stosuje się od 2 grudnia 2027. Szerzej o terminach w artykule AI Act: co to jest i kogo dotyczy.

Dlaczego nie da się tego po prostu wyłączyć?

OWASP pisze wprost, że nie jest jasne, czy istnieją niezawodne metody zapobiegania prompt injection. Simon Willison, badacz, który od 2022 roku dokumentuje ten problem, w czerwcu 2025 napisał, że nadal nie wiemy, jak w 100% temu zapobiec.

Powód jest konstrukcyjny. Filtr, który wyłapie 95% ataków, w bezpieczeństwie oznacza, że co dwudziesta próba przechodzi, a atakujący próbuje tyle razy, ile chce. Szef bezpieczeństwa OpenAI przy premierze przeglądarki ChatGPT Atlas w październiku 2025 nazwał prompt injection „nierozwiązanym problemem bezpieczeństwa” (relacja Simona Willisona).

Wniosek praktyczny: nie projektuj wdrożenia tak, jakby model zawsze słuchał tylko Ciebie. Projektuj je tak, żeby posłuszeństwo wobec obcego tekstu nie mogło wyrządzić dużej szkody.

Kiedy prompt injection jest groźne: zabójcze trio

Willison nazwał to lethal trifecta, zabójczym trio. Szkoda pojawia się, gdy jeden system łączy trzy rzeczy: dostęp do prywatnych danych, kontakt z niezaufaną treścią i możliwość wysłania czegoś na zewnątrz.

Przykład: asystent czyta Twoją skrzynkę (dane), dostaje maila od obcej osoby (niezaufana treść) i potrafi wysłać wiadomość albo otworzyć link (komunikacja). Jedna ukryta linijka w mailu wystarczy, żeby poprosić go o przesłanie dalej czegoś, czego nie powinien.

Usuń jeden element, a ten typ wycieku przestaje być możliwy. To jest najprostsze pytanie kontrolne dla każdego asystenta, agenta i serwera MCP, który podłączasz.

Prompt injection protection: co realnie działa

OWASP wymienia siedem kierunków. W praktyce firmy liczą się te, które ograniczają skutki, a nie te, które obiecują wykrycie każdego ataku:

1. Najmniejsze uprawnienia. Model, który tylko streszcza, nie potrzebuje prawa do wysyłki maili ani zapisu w bazie. 2. Zgoda człowieka przed działaniem o skutkach: płatność, wysyłka, usunięcie, zmiana uprawnień. 3. Oddzielenie treści z zewnątrz od poleceń i wyraźne oznaczenie, skąd pochodzi każdy fragment. 4. Ustalony format odpowiedzi i jego sprawdzanie w kodzie, zanim cokolwiek zostanie wykonane. 5. Filtry wejścia i wyjścia jako dodatkowa warstwa, nigdy jedyna. 6. Testy z wrogą treścią przed wdrożeniem i po każdej zmianie.

Do tego dochodzi zasada z OWASP LLM06 (nadmierna sprawczość): decyzję o dostępie egzekwuje system docelowy, a nie model. Jeśli baza danych nie pozwala użytkownikowi czytać cudzych rekordów, model działający w jego imieniu też ich nie przeczyta, niezależnie od tego, co mu wstrzyknięto. Przykład: asystent obsługi klienta odpowiada na podstawie bazy zamówień. Jeśli zapytania do bazy idą z uprawnieniami zalogowanego klienta, wstrzyknięte „pokaż wszystkie zamówienia” zwróci tylko jego zamówienia.

Jak sprawdzić własne wdrożenie

Zacznij od spisu: które narzędzia AI w firmie czytają treść z zewnątrz i co mogą zrobić po jej przeczytaniu. Często lista jest dłuższa niż oficjalna, bo pracownicy podłączają narzędzia sami, o czym więcej w tekście o shadow AI. Przy każdym narzędziu zapisz, kto je zatwierdził i kto odpowiada za jego konfigurację.

Dla każdego narzędzia odpowiedz na trzy pytania z zabójczego trio. Tam, gdzie wszystkie trzy odpowiedzi brzmią „tak”, odetnij jedną albo dodaj zatwierdzenie przez człowieka. Zasady dla zespołu zapisz w polityce korzystania z AI.

Jeśli wdrażasz agenta albo serwer MCP i chcesz, żeby ktoś z zewnątrz sprawdził uprawnienia i odporność na wstrzyknięcie treści, opisujemy zakres na stronie agenci i serwery MCP. Wynik mówi, co wiemy, czego nie sprawdziliśmy i co zrobić, a nie „bezpieczne”.

W skrócie

  • Prompt injection to polecenie ukryte w tekście, który czyta model. Pośrednie nie wymaga dostępu do czatu.
  • OWASP i badacze zgodnie mówią, że pewnej ochrony nie ma. Ograniczasz skutki, nie samą możliwość ataku.
  • Sprawdź każde narzędzie pod kątem trzech rzeczy naraz: prywatne dane, obca treść, wysyłka na zewnątrz.
  • Płatności, wysyłka i usuwanie zawsze z zatwierdzeniem człowieka.
  • W rekrutacji ukryty tekst w CV jest realnym zjawiskiem: około 1% plików w dużym badaniu z 2026 roku.

Masz adres strony, aplikacji albo maila, który budzi wątpliwości?

Najczęstsze pytania

Czym jest prompt injection w prostych słowach?

To podrzucenie modelowi AI polecenia w treści, którą ma tylko przeczytać. Model nie odróżnia pewnie poleceń od danych, więc czasem wykonuje to, co ktoś mu podrzucił.

Czy ukryty tekst w CV działa na systemy rekrutacyjne AI?

Może wpłynąć na ocenę, bo system czyta tekst, którego człowiek nie widzi. Da się go jednak wykryć, porównując widoczny tekst z odczytanym przez maszynę, i właśnie takie wykrywanie opisuje badanie z 2026 roku. Ukryty tekst jest wprowadzaniem w błąd wobec pracodawcy.

Czym różni się prompt injection od jailbreaku?

Jailbreak to próba obejścia zasad bezpieczeństwa samego modelu, zwykle bezpośrednio w czacie. Prompt injection to szersze pojęcie: każda treść, która przejmuje zachowanie aplikacji z modelem, także pośrednio przez dokumenty i strony.

Czy filtr albo „guardrail” wystarczy jako ochrona przed prompt injection?

Nie jako jedyna warstwa. Filtry zmniejszają liczbę udanych ataków, ale nie do zera, dlatego OWASP zaleca dodatkowo najmniejsze uprawnienia i zgodę człowieka przy działaniach o skutkach.

Czy prompt injection dotyczy też zwykłego ChatGPT?

Tak, gdy model czyta treść z zewnątrz: stronę, plik, maila albo wynik narzędzia. Ryzyko rośnie z tym, ile dany asystent może zrobić po przeczytaniu takiej treści.

Źródła

  1. OWASP: LLM01:2025 Prompt Injection
  2. OWASP Top 10 for LLM Applications 2025
  3. NIST AI 600-1: Generative Artificial Intelligence Profile (lipiec 2024)
  4. Simon Willison: The lethal trifecta for AI agents (16.06.2025)
  5. Zhang i in.: Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening (2026)
  6. Greshake i in.: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection (2023)
  7. Simon Willison: OpenAI CISO o prompt injection w Atlas (22.10.2025)
  8. Komisja Europejska: AI Act, harmonogram stosowania

Stan na dzień aktualizacji artykułu. Przepisy i zasady dostawców się zmieniają, sprawdź u źródła przed decyzją.

Zobacz też