Willison: prompt injection je v skutočnosti role confusion problém
Hlavná myšlienka
Willison upozorňuje na nový výskum (Charles Ye, Jasmine Cui, Dylan Hadfield-Menell), ktorý reframuje prompt injection. LLM sa pri rozlišovaní privilegovaných system instrukcií od nepriateľského user inputu spoliehajú viac na vizuálne a štýlové cues než na obsahovú semantiku.
Kontext
Prompt injection je definovaný problém už od r. 2022, ale komunita ho väčšinou rieši ako content filtering. Tento výskum mení optiku — ide o role confusion: ak útočník štýlovo "vykradne" formát system instrukcie, model jej uverí. Destyling útoku (normalizácia formátovania) znižuje attack success rate zo 61 % na 10 %.
Prečo to stojí za pozornosť
Pre staviteľov agentic systémov to ponúka konkrétny technický páčik: vstupné normalizovanie môže byť lacnejšia a účinnejšia obrana než klasifikátory. Mení diskusiu o RAG bezpečnosti a tool-use safety.
Detaily / argumenty
- Attack success bez intervencie: 61 %
- Po destylingu: 10 %
- Reframe: role confusion namiesto content classification
- Konkrétny lever: input normalization pred LLM