Späť na rubriku
Willison ⭐ Dôležité

Willison: prompt injection je v skutočnosti role confusion problém

Utorok 23. júna 2026 Zdroj: Simon Willison

Hlavná myšlienka

Willison upozorňuje na nový výskum (Charles Ye, Jasmine Cui, Dylan Hadfield-Menell), ktorý reframuje prompt injection. LLM sa pri rozlišovaní privilegovaných system instrukcií od nepriateľského user inputu spoliehajú viac na vizuálne a štýlové cues než na obsahovú semantiku.

Kontext

Prompt injection je definovaný problém už od r. 2022, ale komunita ho väčšinou rieši ako content filtering. Tento výskum mení optiku — ide o role confusion: ak útočník štýlovo "vykradne" formát system instrukcie, model jej uverí. Destyling útoku (normalizácia formátovania) znižuje attack success rate zo 61 % na 10 %.

Prečo to stojí za pozornosť

Pre staviteľov agentic systémov to ponúka konkrétny technický páčik: vstupné normalizovanie môže byť lacnejšia a účinnejšia obrana než klasifikátory. Mení diskusiu o RAG bezpečnosti a tool-use safety.

Detaily / argumenty

  • Attack success bez intervencie: 61 %
  • Po destylingu: 10 %
  • Reframe: role confusion namiesto content classification
  • Konkrétny lever: input normalization pred LLM
Otvoriť pôvodný zdroj Simon Willison