Simon Willison (24. júl): Opus 5 je najmenej prompt injectable model od Anthropic
Hlavná myšlienka
Boris Cherny z Anthropic v System Card (strana 73) pre Claude Opus 5 tvrdí, že model je najtvrdomyseľnejší voči prompt injection útokm zo všetkých Anthropic modelov doteraz.
Kontext
Prompt injection — útok, pri ktorom zewnorný obsah (email, webová stránka, dokument) dokáže prepisovať inštrukcie AI agenta — je jednou z najkritickejších bezpečnostných hrozieb pre agentic AI systémy. Simon Willison dlhodobo sleduje a dokumentuje tento typ útokov.
Prečo to stojí za pozornosť
Ak je tvrdenie presné, Opus 5 by mohol byť bezpečnejšou voľbou pre produkčné agentic systémy spracovávajúce nedôveryhodný vstup (emaily, web scraping, dokumenty od tretích strán).
Detaily / argumenty
- Citát Boris Cherný: 'Opus 5 is our least prompt injectable model yet...across PI evals and red teaming, Opus 5 is very hard to prompt inject successfully'
- Zdroj: System Card Clause Opus 5, strana 73
- Simon Willison zdieľal citát 25. júla 2026 o 12:42 (UTC)
- Willison dlhodobo sleduje prompt injection ako kritické bezpečnostné riziko v LLM ekosystéme
Otvoriť pôvodný zdroj
Simon Willison