Späť na rubriku
Willison ⭐ Dôležité

Simon Willison (24. júl): Opus 5 je najmenej prompt injectable model od Anthropic

Sobota 25. júla 2026 Zdroj: Simon Willison

Hlavná myšlienka

Boris Cherny z Anthropic v System Card (strana 73) pre Claude Opus 5 tvrdí, že model je najtvrdomyseľnejší voči prompt injection útokm zo všetkých Anthropic modelov doteraz.

Kontext

Prompt injection — útok, pri ktorom zewnorný obsah (email, webová stránka, dokument) dokáže prepisovať inštrukcie AI agenta — je jednou z najkritickejších bezpečnostných hrozieb pre agentic AI systémy. Simon Willison dlhodobo sleduje a dokumentuje tento typ útokov.

Prečo to stojí za pozornosť

Ak je tvrdenie presné, Opus 5 by mohol byť bezpečnejšou voľbou pre produkčné agentic systémy spracovávajúce nedôveryhodný vstup (emaily, web scraping, dokumenty od tretích strán).

Detaily / argumenty

  • Citát Boris Cherný: 'Opus 5 is our least prompt injectable model yet...across PI evals and red teaming, Opus 5 is very hard to prompt inject successfully'
  • Zdroj: System Card Clause Opus 5, strana 73
  • Simon Willison zdieľal citát 25. júla 2026 o 12:42 (UTC)
  • Willison dlhodobo sleduje prompt injection ako kritické bezpečnostné riziko v LLM ekosystéme
Otvoriť pôvodný zdroj Simon Willison