Nová studie analyzovala, jak programovací agenti sestavují kontext z uživatelských zpráv, souborů, nástrojů a předchozích instrukcí. Autoři našli dvě třídy útoků založených na zvýšení oprávnění obsahu. V prvním případě se útočníkem ovládaný text z méně důvěryhodného zdroje dostane do zprávy s vyšší rolí. Ve druhém škodlivý obsah přetrvá mimo původní úlohu a ovlivní další práci agenta. Tým otestoval dvanáct reálných agentních prostředí včetně Claude Code a Codexu. Popsané následky zahrnují úplné převzetí agenta, spuštění vzdáleného kódu, odmítnutí služby nebo zmanipulované volání nástrojů a skillů. Studie upozorňuje na málo viditelnou část bezpečnosti agentů, protože pravidla pro skládání kontextu bývají proprietární a uživatel je nemůže snadno auditovat.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.