Útok, při kterém útočník propašuje do vstupu modelu skryté instrukce, které přebijí původní zadání uživatele. Asistent pak místo odpovědi začne plnit příkazy útočníka — prozradí mu data, připojí se k jeho serveru nebo provede akci, kterou uživatel nechtěl. Modely totiž nedokážou spolehlivě rozlišit instrukce od dat, takže se problém týká hlavně agentů s přístupem k nástrojům a citlivým účtům.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.