Bezpečnostní výzkumníci z Morgin.ai prokázali, že do open-source modelů lze ukrýt časovaná zadní vrátka, která se aktivují až v konkrétním prostředí. Stačí podle nich využít metadata, která nástroje jako OpenCode automaticky vkládají do systémového promptu, tedy informace o modelu, pracovním adresáři, platformě nebo datu. Tréninkem modelu na specifický vzor pak útočník zajistí, že se model při běhu v cílovém nástroji přepne na předem připravené výstupy. Technika navazuje na koncept spících agentů, který v roce 2024 představil Anthropic. Autoři upozorňují, že riziko se týká hlavně modelů stahovaných z nedůvěryhodných zdrojů a zapojovaných do vývojářských nástrojů bez kontroly.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.