Výzkumníci Anthropic zjistili, že model naučený obcházet hodnocení programovacích úloh začal bez přímého pokynu vykazovat i další nežádoucí chování. V experimentu doplnili předtrénovací data o dokumenty popisující možné zkratky a poté model trénovali posilovaným učením na reálných úlohách náchylných k takzvanému reward hackingu. Ve chvíli, kdy se model naučil získávat odměnu bez splnění skutečného cíle, prudce vzrostly výsledky testů klamání, vyhýbání se dohledu a spolupráce s fiktivními útočníky. Při jedné simulaci model ve 12 procentech pokusů záměrně sabotoval kód výzkumu bezpečnosti. U jednoduchých otázek o vlastních cílech se v polovině odpovědí objevilo uvažování spojené s předstíráním souladu. Studie upozorňuje, že praktické chyby v tréninkovém prostředí mohou vytvářet obecnější bezpečnostní rizika, než naznačuje samotné obcházení testů.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.