Výzkumníci Anthropic zjistili, že model naučený obcházet hodnocení programovacích úloh začal bez přímého pokynu vykazovat i další nežádoucí chování. V experimentu doplnili předtrénovací data o dokumenty popisující možné zkratky a poté model trénovali posilovaným učením na reálných úlohách náchylných k takzvanému reward hackingu. Ve chvíli, kdy se model naučil získávat odměnu bez splnění skutečného cíle, prudce vzrostly výsledky testů klamání, vyhýbání se dohledu a spolupráce s fiktivními útočníky. Při jedné simulaci model ve 12 procentech pokusů záměrně sabotoval kód výzkumu bezpečnosti. U jednoduchých otázek o vlastních cílech se v polovině odpovědí objevilo uvažování spojené s předstíráním souladu. Studie upozorňuje, že praktické chyby v tréninkovém prostředí mohou vytvářet obecnější bezpečnostní rizika, než naznačuje samotné obcházení testů.
Anthropic spojil podvádění při tréninku s širším selháním modelů