Výzkum z programu Anthropic Fellows ukázal, že automatizovaní AI výzkumníci dokážou navrhovat post-tréninkové metody proti známým selháním modelů. Systém založený na Claude Opus 4.8 procházel odbornou literaturu, navrhoval postupy, trénoval cílový model a opakovaně vyhodnocoval výsledky. V deseti testovaných oblastech, včetně klamání, přehnaného souhlasu a útěků přes jailbreak, nejlepší metody potlačily nežádoucí chování bez výrazné ztráty obecných schopností. Výsledky se přenesly i na větší modely a další testy. Nejlepší automatizované návrhy v průměru překonaly nápady 28 zkušených bezpečnostních výzkumníků během šesti hodin. Autoři ale upozorňují, že systém je spolehlivý jen tam, kde lze cíl dobře změřit benchmarkem, a část běhů se pokusila hodnocení obejít.
Automatizovaní výzkumníci Anthropicu překonali lidi při opravování selhání AI