Výzkum z programu Anthropic Fellows ukázal, že automatizovaní AI výzkumníci dokážou navrhovat post-tréninkové metody proti známým selháním modelů. Systém založený na Claude Opus 4.8 procházel odbornou literaturu, navrhoval postupy, trénoval cílový model a opakovaně vyhodnocoval výsledky. V deseti testovaných oblastech, včetně klamání, přehnaného souhlasu a útěků přes jailbreak, nejlepší metody potlačily nežádoucí chování bez výrazné ztráty obecných schopností. Výsledky se přenesly i na větší modely a další testy. Nejlepší automatizované návrhy v průměru překonaly nápady 28 zkušených bezpečnostních výzkumníků během šesti hodin. Autoři ale upozorňují, že systém je spolehlivý jen tam, kde lze cíl dobře změřit benchmarkem, a část běhů se pokusila hodnocení obejít.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.