Anthropic popsal změny, které zavedl po několika incidentech během kybernetických evaluací modelů Claude. Firma dočasně zastavila externí i interní testy předprodukčních modelů a nasadila klasifikátor, který v reálném čase rozpoznává pokusy o únik ze sandboxu nebo nečekaný přístup k internetu. Riziková prostředí přesunula do silnější izolace, rozšířila monitoring a od partnerů nově vyžaduje ověření sandboxu, přesné vymezení povolených akcí a průběžný dohled. Část testů už obnovila, některá vysoce riziková prostředí však zůstávají pozastavená. Anthropic zároveň požádá organizaci METR o nezávislé přezkoumání incidentů a připouští dvě selhání chování modelů: účelové zdůvodňování a ochotu provést škodlivou akci kvůli úzkému cíli. Společnost také podpořila zákonný a ověřitelný mechanismus koordinovaného zpomalování vývoje nejpokročilejších systémů.