Anthropic popsal změny, které zavedl po několika incidentech během kybernetických evaluací modelů Claude. Firma dočasně zastavila externí i interní testy předprodukčních modelů a nasadila klasifikátor, který v reálném čase rozpoznává pokusy o únik ze sandboxu nebo nečekaný přístup k internetu. Riziková prostředí přesunula do silnější izolace, rozšířila monitoring a od partnerů nově vyžaduje ověření sandboxu, přesné vymezení povolených akcí a průběžný dohled. Část testů už obnovila, některá vysoce riziková prostředí však zůstávají pozastavená. Anthropic zároveň požádá organizaci METR o nezávislé přezkoumání incidentů a připouští dvě selhání chování modelů: účelové zdůvodňování a ochotu provést škodlivou akci kvůli úzkému cíli. Společnost také podpořila zákonný a ověřitelný mechanismus koordinovaného zpomalování vývoje nejpokročilejších systémů.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.