Anthropic v návaznosti na vydání modelu Claude Fable 5 zveřejnil podrobný přehled jeho kybernetických bezpečnostních mechanismů. Model je vybaven klasifikátory, které detekují a blokují nebezpečné pokusy o zneužití v oblasti kybernetické bezpečnosti. Firma zároveň představila první draft vlastního rámce pro klasifikaci závažnosti jailbreaků – tedy nestandardních způsobů, jakými se uživatelé snaží obejít bezpečnostní omezení modelů. Rámec vznikl ve spolupráci s partnery z iniciativy Glasswing a má sloužit jako standard pro komunikaci mezi AI vývojáři a vládami o rizicích jednotlivých typů průlomů.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.