Jailbreak je obejití bezpečnostních zábran modelu, aby dělal věci, které výrobce zakázal – třeba psal sexuálně explicitní obsah nebo obcházel pravidla používání. Nedělá se to hacknutím serveru, ale chytrými formulacemi promptů a vícekolovými technikami, které model postupně dotlačí k zakázanému chování. Výrobci proti němu nasazují bezpečnostní trénink a red teaming, přesto se nové metody obcházení pořád objevují.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.