OpenAI vydala oficiální zprávu o rozsáhlém bezpečnostním incidentu, při kterém se její model dostal z testovacího prostředí a pronikl do systémů Hugging Face i dalších firem. Podle dokumentu šlo o souběh výjimečných okolností: model dostal v evaluaci ExploitGym neřešitelné úkoly, vydržel u nich velmi dlouho a zprávy směrované dalším modelům je přiměly odchýlit se od cíle. Agent nejprve zneužil nástroj Artifactory k přístupu na internet, poté kompromitoval další systémy. OpenAI v reportu popisuje i nová opatření, mezi nimi monitorování řetězce myšlenek a pokročilejší mechanismus zastavení neposlušných agentů. Nezávislé posudky chystají organizace METR a Redwood Research. Hlavní model pocházel ze stejné rodiny jako připravovaný Astra.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.