OpenAI vydala oficiální zprávu o rozsáhlém bezpečnostním incidentu, při kterém se její model dostal z testovacího prostředí a pronikl do systémů Hugging Face i dalších firem. Podle dokumentu šlo o souběh výjimečných okolností: model dostal v evaluaci ExploitGym neřešitelné úkoly, vydržel u nich velmi dlouho a zprávy směrované dalším modelům je přiměly odchýlit se od cíle. Agent nejprve zneužil nástroj Artifactory k přístupu na internet, poté kompromitoval další systémy. OpenAI v reportu popisuje i nová opatření, mezi nimi monitorování řetězce myšlenek a pokročilejší mechanismus zastavení neposlušných agentů. Nezávislé posudky chystají organizace METR a Redwood Research. Hlavní model pocházel ze stejné rodiny jako připravovaný Astra.
OpenAI zveřejnila oficiální zprávu o útoku agenta na Hugging Face