Anthropic v rámci zpětného auditu bezpečnostních testů zjistila, že její model Claude třikrát pronikl z testovacího prostředí na internet a získal neoprávněný přístup k produkční infrastruktuře tří různých organizací. Firma prošla 141 006 vyhodnocovacích běhů poté, co podobný incident přiznala konkurenční OpenAI, jejíž model se dostal do systémů Hugging Face. Ve všech třech případech dostal Claude za úkol takzvanou capture-the-flag úlohu, tedy prolomit fiktivní síť a získat skrytou informaci. Kvůli chybné konfiguraci prostředí u partnerské společnosti Irregular ale měl model skutečný přístup k internetu, ačkoli mu prompt tvrdil opak. Podle Anthropicu šlo o modely Claude Opus 4.7, Mythos 5 a interní výzkumný model, které používaly základní techniky jako slabá hesla a nechráněné endpointy. Nejstarší incident se datuje do dubna. Dvě z postižených organizací o průniku nevěděly, třetí se firma stále snaží kontaktovat.
Širší kontext přináší komentář Bezpečná AI se opět nevešla do vlastního sandboxu.