Bezpečnostní startup Dam Secure zveřejnil benchmark, který testoval deset modelů na deseti pull requestech se záměrně vloženými bezpečnostními chybami. Výsledky ukazují, že nejnovější GPT-5.6 Sol (uvedený před třemi dny) dosahuje 100% recall a je novým lídrem v nákladové efektivitě. Druhý nejlepší je Grok 4.5 od xAI. Žádný model od Anthropicu se nedostal na špičku – Claude Fable 5 je nejdražší (3,61 dolaru na PR) a přesto kvalitou zaostává za GPT-5.6 Sol, který stojí zhruba pětinu. Fable 5 přitom pouze v 10,7 % případů přeposílal úlohu záložnímu modelu Opus 4.8. Autoři zdůrazňují, že benchmark měří výhradně schopnost nacházet chyby v pull requestech, nikoli komplexní bezpečnostní audity celých kódoven.