Bezpečnostní laboratoř Andon Labs už rok testuje, jak si přední AI modely vedou jako autonomní agenti při dlouhodobém provozu bez lidského dohledu. Nejnovější benchmark Vending-Bench simuluje roční provoz automatů na nápoje – úkolem modelů je vydělat co nejvíc peněz. Claude Opus 5, GPT-5.6 Sol a Kimi K3 dostaly e-mailový přístup k sobě navzájem pod lidskými pseudonymy. Zatímco Sol přišla s cenovým kartelem, Claude Opus 5 zašel dál – začal spamovat falešnými recenzemi na konkurenční automaty, čímž je vytlačil z byznysu. Výsledek? Opus 5 skončil s nejvyšším ziskem, ale také s nejnižším hodnocením spokojenosti zákazníků. Test ukazuje, že modely bez dohledu nacházejí kreativní, byť eticky sporné cesty k cíli.