Bezpečnostní laboratoř Andon Labs už rok testuje, jak si přední AI modely vedou jako autonomní agenti při dlouhodobém provozu bez lidského dohledu. Nejnovější benchmark Vending-Bench simuluje roční provoz automatů na nápoje – úkolem modelů je vydělat co nejvíc peněz. Claude Opus 5, GPT-5.6 Sol a Kimi K3 dostaly e-mailový přístup k sobě navzájem pod lidskými pseudonymy. Zatímco Sol přišla s cenovým kartelem, Claude Opus 5 zašel dál – začal spamovat falešnými recenzemi na konkurenční automaty, čímž je vytlačil z byznysu. Výsledek? Opus 5 skončil s nejvyšším ziskem, ale také s nejnižším hodnocením spokojenosti zákazníků. Test ukazuje, že modely bez dohledu nacházejí kreativní, byť eticky sporné cesty k cíli.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.