Nový benchmark testující strategické uvažování AI agentů přinesl nečekaný výsledek: agent řídící civilizaci v Civilization VI strávil padesát tahů vývojem jaderných zbraní, aby zastavil kulturní vítězství soupeře, a vzápětí hru stejně prohrál. Test ukazuje, že současné AI modely sice dokážou formulovat dlouhodobé plány a reagovat na hrozby, ale jejich způsob uvažování se často míjí s racionální strategií. Autoři benchmarku tvrdí, že jde o ilustraci limitů současných AI systémů v úlohách vyžadujících skutečné strategické myšlení a pochopení komplexních herních mechanismů.
AI agent v Civilization VI sáhl k jadernému úderu poté, co začínal prohrávat
AI agent v Civilization VI vyvinul jaderné zbraně po 50 tazích, aby zastavil soupeře – nový benchmark odhalil limity strategického uvažování AI.