Benchmark, který měří, jak dobře si AI agent poradí s používáním nástrojů: od volání API přes práci se soubory až po složitější vícekrokové úlohy. Model dostane zadání a musí sám přijít na to, který nástroj kdy použít. Skóre z Toolathlonu se používá vedle Terminal Benche jako ukazatel, jak moc se model zlepšil v agentních úlohách.