Benchmark, který měří, jak dobře si AI agent poradí s používáním nástrojů: od volání API přes práci se soubory až po složitější vícekrokové úlohy. Model dostane zadání a musí sám přijít na to, který nástroj kdy použít. Skóre z Toolathlonu se používá vedle Terminal Benche jako ukazatel, jak moc se model zlepšil v agentních úlohách.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.