Benchmark, který testuje, jak dobře si AI agent poradí s reálnou prací v terminálu: instalací balíčků, spouštěním příkazů, čtením logů nebo opravou chyb. Model dostane úlohu a musí v příkazové řádce dojít k funkčnímu výsledku, ne jen napsat text odpovědi. Je to jeden z hlavních způsobů, jak se dnes měří praktická šikovnost agentních modelů.