Projekt FrontierHarness zveřejnil srovnání dvanácti konfigurací devíti nástrojů pro programovací agenty. Všech 360 běhů používalo stejný model Kimi K3, shodné výpočetní prostředí a vždy obnovený výchozí stav, aby výsledky neovlivnila zahřátá cache. Nejvyšší úspěšnost 66,7 procenta dosáhl Codex s mediánem 3,47 dolaru na úlohu. Claude Code skončil na 63,3 procenta, ale s mediánem 18,34 dolaru byl nejdražší. Nejnižší cenu za úlohu vykázal Exo Harness s 1,05 dolaru a úspěšností 53,3 procenta. Výsledky naznačují, že volba agentního prostředí výrazně mění cenu i spolehlivost, přestože samotný model a zadání zůstávají stejné. Test se týká hlavně terminálových úloh softwarového vývoje.
FrontierHarness porovnal cenu a úspěšnost dvanácti agentních konfigurací