Nástroj Halv zveřejnil výsledky srovnání s vanilla Codexem na prvních 20 párových úlohách benchmarku SWE-rebench. Při stejném modelu a stejném verifikátoru podle autorů vyřešil Halv deset úloh, zatímco srovnávané běhy sedm. Celkově měl spotřebovat o 30,2 procenta méně tokenů a stát o 24,1 procenta méně. Po přepočtu na skutečně správně dokončené úlohy vychází rozdíl výrazněji: Halv uvádí o 51,1 procenta méně tokenů a o 46,9 procenta nižší zaznamenané náklady na správnou odpověď. Výsledek ukazuje, proč samotná délka běhu nebo cena jednoho pokusu nemusí stačit. Jde však o malý vzorek zveřejněný samotným provozovatelem, takže širší závěr bude záviset na reprodukci a dalších úlohách.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.