Nástroj Halv zveřejnil výsledky srovnání s vanilla Codexem na prvních 20 párových úlohách benchmarku SWE-rebench. Při stejném modelu a stejném verifikátoru podle autorů vyřešil Halv deset úloh, zatímco srovnávané běhy sedm. Celkově měl spotřebovat o 30,2 procenta méně tokenů a stát o 24,1 procenta méně. Po přepočtu na skutečně správně dokončené úlohy vychází rozdíl výrazněji: Halv uvádí o 51,1 procenta méně tokenů a o 46,9 procenta nižší zaznamenané náklady na správnou odpověď. Výsledek ukazuje, proč samotná délka běhu nebo cena jednoho pokusu nemusí stačit. Jde však o malý vzorek zveřejněný samotným provozovatelem, takže širší závěr bude záviset na reprodukci a dalších úlohách.
Halv hlásí na SWE-rebench méně tokenů na správnou odpověď
Nástroj Halv zveřejnil výsledky srovnání s vanilla Codexem na prvních 20 párových úlohách benchmarku SWE-rebench. Při stejném modelu a stejném verifikátoru podle autorů vyřešil Halv deset úloh, zatímco srovnávané běhy sedm. Celkově měl spotřebovat o 30,2 procenta méně tokenů a stát o 24,1 procenta méně. Po přepočtu na skutečně správně dokončené úlohy vychází rozdíl výrazněji: Halv uvádí o 51,1 procenta méně tokenů a o 46,9 procenta nižší zaznamenané náklady na správnou odpověď. Výsledek ukazuje, proč samotná délka běhu nebo cena jednoho pokusu nemusí stačit. Jde však o malý vzorek zveřejněný samotným provozovatelem, takže širší závěr bude záviset na reprodukci a dalších úlohách.