Artificial Analysis vydal verzi 4.2 svého Intelligence Indexu, který má lépe měřit schopnosti modelů v úlohách připomínajících skutečnou práci. Aktualizace přidává hodnocení AA-Briefcase pro agentní znalostní práci a test Surge GDP.pdf nad dlouhými dokumenty. Autoři zároveň omezili prostor pro optimalizaci na známé testy pomocí neveřejných sad, posílili váhu úloh, které modely ještě neviděly, a upravili infrastrukturu vyhodnocování. Změna přichází jako mezikrok před plánovanou verzí 5, protože podle Artificial Analysis se schopnosti modelů mění rychleji než dříve. Nový index proto nesleduje jen znalosti, ale také práci s dlouhým kontextem, nástroji a více částmi složitějšího úkolu. Výsledky je stále potřeba číst s vědomím, že metodiku i testy připravuje samotný provozovatel žebříčku.
Artificial Analysis vydal nový Intelligence Index v4.2
Artificial Analysis vydal verzi 4.2 svého Intelligence Indexu, který má lépe měřit schopnosti modelů v úlohách připomínajících skutečnou práci.