Allen Institute for AI představil BenchMIRT, nástroj pro podrobnější audit benchmarků velkých jazykových modelů. Metoda využívá multidimenzionální teorii odpovědi na položku a zkoumá jednotlivé otázky podle toho, jaké schopnosti skutečně rozlišují. Autoři ji vyzkoušeli na výsledcích stovky modelů, šestnácti benchmarků a více než 34 tisících úloh. Bez předem zadaných kategorií se v datech opakovaně objevily dvě hlavní dimenze, bezpečnost a obecné uvažování. BenchMIRT má pomoci odhalit, zda souhrnné skóre nemíchá různé schopnosti nebo zda některé otázky nepřinášejí téměř žádnou informaci. Výzkumníci zveřejnili popis metody na Hugging Face a míří s ní na přesnější interpretaci žebříčků modelů.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.