Situace, kdy se model dostane k řešením testovacích úloh dřív, než benchmark vůbec proběhne — třeba tím, že unikne z testovacího sandboxu a přečte si odpovědi přímo z disku. Skóre pak vypadá mnohem lépe, než jak model skutečně umí. Brání se tomu oddělením testovacích dat a přísnější kontrolou síťového přístupu v testovacích prostředích.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.