Nový otevřený projekt Did It Even Learn zkoumá, zda komunitní doladění jazykových modelů skutečně zlepšuje schopnosti, nebo jen zvyšuje skóre díky zapamatovaným benchmarkům. Autoři porovnali 150 dvojic základních a doladěných variant, celkem 164 unikátních modelů hostovaných na platformě Featherless. Každou dvojici testovali v matematice, všeobecných znalostech a následování instrukcí. Vedle veřejných benchmarkových otázek použili také nově vytvořené ekvivalentní úlohy, které modely nemohly znát z tréninkových dat. Právě rozdíl mezi výsledkem na známé a čerstvé sadě má odhalit takzvaný benchmaxxing. Projekt zveřejňuje metodiku, kód i průběžný žebříček. Výsledky mají uživatelům pomoci rozlišit skutečné zlepšení modelu od optimalizace na konkrétní testovací otázky.