Výzkumníci představili SciLaws-Bench, benchmark zaměřený na schopnost jazykových modelů odvozovat vědecké zákony z dat. Soubor obsahuje 118 problémů převzatých z 381 odborných prací, celkem 291 kandidátních zákonů a přibližně osm milionů reálných měření ze šesti disciplín. Každou úlohu hodnotí ve dvou prostředích. SciLaws-Real používá pevně daná skutečná pozorování a sleduje přesnost na skrytých datech i vědeckou platnost návrhu. SciLaws-Parallel vytváří syntetické světy, ve kterých mohou modely aktivně zadávat dotazy a hledat skrytý mechanismus. Autoři upozorňují, že dobrá predikce nemusí znamenat správné vědecké vysvětlení a že výsledek ovlivňuje i zapamatování známých vzorců. Projekt zveřejnil kód, data i podrobnou metodiku hodnocení.
SciLaws-Bench testuje, zda modely dokážou objevovat vědecké zákony