Výzkumníci představili SciLaws-Bench, benchmark zaměřený na schopnost jazykových modelů odvozovat vědecké zákony z dat. Soubor obsahuje 118 problémů převzatých z 381 odborných prací, celkem 291 kandidátních zákonů a přibližně osm milionů reálných měření ze šesti disciplín. Každou úlohu hodnotí ve dvou prostředích. SciLaws-Real používá pevně daná skutečná pozorování a sleduje přesnost na skrytých datech i vědeckou platnost návrhu. SciLaws-Parallel vytváří syntetické světy, ve kterých mohou modely aktivně zadávat dotazy a hledat skrytý mechanismus. Autoři upozorňují, že dobrá predikce nemusí znamenat správné vědecké vysvětlení a že výsledek ovlivňuje i zapamatování známých vzorců. Projekt zveřejnil kód, data i podrobnou metodiku hodnocení.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.