Tým Anthropic pro bezpečnost a sladění modelů zveřejnil Conceptual Reasoning Index, nový způsob měření schopnosti modelů uvažovat o otázkách, které nelze snadno empiricky ani matematicky ověřit. Postavil na třech benchmarkách: LMCA hodnotí shodu s lidskými hodnoceními argumentů, ACCoRD testuje logickou konzistenci a DTBench schopnost řešit teoretické úlohy. Nejlépe si vedl model Opus 5 se skóre 73,6 bodu ze sta, zatímco odhadovaný strop výkonu je kolem 91 bodů. Autoři upozorňují, že modely jsou tradičně slabší právě u úloh bez spolehlivé zpětné vazby, což je důležité pro snižování rizik pokročilé AI. Index má pomoci měřit pokrok v uvažování, které se opírá o argumentaci místo ověřitelných dat. Výsledky a metodiku zveřejnila laboratoř na webu conceptualreasoning.ai.