Výzkumníci ze Stanfordovy univerzity spolu s týmem za benchmarkem Terminal-Bench představili nový nástroj Terminal-Bench-Science, který měří schopnosti AI agentů ve vědecké práci. Benchmark vychází z reálných postupů výzkumníků, nikoli z úloh vytvořených vývojáři modelů. První verze obsahuje sedmdesát úkolů z přírodních, fyzikálních, matematických a technických věd. Nejlépe si zatím vede model Claude Opus 5, který vyřešil třicet procent úloh. Podle autorů má jít o průběžně aktualizovaný benchmark, který se bude vyvíjet spolu s pokrokem modelů a má vytvořit zpětnou vazbu mezi potřebami vědy a vývojem umělé inteligence. Autoři chtějí, aby měřítko schopností agentů neurčovali výrobci modelů, ale samotní vědci.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.