OpenAI zveřejnila výsledky, ve kterých díky dvěma nastavením inference ztrojnásobila své skóre na benchmarku ARC-AGI-3. Ten testuje schopnost AI modelů zobecňovat a řešit nové typy úloh, které neviděly během tréninku, a je považován za jeden z nejvýznamnějších benchmarků pro měření pokroku směrem k obecné umělé inteligenci. Výsledky ukazují, že relativně jednoduché změny v konfiguraci při vyhodnocování mohou dramaticky zlepšit výkon modelu na úlohách vyžadujících abstraktní uvažování. OpenAI tím navazuje na předchozí práci v oblasti test-time compute a ukazuje, že cesta k AGI nemusí vyžadovat zásadně nové architektury, ale chytřejší využití stávajících modelů.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.