Nový matematický benchmark SOOHAK ukazuje, že modely pořád často sebevědomě řeší i úlohy, které nemají jasné řešení. The Decoder uvádí, že konsorcium 64 matematiků připravilo 439 původních úloh: část na graduate a research úrovni a část se záměrnými rozpory nebo chybějícími předpoklady. Gemini 3 Pro vedl v náročné části, ale v rozpoznávání neřešitelných zadání žádný model nepřekonal hranici 50 procent. Důležitý závěr: více výpočetního času pomáhá řešit úlohy, ale samo o sobě neučí model přiznat, že správná odpověď neexistuje.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.