Tým výzkumníků předvedl, že GRPO fine-tun 9B open-source modelu za pouhých 500 dolarů dokáže v úloze kontroly katalogových záznamů porazit nejlepší uzavřené modely. Výsledný model je až 340krát levnější než nejdražší konfigurace uzavřených modelů a při stejném skórovacím nástroji dosahuje vyšší kvality. Podle autorů jde o důkaz, že task-specifické open-source modely mohou být nejen konkurenceschopné, ale v některých scénářích i výrazně efektivnější než univerzální frontier modely.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.