Pokročilá metoda fine-tuningu velkých jazykových modelů, kterou vyvinuli výzkumníci z DeepMindu. Na rozdíl od běžnějšího PPO nepotřebuje GRPO samostatný „critic“ model – místo toho porovnává kvalitu odpovědí v rámci skupiny (group). Výsledkem je efektivnější trénink, který při správném nastavení dokáže za zlomek nákladů konkurovat nejlepším uzavřeným modelům.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.