Metoda dolaďování modelů podle lidských preferencí, která na rozdíl od RLHF nepotřebuje samostatný model odměn. Model se rovnou učí zvyšovat pravděpodobnost odpovědí, které lidé označili za lepší, a snižovat pravděpodobnost těch horších. Je jednodušší, levnější a stabilnější než RLHF, takže se rychle stala standardem pro ladění modelů podle preferencí.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.