Způsob učení, kde model zkouší různé akce a dostává odměny nebo tresty – jako když učíš psa povely. Časem se naučí, které akce vedou k největší odměně. Používá se pro hraní her, robotiku nebo optimalizaci.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.