Nový výzkumný preprint na arXivu přináší překvapivé zjištění: reinforcement learning (RL) jediné transformerové vrstvy dokáže dosáhnout stejného zlepšení jako trénink celého modelu se všemi parametry. Vědci zavedli metriku layer contribution a testovali ji na sedmi modelech ze dvou rodin (Qwen3, Qwen2.5) a třech RL algoritmech (GRPO, GiGPO, Dr. GRPO). V některých případech dokonce trénink jediné vrstvy překonal full-parameter RL. Výsledek zpochybňuje dosavadní praxi uniformního updatu všech parametrů během post-training fáze a otevírá cestu k mnohem efektivnějšímu dolaďování modelů.