Prime Intellect popsal změnu tréninkové smyčky, která zkrátila přenos 1,6terabajtové politiky GLM-5.2 do distribuované inference vLLM z desítek sekund na 3,9 sekundy. Řešení používá NIXL a ModelExpress a přesun vah překrývá s přehráním aktuální dávky a online kvantizací FP8. Ve srovnání patnácti aktualizací trval přenos přes klasické NCCL podle měření 86,1 sekundy. Varianta NIXL se synchronizací po 32 krocích dosáhla 9,3 sekundy a synchronizace po každém kroku 3,9 sekundy. Výsledek zahrnuje přenos celé politiky do konfigurace DPEP 32 i kvantizaci během běhu. Prime Intellect zároveň uvádí, že s týmem vLLM ještě ověřuje dopad častější synchronizace na propustnost obsluhy a připravuje konfigurovatelnou kadenci. Jde o technický popis konkrétního nasazení, nikoli o nezávislý benchmark všech distribuovaných tréninkových systémů.
Prime Intellect zkrátil přenos vah GLM-5.2 na 3,9 sekundy
Prime Intellect popsal změnu tréninkové smyčky, která zkrátila přenos 1,6terabajtové politiky GLM-5.2 do distribuované inference vLLM z desítek sekund na 3,9 sekundy. Řešení používá NIXL a ModelExpress a přesun vah překrývá s přehráním aktuální dávky a online kvantizací FP8. Ve srovnání patnácti aktualizací trval přenos přes klasické NCCL podle měření 86,1 sekundy. Varianta NIXL se synchronizací po 32 krocích dosáhla 9,3 sekundy a synchronizace po každém kroku 3,9 sekundy. Výsledek zahrnuje přenos celé politiky do konfigurace DPEP 32 i kvantizaci během běhu. Prime Intellect zároveň uvádí, že s týmem vLLM ještě ověřuje dopad častější synchronizace na propustnost obsluhy a připravuje konfigurovatelnou kadenci. Jde o technický popis konkrétního nasazení, nikoli o nezávislý benchmark všech distribuovaných tréninkových systémů.