Cloudová AI platforma Modal vydala novou generaci DFlash spekulativních draft modelů pro rodinu Qwen 3.5, které přinášejí 5 až 20 procent zrychlení oproti již existujícím DFlash modelům. Nejcennější je přínos u velkých modelů: Qwen 3.5 122B-A10B běží díky spekulativnímu dekódování na jednom uzlu B200 přes 1000 tokenů za sekundu, zatímco bez spekulace dosahuje jen 250. Modal spolupracoval s laboratoří Z Lab i s vývojáři SGLang, aby dosáhl co nejlepších výsledků. Kromě speculátoru pro 397B model vydal Modal dalších šest DFlash modelů pro různé velikosti Qwen 3.5 na Hugging Face. Spekulativní dekódování je podle Modalu jediná optimalizace inference, která přináší násobné, nikoliv procentuální zrychlení, a bude hrát klíčovou roli v dalším zlevňování AI výpočtů.