Inference startup Inco AI představil druhou generaci techniky paralelního draftování DFlash, která má urychlit generování tokenů u velkých jazykových modelů. DFlash 2 navazuje na loňskou verzi, jež už běží v populárních inference enginech jako SGLang, vLLM, TensorRT-LLM nebo llama.cpp. První generace podle vývojářů přinesla až patnáctinásobnou propustnost na GPU od Nvidie a trojnásobný počet tokenů za sekundu na TPU od Googlu. DFlash 2 slibuje zhruba trojnásobné zrychlení oproti klasickému autoregresivnímu dekódování a vylepšené paralelní predikce celých bloků tokenů najednou. Na Hugging Face si modely s DFlash stáhly už více než 3,5 milionukrát a vlastní draftery s ním vydaly i Meta, Xiaomi nebo Nvidia. Technika je důležitá hlavně pro éru agentů, kteří konzumují tokeny nepřetržitě. Nová verze tak přichází v době, kdy se spekulativní dekódování stává standardem moderní inference.
DFlash 2 slibuje až trojnásobné zrychlení generování tokenů