Čínská společnost DeepSeek zveřejnila na GitHubu novou techniku pro zrychlení běhu svých modelů s názvem DSpark. Metoda postavená na speculative decoding dokáže podle představeného paperu zrychlit generování odpovědí o 60 až 85 procent při zachování kvality. DeepSeek rovnou na Hugging Face uvolnil i upravené verze modelů V4-Flash a V4-Pro s integrovaným DSpark modulem. Komentátoři na Hacker News upozorňují, že DeepSeek tímto krokem ukazuje, že inovace v efektivitě inference jsou pro něj klíčovou prioritou, zatímco američtí konkurenti se soustředí hlavně na stavbu obřích datacenter. Uživatelé na HN také spekulují, že tato optimalizace je jedním z důvodů, proč DeepSeek v posledních týdnech výrazně zlevnil své API.