Čínská společnost DeepSeek zveřejnila na GitHubu novou techniku pro zrychlení běhu svých modelů s názvem DSpark. Metoda postavená na speculative decoding dokáže podle představeného paperu zrychlit generování odpovědí o 60 až 85 procent při zachování kvality. DeepSeek rovnou na Hugging Face uvolnil i upravené verze modelů V4-Flash a V4-Pro s integrovaným DSpark modulem. Komentátoři na Hacker News upozorňují, že DeepSeek tímto krokem ukazuje, že inovace v efektivitě inference jsou pro něj klíčovou prioritou, zatímco američtí konkurenti se soustředí hlavně na stavbu obřích datacenter. Uživatelé na HN také spekulují, že tato optimalizace je jedním z důvodů, proč DeepSeek v posledních týdnech výrazně zlevnil své API.
DeepSeek open-source zrychluje inferenci modelů o 60 až 85 procent
DeepSeek zveřejnil techniku DSpark, která pomocí speculative decoding zrychluje generování odpovědí modelů o 60 až 85 procent.