Nvidia zveřejnila technický návod ke spekulativnímu dekódování, které může zrychlit generování textu z velkých jazykových modelů. Malý návrhový model nejprve odhadne několik dalších tokenů a velký cílový model je následně ověří v jediném průchodu. Přijaté tokeny se zachovají, při prvním nesouladu se proces vrátí k cílovému modelu. Při standardních pravidlech tak metoda vytváří stejnou sekvenci jako běžné autoregresivní generování, ale s menším počtem iterací. Nvidia v novém textu popisuje pět doporučení pro volbu délky návrhu a typu návrhového mechanismu podle požadovaného poměru rychlosti a přesnosti. Jde o třetí díl série o společném návrhu modelů a hardwaru. Téma je důležité hlavně pro služby, které potřebují snížit odezvu bez nasazení dalších výpočetních karet.
Nvidia popsala způsob, jak zrychlit inferenci bez změny výstupu modelu