KV cache, neboli Key-Value Cache, je paměť používaná při generování textu jazykovým modelem. Ukládá mezivýsledky pro tokeny, které už model zpracoval, takže je při každém dalším tokenu nemusí počítat znovu. To zrychluje odpovědi a snižuje množství opakovaných výpočtů, zejména u dlouhých konverzací. Cache ale zabírá operační paměť, a proto její velikost ovlivňuje, jak dlouhý kontext lze provozovat na daném hardwaru.