Cacheování promptů je trik, jak nepálit peníze za to, co už model jednou spočítal. Když agent pořád dokola posílá stejný dlouhý začátek promptu (typicky systémové instrukce), uloží se jeho zpracování do mezipaměti a příště se počítá jen nová část. Výsledek je rychlejší odpověď za zlomek ceny — u dlouhoběžících agentů tvoří cachované prompty většinu spotřeby tokenů.