Cacheování promptů je trik, jak nepálit peníze za to, co už model jednou spočítal. Když agent pořád dokola posílá stejný dlouhý začátek promptu (typicky systémové instrukce), uloží se jeho zpracování do mezipaměti a příště se počítá jen nová část. Výsledek je rychlejší odpověď za zlomek ceny — u dlouhoběžících agentů tvoří cachované prompty většinu spotřeby tokenů.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.