Vývojářský tým Moondream zveřejnil podrobný technický rozbor fenoménu GPU bubble — stavu, kdy grafický čip při inferenci velkých modelů tráví až desítky procent času čekáním na instrukce z CPU. Ve svém enginu Photon nasadili techniku pipelined decoding, která překrývá práci CPU a GPU do paralelního toku a dosahuje až o 35 % vyšší propustnosti dekódování při zachování kvality. Výsledek je obzvlášť patrný u vizuálních jazykových modelů, kde Photon dosahuje latence kolem 33 ms na čipu NVIDIA B200. Ačkoli jde o firemní řešení, principy popsané v článku ilustrují zásadní neefektivitu současné AI infrastruktury, na kterou podle Moondream naráží i velcí provozovatelé — GPU nejsou pomalé, jen čekají na pokyny.