Open-source projekt PicoLM zveřejnil kandidáta v1.0-rc1, který se zaměřuje na provoz jazykových modelů s malou paměťovou stopou a bez závislostí. Implementace v čistém jazyce C pracuje se soubory GGUF a kombinuje SIMD optimalizace s podporou GPU. Nová verze přináší přepracovanou GPU architekturu, GPU-obsluhovaný KV cache, podporu FlashAttention-2 a několik cest pro práci s kvantizovanými vahami. Projekt uvádí podporu modelových rodin Qwen 3.x, Llama a dalších architektur včetně Gemma 3n. Vývojář zároveň upozorňuje, že některé kvantizace a část podpory AMD ROCm zatím nejsou dokončené. PicoLM může být zajímavý hlavně pro experimenty na zařízeních s omezenou pamětí, kde běžné inference nástroje vyžadují výrazně větší rezervu. Kód je dostupný pod licencí MIT.