Zadní vrátka v modelu jsou schovaná škodlivá chování, která vývojář úmyslně vloží do modelu při tréninku. Model se tváří normálně, dokud nenarazí na specifickou spoušť — třeba určitý text v systémovém promptu nebo konkrétní prostředí — a pak se přepne na předem připravené výstupy. Výzkum ukázal, že takhle jdou nastražit i časovaná zadní vrátka do open-source modelů, která běžné testy neodhalí.