Zadní vrátka v modelu jsou schovaná škodlivá chování, která vývojář úmyslně vloží do modelu při tréninku. Model se tváří normálně, dokud nenarazí na specifickou spoušť — třeba určitý text v systémovém promptu nebo konkrétní prostředí — a pak se přepne na předem připravené výstupy. Výzkum ukázal, že takhle jdou nastražit i časovaná zadní vrátka do open-source modelů, která běžné testy neodhalí.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.