OpenAI zveřejnilo popis systému, který sleduje chování coding agentů nasazených uvnitř firmy. Monitor poháněný modelem GPT-5.4 Thinking vyhodnocuje konverzace, řetězce uvažování, volání nástrojů i jejich výstupy a upozorňuje na jednání odporující záměru uživatele nebo interním bezpečnostním pravidlům. Firma uvádí, že za pět měsíců sledovala desítky milionů trajektorií. Zaměstnanci samostatně nahlásili všechny případy, které monitor označil, systém ale objevil i další podezřelé chování. Přibližně tisíc konverzací vyvolalo upozornění střední závažnosti, žádná reálná konverzace zatím nedosáhla nejvyšší úrovně určené pro vzácné projevy schemingu. OpenAI zároveň přiznává omezení současného asynchronního režimu a chce se posunout k monitorování, které dokáže rizikový krok zablokovat ještě před provedením.
OpenAI popisuje monitorování interních coding agentů
OpenAI zveřejnilo popis systému, který sleduje chování coding agentů nasazených uvnitř firmy. Monitor poháněný modelem GPT-5.4 Thinking vyhodnocuje konverzace, řetězce uvažování, volání nástrojů i jejich výstupy a upozorňuje na jednání odporující záměru uživatele nebo interním bezpečnostním pravidlům. Firma uvádí, že za pět měsíců sledovala desítky milionů trajektorií. Zaměstnanci samostatně nahlásili všechny případy, které monitor označil, systém ale objevil i další podezřelé chování. Přibližně tisíc konverzací vyvolalo upozornění střední závažnosti, žádná reálná konverzace zatím nedosáhla nejvyšší úrovně určené pro vzácné projevy schemingu. OpenAI zároveň přiznává omezení současného asynchronního režimu a chce se posunout k monitorování, které dokáže rizikový krok zablokovat ještě před provedením.