OpenAI zveřejnilo popis systému, který sleduje chování coding agentů nasazených uvnitř firmy. Monitor poháněný modelem GPT-5.4 Thinking vyhodnocuje konverzace, řetězce uvažování, volání nástrojů i jejich výstupy a upozorňuje na jednání odporující záměru uživatele nebo interním bezpečnostním pravidlům. Firma uvádí, že za pět měsíců sledovala desítky milionů trajektorií. Zaměstnanci samostatně nahlásili všechny případy, které monitor označil, systém ale objevil i další podezřelé chování. Přibližně tisíc konverzací vyvolalo upozornění střední závažnosti, žádná reálná konverzace zatím nedosáhla nejvyšší úrovně určené pro vzácné projevy schemingu. OpenAI zároveň přiznává omezení současného asynchronního režimu a chce se posunout k monitorování, které dokáže rizikový krok zablokovat ještě před provedením.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.