Nový model GPT-5.6 Sol má zvládat dlouhé úkoly, programování a práci s počítačem s výrazně menším dohledem člověka. Jeden z prvních veřejně popsaných incidentů ale ukazuje také odvrácenou stranu této autonomie.
Matt Shumer, CEO společnosti HyperWrite, uvedl, že mu agent využívající GPT-5.6 Sol během práce s počítačem smazal téměř všechny soubory uložené na Macu. Na síti X zveřejnil snímek komunikace, ve kterém agent přiznává spuštění chybného příkazu pro odstranění souborů.
Rozsah škody zatím nebyl nezávisle ověřen. Případ proto nelze vydávat za důkaz, že GPT-5.6 Sol běžně maže uživatelská data. Jde ale o názornou ukázku toho, co se může stát, když AI agent získá přístup k terminálu a možnost vykonávat nevratné operace bez průběžného potvrzování.
Jeden chybný příkaz stačil
Podle zveřejněného snímku agent při úklidu pracovního prostředí nesprávně pracoval s umístěním domovského adresáře a spustil příkaz:
rm -rf /Users/mattsdevbox
Příkaz rm -rf odstraní zadaný adresář včetně jeho obsahu bez přesunutí souborů do koše. Jejich následná obnova závisí především na existenci zálohy a na stavu úložiště.
Shumer uvedl, že výsledkem bylo smazání téměř všech souborů na jeho Macu. Zároveň napsal, že po této zkušenosti výrazně více důvěřuje konkurenčnímu modelu Fable od společnosti Anthropic. Jde však o jeho osobní hodnocení po konkrétním incidentu, nikoliv o nezávislé porovnání bezpečnosti obou modelů.
OpenAI se podle dostupných informací k samotnému případu veřejně nevyjádřila.
Sol má být nejschopnějším modelem GPT-5.6
OpenAI uvedla rodinu GPT-5.6 společně s novým prostředím ChatGPT Work. To má spojovat schopnosti ChatGPT a Codexu a umožnit agentům pracovat s dokumenty, tabulkami, webovými aplikacemi i připojenými firemními službami.
Rodina GPT-5.6 zahrnuje několik modelů určených pro rozdílné typy práce. Sol představuje nejvýkonnější variantu zaměřenou na složité úlohy, programování, kybernetickou bezpečnost a vědeckou práci.
Právě vysoká autonomie je jedním z hlavních důvodů, proč mohou být podobné modely užitečné. Agent dokáže úkol rozdělit na menší části, používat nástroje a pokračovat v práci bez toho, aby člověk schvaloval každý jednotlivý krok.
Stejná vlastnost ale zvyšuje následky případné chyby.
Chatbot může poradit špatně. Agent může chybu rovnou provést
U běžného chatbota většinou chyba skončí nesprávnou odpovědí. Uživatel ji může ignorovat, opravit nebo si informace ověřit.
Agent s přístupem k počítači může chybnou úvahu okamžitě převést do skutečné akce. Může změnit zdrojový kód, upravit konfiguraci serveru, odeslat zprávu, zasáhnout do databáze nebo odstranit soubory.
Problém proto nespočívá pouze v tom, zda model dokáže správně vyhodnotit situaci. Stejně důležité je, jaké pravomoci mu umožní samotná aplikace.
Nebezpečné operace by neměly záviset jen na rozhodnutí jazykového modelu. Mazání rozsáhlých adresářů, zásahy do produkčních databází nebo změny mimo vyhrazenou pracovní složku by měla aplikace blokovat nebo před jejich provedením vyžadovat výslovné potvrzení uživatele.
Výkon se měří snáze než bezpečnost
Při uvedení GPT-5.6 se pozornost soustředila hlavně na výkon, rychlost a cenu. Podle dostupných benchmarků patří Sol mezi nejschopnější současné modely a má nabídnout vysoký výkon při nižších nákladech než některé konkurenční systémy.
Benchmarky však obvykle hodnotí především to, zda model dokázal úkol dokončit. Podstatně hůře zachycují, zda při práci zbytečně neriskoval, nepochopil vedlejší instrukci příliš široce nebo neprovedl operaci, kterou uživatel neočekával.
Model může v testu získat vysoké skóre a současně se v reálném prostředí dopustit chyby s vážnými následky. Čím více nástrojů a oprávnění dostane, tím menší prostor zůstává pro lidskou kontrolu před provedením akce.
Odpovědnost neleží jen na modelu
Incident nelze jednoduše uzavřít tvrzením, že GPT-5.6 Sol je nebezpečný model. Ke smazání souborů mohlo dojít jen proto, že agent dostal přístup k systému a oprávnění spouštět příkazy.
Bezpečnost agentních nástrojů proto závisí na několika vrstvách:
- schopnostech a spolehlivosti samotného modelu,
- omezeních aplikace, ve které pracuje,
- přidělených oprávněních,
- izolaci pracovního prostředí,
- dostupnosti záloh a verzování,
- potvrzování rizikových operací uživatelem.
Spoléhat pouze na to, že dostatečně chytrý model chybu neudělá, není bezpečnostní strategie. Je to spíš optimismus převlečený za technický návrh.
Autonomní agent potřebuje pevné hranice
Případ Matta Shumera je zatím jediným veřejně popsaným incidentem, jehož rozsah není nezávisle potvrzený. Přesto dobře ukazuje základní problém nastupujících AI agentů.
Čím schopnější model je, tím více práce mu uživatelé chtějí svěřit. A čím více práce mu svěří, tím větší škodu může způsobit jediná chyba.
Agent pracující s důležitými daty by měl mít omezený přístup pouze k určenému adresáři, používat verzovací systém a pracovat se zálohovanými daty. Zásahy mimo pracovní prostředí a nevratné operace by měly vždy vyžadovat samostatné potvrzení.
GPT-5.6 Sol může být mimořádně schopný pracovní a programovací nástroj. Schopnost dokončit složitý úkol ale sama o sobě nezaručuje, že jej model dokončí bezpečně.
U agentů proto nebude rozhodující pouze otázka, co všechno dokážou. Stejně důležité bude, co všechno jim jejich tvůrci a uživatelé dovolí udělat.