01
Artificial Analysis vydal nový Intelligence Index v4.2
Artificial Analysis vydal verzi 4.2 svého Intelligence Indexu, který má lépe měřit schopnosti modelů v úlohách připomínajících skutečnou práci. Aktualizace přidává hodnocení AA-Briefcase pro agentní znalostní práci a test Surge GDP.pdf nad dlouhými dokumenty. Autoři zároveň omezili prostor pro optimalizaci na známé testy pomocí neveřejných sad, posílili váhu úloh, které modely ještě neviděly, a upravili infrastrukturu vyhodnocování. Změna přichází jako mezikrok před plánovanou verzí 5, protože podle Artificial Analysis se schopnosti modelů mění rychleji než dříve. Nový index proto nesleduje jen znalosti, ale také práci s dlouhým kontextem, nástroji a více částmi složitějšího úkolu. Výsledky je stále potřeba číst s vědomím, že metodiku i testy připravuje samotný provozovatel žebříčku.
02
OpenAI Codex dostává dovednosti a lepší práci s repozitáři
OpenAI rozšířila Codex o několik funkcí, které mají zjednodušit práci s většími softwarovými projekty. Nové Skills umožňují přidávat opakovaně použitelné instrukce a pracovní postupy, takže agent může stejnou specializovanou činnost provádět konzistentněji napříč úkoly. Aktualizace zároveň zlepšuje navigaci v repozitářích a práci s jejich strukturou, což je důležité hlavně při změnách zasahujících více souborů. Firma popisuje také širší možnosti konfigurace prostředí a sdílení postupů mezi týmy. Praktický dopad bude záviset na tom, jak dobře si vývojáři vlastní Skills nastaví a jak přesně omezí pravomoci agenta při práci s kódem v týmu.
03
Zed přidává do editoru autonomní agenty pro práci v kódu
Vývojářský editor Zed představil autonomní agenty, kteří mohou v projektu samostatně procházet soubory, navrhovat změny a provádět více kroků podle zadaného úkolu. Funkce míří na práci, při níž nestačí jednorázové doplnění kódu, například na úpravy napříč repozitářem nebo kontrolu výsledku po změně. Zed současně zdůrazňuje lokální a týmovou kontrolu nad prostředím, ve kterém agent pracuje. Pro vývojáře tak nejde jen o další chatovací okno, ale o přesun části běžné práce přímo do editoru. Výsledek bude záviset na kvalitě plánování agenta, dostupných nástrojích a možnosti bezpečně vracet jeho zásahy v celém projektu.
04
Atlassian spouští Rovo Dev pro agentní práci vývojářů
Atlassian uvedl Rovo Dev, nástroj zaměřený na agentní práci při vývoji softwaru. Podle oznámení má pomáhat s úkoly v kódové základně, včetně orientace v projektu, návrhu změn a provádění navazujících kroků podle zadání. Nástroj zapadá do širší platformy Atlassianu, takže může využívat kontext práce týmů a jejich projektové dokumentace. To je současně jeho hlavní odlišnost i zdroj možného rizika: čím více systémů agent propojí, tím důležitější bude nastavení oprávnění a kontrola akcí před jejich provedením. Rovo Dev proto ukazuje, jak se agentní funkce přesouvají z experimentálních chatů do běžných nástrojů pro vývojové týmy.
05
ASCII smuggling se ze zbraně proti AI mění v nástroj spamerů
Technika známá jako ASCII smuggling se podle Ars Technica rozšířila z útoků na AI systémy také do masového spamu. Útočníci používají speciální blok neviditelných znaků Unicode, které mohou pro člověka vypadat jako prázdný obsah, ale jazykový model nebo filtr je stále zpracuje. Dříve se tento princip používal hlavně k ukrytí instrukcí pro prompt injection v e-mailech a dalších nedůvěryhodných datech. Microsoft letos zaznamenal prudký nárůst podpisů spojených s touto technikou v Defenderu pro Office, z desítek tisíc detekcí denně na více než milion. Stejná vlastnost, která pomáhá obcházet ochranu AI agentů, nyní pomáhá spamerům maskovat slova před filtry.
06
Výzkumníci ukázali nový způsob útoku na AI agenty
Výzkumníci popsali útok nazvaný ToxicSkills, který využívá dovednosti instalované do AI agentů. Pokud agent načte škodlivý nebo nedůvěryhodný balíček instrukcí, může získat postupy vedoucí k úniku citlivých dat nebo k provedení nežádoucích akcí. Problém se týká hlavně systémů, které agentům dovolují automaticky vyhledávat, instalovat a spouštět rozšíření z více zdrojů. Bezpečnostní dopad proto neleží pouze v samotném modelu, ale také v distribučním řetězci dovedností a v oprávněních běžícího agenta. Studie upozorňuje, že kontrola původu balíčku a izolace jednotlivých úkolů by měly být součástí návrhu agentních platforem, ne až dodatečnou opravou po incidentu.
07
Samsung ukázal paměti HBM4 s vyšší kapacitou pro AI akcelerátory
Samsung představil nové paměťové produkty určené pro servery a akcelerátory umělé inteligence. Firma popisuje kombinaci HBM4 s kapacitou 36 GB na stack a řešení HBM4E, které má nabídnout vyšší propustnost i kapacitu pro náročnější modely. U AI infrastruktury se tím řeší stále výraznější úzké hrdlo mezi výpočetními čipy a pamětí: moderní modely potřebují přesouvat velké objemy vah a mezivýsledků při trénování i inferenci. Samsung zároveň ukázal novou generaci pamětí GDDR7 a další produkty pro datacentra. Dodávky konkrétních variant budou záviset na validaci u zákazníků, ale vývoj potvrzuje, že paměť je pro další škálování AI stejně důležitá jako samotné akcelerátory.
08
MonoCode nabízí jedno rozhraní pro coding agenty
MonoCode je desktopová aplikace, která sjednocuje práci s několika coding agenty v jednom grafickém rozhraní. Podle repozitáře umí spouštět Claude Code, Codex, Cursor, Grok Build, OpenCode, Pi, omp a fx, pokud jsou nástroje nainstalované a uživatel je přihlášený. Každá relace má vlastní záložku a aplikace nepřidává další prodej tokenů, ale využívá existující předplatná. Projekt podporuje macOS, Linux i Windows. Pro Linux nabízí balíček deb a AppImage, pro Windows instalační program a pro macOS obraz disku. Repozitář upozorňuje, že jde o raný projekt, u kterého lze čekat chyby. MonoCode tak míří na vývojáře, kteří střídají více agentních nástrojů a chtějí jejich relace sledovat z jednoho místa bez přepínání mezi samostatnými terminály.
09
Toolcall-doctor zmenšuje reprodukce chyb v nástrojích LLM
Open-source nástroj toolcall-doctor automatizuje zmenšování požadavků, které reprodukují chyby při volání nástrojů velkým jazykovým modelem. Uživatel dodá původní požadavek a kontrakt s podmínkami, které musí při zjednodušování zůstat zachované. Nástroj postupně odstraňuje nástroje, části schémat a další prvky, po každém kroku znovu ověří chování modelu a ponechá jen změny, při nichž chyba stále nastává. Repozitář rozlišuje živou minimalizaci s OpenAI kompatibilním serverem od demonstračního režimu, který pouze přehrává uložený běh bez volání modelu. Autoři uvádějí ověření na Ollamě s modelem llama3.2:3b, nejde ale o srovnávací test napříč modely. Výsledkem má být menší reprodukce použitelná při ladění runtime, schémat a implementací tool-calling rozhraní.
10
Thinkst nasazuje past, která odhaluje nebezpečné AI agenty
Bezpečnostní firma Thinkst představila Agent Provocateur, novou podobu svých Canary nástrojů pro odhalování AI agentů pohybujících se v síti. Služba se vydává za užitečný webserver a agentovi nabídne pomoc s jeho cílem. Pokud agent začne s nastraženou službou komunikovat, bezpečnostní tým dostane upozornění a může sledovat další kroky. Thinkst popisuje, že agenti jsou při práci s daty náchylní k sociálnímu inženýrství, protože výstup z okolí přímo vstupuje do jejich rozhodování. Agent Provocateur může klást doplňující otázky a pokusit se útočníka udržet v interakci, například žádostí o informace o plánovaných akcích nebo systému. Firma uvádí, že aktualizaci postupně nasazuje zákazníkům do Consoles a Canary prostředí. Zároveň upozorňuje, že nastražený modul nenahrazuje další bezpečnostní kontroly a část odpovědí agentů může být smyšlená.
11
Nscale hledá před IPO financování za 3,5 miliardy dolarů
Nscale, britský poskytovatel výpočetní infrastruktury pro AI, hledá před plánovaným vstupem na burzu další financování. Firma podle zveřejněných informací zvažuje prodej konvertibilních dluhopisů za 1,5 miliardy dolarů a současně jedná o investici ve výši 2 miliard dolarů od Nvidie. Nscale už letos získala velké peníze v kole vedeném fondem Aker a nedávno uzavřela dlouhodobou dohodu s Anthropicem na dodávky výpočetního výkonu. Společnost přitom investorům prezentuje také vysoké budoucí příjmy založené na podepsaných nájemních smlouvách. Nejde tedy o současné tržby, ale o projekci. Případné IPO by se mohlo uskutečnit ještě během září, pokud firma splní své plány.
12
Roland uvádí generativní hudební plugin Melody Flip
Roland vstupuje do generativní hudby nástrojem Melody Flip. Jde o plugin pro digitální audio pracovní stanice, který nabízí zhruba 250 tematických palet a z nich vytváří krátké hudební nápady. Uživatel si může nechat připravit melodii, akordy, basovou linku nebo bicí, případně nástroji dodat referenční skladbu. Výsledkem nejsou hotové písně s vokály a aranžmá, ale jednoduché smyčky určené k dalším úpravám v hudebním programu. Ovládání je omezené na volbu žánru, hustoty not, tempa a tóniny. Roland tak cílí spíše na rychlý tvůrčí start než na automatickou výrobu celé skladby. Plugin je určen hudebníkům, kteří chtějí začít pracovat s nápadem bez dlouhého nastavování nástroje.
13
TokenOps hlídá rozpočty AI agentů mezi jednotlivými běhy
Open-source projekt TokenOps přidává AI agentům rozpočtovou kontrolu na úrovni jednotlivých běhů. Před každým voláním modelu nebo nástroje vyhodnocuje, kolik prostředků už úloha spotřebovala, a může běh zastavit nebo přesměrovat podle zvolené politiky. Sdílený účet funguje i mezi více procesy, takže limit nemusí obcházet paralelní části jednoho agenta. Autoři uvádějí až 65procentní omezení zbytečné spotřeby, tento údaj ale vychází z jejich vlastního popisu projektu. Knihovna pro Python nabízí deset předpřipravených politik a rozhraní pro vlastní pravidla. Projekt je dostupný pod licencí MIT a jeho repozitář dostal novou aktualizaci během dneška. Důraz je na přehled o nákladech a předvídatelné chování při práci s více nástroji.
14
ForgeGuardian skenuje rizika v AI dodavatelském řetězci
ForgeGuardian představuje lokální skener dodavatelského řetězce pro běžné balíčky i AI projekty. Dokumentace uvádí osm skenovacích enginů, podporu devíti ekosystémů a více než 223 detekčních signatur. Nástroj kombinuje kontrolu známých zranitelností, škodlivých instalačních skriptů, typosquattingu, prompt injection v MCP nástrojích a nebezpečných vah modelů. Umí pracovat offline a nabízí také tvorbu SBOM, pravidla jako kód, ověřování přes Sigstore, webhooky a napojení na CI/CD. Součástí je volitelná AI analýza nálezů a návrhy oprav. Jde o mladý open-source projekt, takže uvedený rozsah funkcí je třeba chápat jako stav popsaný autory repozitáře, nikoli jako nezávislý bezpečnostní audit. Vývojáři ho mohou spustit lokálně před odesláním změn do sdíleného repozitáře.
15
Coarse nabízí AI recenze akademických článků
Coarse je open-source nástroj pro AI recenzování akademických článků. Po dodání dokumentu vytvoří recenzi přes příkazovou řádku nebo webové rozhraní a používá vlastní klíč k modelové službě, takže náklady zůstávají na uživateli. Projekt podporuje PDF, TXT, Markdown, LaTeX, DOCX, HTML a EPUB. U PDF počítá s extrakcí textu a kontrolou pomocí modelu, u ostatních formátů se snaží zpracovat obsah lokálně. Autoři uvádějí, že běžná recenze vyjde obvykle pod dva dolary, což závisí na použitém modelu a délce článku. Nástroj nabízí také napojení na lokální CLI předplatné Claude, Codex nebo Gemini, pokud je uživatel už přihlášený. Výsledná recenze nenahrazuje odborné posouzení, může ale urychlit první kontrolu struktury a argumentace.
16
Spotify popsal, jak snížil spotřebu tokenů v Claude Code
Spotify popsal vlastní postup, který podle interního měření snížil spotřebu tokenů v Claude Code při práci s kódem přibližně o 90 procent. Princip spočívá v rozdělení úloh podle náročnosti: dražší model řeší rozhodování a složitější práci, zatímco čtení většího množství souborů nebo tvorbu předvídatelného kódu přebírá levnější worker model. Firma k tomu využívá AiKA Modes v Portalu, kde lze deklarativně nastavit model, instrukce, parametry a MCP nástroje. Plugin shunt přes hooky zachytí čtení velkých souborů a přesměruje ho do specializovaného režimu. Spotify zároveň upozorňuje, že tento přístup není vhodný pro debugging, architektonická rozhodnutí ani bezpečnostně kritický kód. Delegace také přidává síťovou latenci, takže se vyplatí hlavně u větších opakovatelných úloh.
17
Moadim plánuje běhy AI agentů bez systémového cronu
Open-source projekt Moadim nabízí server pro plánování opakovaných běhů AI agentů. Uživatel v něm definuje smyčku pomocí promptu, harmonogramu a vybraného agenta, který pak pracuje nad repozitářem v izolovaném pracovním prostředí. Nástroj podporuje Claude, Codex, Hermes, NanoClaw i Pi a sleduje běhy pomocí watchdogu. Místo systémového cron démona používá vlastní přenosný scheduler a jeden lokální port vystavuje webové rozhraní, REST API i MCP server. Moadim je napsaný v Rustu a instaluje se například přes Cargo, Homebrew nebo npm. Pro spouštění rutin ale vyžaduje tmux, protože jednotlivé úlohy běží v samostatných relacích. Projekt tak míří na vývojáře, kteří chtějí agentní úkoly spouštět pravidelně a kontrolovat jejich stav bez ručního zadávání každého dalšího kroku.
18
Rubato mění čekání na AI agenta v připomínku přestávky
Rubato je malý stolní doplněk s retro displejem, který sleduje stav relace AI coding agenta a podle délky čekání připomíná uživateli přestávku. Zařízení postavené na ESP8266 a barevném displeji o rozlišení 240 krát 240 pixelů zobrazuje, zda agent přemýšlí, generuje nebo dokončil úlohu. Při delším běhu může zobrazit celoobrazovkovou připomínku k napití, odpočinku očí, protažení krku nebo změně polohy. Stav se přenáší přes MQTT a zařízení podle dokumentace nečte ani nezobrazuje text zpráv. Projekt má také hodiny, počasí, webové nastavení a aktualizace firmwaru s ochranným režimem proti nepovedenému upgradu. Repozitář obsahuje firmware i nástroje a autoři zveřejňují pluginy pro několik agentů včetně Cursoru, OpenCode a DeepSeek Harness. Rubato se tak snaží spojit hardwarový doplněk s hygienou práce u dlouhých agentních úloh.
19
Aegis staví bezpečnostní sidecar pro AI agenty
Aegis se představuje jako bezpečnostní sidecar pro AI agenty, který kontroluje volání nástrojů ještě před jejich předáním dál. Podle dokumentace má Rustová datová vrstva běžet přímo v cestě mezi modelem a nástrojem, zatímco pravidla a compliance obsluhuje Pythonová řídicí vrstva mimo kritickou cestu. Systém může rozhodnutí zamítnout přes HTTP 403, kontrolovat allowlisty, role, pořadí akcí, podpisy nebo schválení člověkem a vytvářet podepsané záznamy o rozhodnutí. Volitelný linuxový uzel má pomocí BPF LSM omezovat také operace open, exec a connect podle deklarace nástroje. Aegis přidává testovací canary pro prompt injection a další útoky a uvádí podporu OpenAI kompatibilních agentů bez úprav SDK. Projekt zároveň upozorňuje, že obcházení sidecaru ochranu vyřadí a že prostředí Docker Desktopu nepokrývá stejné kernelové blokování jako Ubuntu.
20
ActraDeck dává rizikové akce AI coding agentů před člověka
ActraDeck je lokální ovládací panel pro Claude Code a Codex, který zachytává rizikové akce agentů a před jejich provedením je předkládá člověku ke schválení. Nástroj umí rozpoznané přihlašovací údaje zamaskovat ještě před uložením události a jednotlivé relace uchovává pro pozdější přehrání. Podle dokumentace běží bez cloudového účtu a ve výchozím nastavení se váže jen na lokální loopback rozhraní. Nabízí režim Attach pro pozorování práce agentů i Managed Mode, v němž může u podporovaných nástrojů zprostředkovat schvalování. Autoři ale zdůrazňují, že jde o raný projekt a klasifikace příkazů ani redakce tajných údajů nepředstavují úplnou bezpečnostní hranici. ActraDeck proto nenahrazuje sandbox a jeho účinnost závisí na použitém agentovi a způsobu spuštění.
21
MachineMind promění fotku stroje v plán údržby s AI agentem
MachineMind představuje průmyslový nástroj, který z fotografie zařízení připraví podklady pro preventivní údržbu a navazující práci AI agenta. Uživatel nahraje snímek stroje a služba z něj vytváří údržbový balíček s plánem, prioritami, termíny, evidencí, školením a podklady pro audit. Agent potom sleduje otevřené úkoly, ptá se na chybějící informace a připomíná následné kroky, aby se předešlo odkládání údržby. Projekt uvádí také živou paměť, která propojuje priority, otázky, časové údaje a důkazy z pokračující práce. Prototyp nabízí angličtinu a latinskoamerickou španělštinu a podle stránky počítá s omezeným bezplatným používáním v prohlížeči. MachineMind současně popisuje ukládání tajných údajů na serveru, řízení přístupu a šifrování přenosu i uložených dat.
22
GateKeep402 chrání AI agenty před nechtěnými platbami
Open-source projekt GateKeep402 přidává AI agentům bezpečnostní vrstvu pro platby přes protokol x402. Před odesláním peněz kontroluje, zda požadavek skutečně pochází z ověřeného HTTP 402, a porovnává doménu s lokální historií důvěry. Agent pak může platbu automaticky povolit, zablokovat, nebo předat člověku ke schválení. Po zaplacení projekt ověřuje, že server vrátil smysluplná data, nikoli prázdnou odpověď, podvrženou chybovou stránku nebo nečekané přesměrování. Výsledky ukládá do lokální databáze SQLite, kde neúspěšná doručení snižují reputaci výrazněji než běžné úspěchy. GateKeep402 podle dokumentace používá také externí signály ERC-8004 jen jako doplňkové ověření a jeho prototyp byl testován na veřejném Solana Devnetu. Repozitář zatím představuje raný projekt, nikoli hotový bezpečnostní standard.
23
Codex Astra uchovává poznámky i po zaplnění kontextu
Codex dostává s funkcí Astra nový způsob práce s dlouhými relacemi. Gabriel Chua z týmu Codex na síti X popsal, že Astra umí při zaplnění kontextového okna uchovat a později znovu načíst průběžné poznámky. Systém tak nemusí opakovaně stlačovat celou historii práce do jediného souhrnu, který může ztratit důležité detaily. Poznámky mají zachovat nastřádané informace i při přechodu do dalšího kontextového okna. Zveřejněný příspěvek uvádí, že navazující post popíše způsob zapnutí funkce, samotné oznámení ale zatím neuvádí podrobnosti o dostupnosti, omezeních ani podporovaných plánech. Astra tak představuje praktickou změnu pro delší agentní úlohy v Codexu, její přesné chování bude záviset na dokumentaci a zkušenostech z používání. OpenAI přitom už dříve představilo Astru jako modelovou řadu, nová zpráva se týká konkrétní práce Codexu s kontextem.