Projekt Snorkel AI představil Senior SWE-Bench, open-source benchmark, který hodnotí AI agenty ne jako juniory, ale jako opravdové seniorní inženýry. Úkoly zahrnují přirozené instrukce připomínající reálnou komunikaci v týmu, runtime debugging z uživatelských reportů a kvalitativní hodnocení kódu včetně metriky „tasteful solves“. Benchmark používá vlastního validačního agenta s expertními recepturami pro psaní behaviorálních testů.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.