Projekt EEBench zveřejnil nový test pro hodnocení elektronických obvodů navržených jazykovými modely. Místo samotného sledování, zda agent zvládne ovládat grafický editor KiCad, kontroluje, jestli výsledný návrh splní elektrické požadavky a projde simulací. Autoři popisují úlohy založené na reálných obvodech, například na záložním napájení elektroměru, kde musí návrh udržet procesor v chodu po výpadku zdroje. Benchmark má oddělit znalosti modelu od schopnosti pracovat s CAD nástrojem a vytvořit prostor pro další post-training. EEBench zároveň upozorňuje, že současné modely často rozumějí elektronice lépe, než naznačují jejich první výstupy v konvenčních návrhových nástrojích. Výsledky tak mají ukázat nejen to, zda AI něco nakreslí, ale zda to bude skutečně fungovat.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.