Během několika dnů dorazily tři modely, které se snaží předefinovat, co má znamenat „nejlepší AI“. Claude Fable 5.1 míří na dlouhé a náročné úkoly, GPT-6 Astra sází na samostatné agenty a Gemini 3.8 Flash chce nabídnout co nejvíce výkonu za co nejnižší cenu.

Na první pohled to vypadá jako další souboj o jednu vítěznou příčku v žebříčku. Jenže dostupná čísla ukazují něco zajímavějšího: každý z těchto modelů vyhrává jinou disciplínu. A pokud někdo hledá jediného univerzálního šampiona, nejspíš hledá odpověď na špatnou otázku.

Srovnání na jednom místě

Nejčistší společné srovnání nabízí nezávislý Artificial Analysis Intelligence Index. Ten dává Fable 5.1 skóre 66, GPT-6 Astra 61 a Gemini 3.8 Flash 59. Agentní programování je ale samostatná metrika a její výsledky závisejí také na tom, v jakém nástroji nebo testovacím prostředí model běží.

Metrika Claude Fable 5.1 GPT-6 Astra Gemini 3.8 Flash
Intelligence Index 66 61 59
Coding Agent Index 70* 67** V tomto indexu neuvedeno
Vstup / výstup (USD za 1 mil. tokenů) 10 / 50 10 / 50 0,75 / 3,75***
Kontext 1 mil. tokenů 1,05 mil. tokenů 1 mil. tokenů
Max. výstup 128 tisíc tokenů 128 tisíc tokenů 64 tisíc tokenů

* Fable 5.1 dosáhl skóre 70 v prostředí Claude Code. ** Astra dosáhl skóre 67 v prostředí Codex. Nejde tedy o čistý laboratorní test tří modelů za naprosto stejných podmínek. *** Cena Gemini 3.8 Flash platí podle aktuálního ceníku do 31. prosince 2026; poté se má zvýšit na 1,50 dolaru za vstup a 7,50 dolaru za výstup za milion tokenů.

Čísla v přehledu také nejsou procenta úspěšnosti. Rozdíl mezi 66 a 61 neznamená, že je jeden model přesně o deset procent chytřejší. Index je složené pořadí, které pomáhá zachytit trend, ne přesný převod kvality do běžné konverzace.

Fable 5.1 chce vyhrát dlouhý běh, ne rychlou odpověď

Fable 5.1 má z trojice nejlepší výsledek v obecném Intelligence Indexu a zároveň vede v agentním programování podle výsledků Artificial Analysis. To je důležitá kombinace. Neříká jen, že model umí vyřešit izolovaný problém, ale naznačuje, že se dokáže držet složitějšího zadání i ve chvíli, kdy práce vyžaduje více kroků, nástrojů a oprav.

Anthropic u Fable 5.1 uvádí, že typické tokenové účty mohou být přibližně o čtvrtinu nižší než u předchozí generace. U vysoce agentních úloh mají úspory dosáhnout až zhruba 45 procent, především díky levnějšímu čtení obsahu z mezipaměti. Základní cena přitom zůstává na 10 dolarech za vstup a 50 dolarech za výstup za milion tokenů.

Fable tak není levný model v běžném smyslu. Jeho argument je jiný: když díky menšímu počtu opakovaných kroků a lepší práci s kontextem dokončí úkol rychleji, může vyjít levněji než levnější model, který se při stejné práci zamotá a začne spotřebovávat další tokeny. Právě proto dává smysl i příklad několika paralelních relací Claude Code – hodnota modelu se ukazuje až v celém pracovním procesu, ne v jedné odpovědi.

Astra je méně přesvědčivá na papíře, ale silná v kódu

GPT-6 Astra působí jako model se dvěma tvářemi. V obecném Intelligence Indexu má 61 bodů, tedy méně než Fable 5.1, ale v Coding Agent Indexu dosahuje 67 bodů a přibližuje se špičce. Artificial Analysis navíc uvádí výraznou tokenovou efektivitu: při maximálním úsilí Astra spotřebuje přibližně třetinu tokenů oproti GPT-5.6 Sol ve stejném typu testu.

To je možná praktičtější zlepšení než další desetiny bodu v akademickém benchmarku. U agenta, který několik hodin prochází repozitář, spouští testy a opravuje chyby, totiž účet neurčuje jen cena za token. Rozhoduje i to, kolik slepých uliček model vytvoří, kolikrát zopakuje stejnou práci a zda si udrží přehled o celém úkolu.

Oficiální dokumentace OpenAI uvádí u Astry kontextové okno 1,05 milionu tokenů, maximální výstup 128 tisíc tokenů a cenu 10 dolarů za vstup a 50 dolarů za výstup za milion tokenů. Artificial Analysis ale upozorňuje, že vyšší cena proti předchozí generaci část efektivity smaže. Astra tedy není automaticky levná – levnější může být až ve chvíli, kdy skutečně dokončí práci s menším počtem tokenů.

Zajímavý je také pokles halucinací v testu AA-Omniscience. Podle Artificial Analysis klesla u Astry při maximálním úsilí míra halucinací z 92 na 51 procent oproti GPT-5.6 Sol a přesnost se současně zvýšila o čtyři body. Je to výrazné zlepšení, ale stále to není důvod nechat agenta pracovat bez kontroly – 51 procent v konkrétním testu není totéž jako spolehlivost v každém reálném projektu.

Gemini 3.8 Flash hraje úplně jinou hru

Gemini 3.8 Flash má v obecném Intelligence Indexu 59 bodů, tedy méně než oba dražší konkurenti. To ale neznamená, že je mimo hru. Google ho staví jako model pro široké nasazení, kde je důležitá kombinace kvality, latence a ceny, nikoli maximální skóre v každé disciplíně.

Oficiální karta Google DeepMind uvádí kontext až 1 milion tokenů, maximální textový výstup 64 tisíc tokenů a nastavitelné úrovně úsilí. Model přijímá text, obrázky, zvuk i video. To z něj dělá přirozeného kandidáta pro aplikace, které zpracovávají velké množství různorodých vstupů a kde by použití modelu za 50 dolarů za milion výstupních tokenů bylo ekonomickým nesmyslem.

Na cenovce vypadá Gemini téměř absurdně levně: 0,75 dolaru za vstup a 3,75 dolaru za výstup za milion tokenů. Jenže výstupní cena zahrnuje i thinking tokeny a Google sám upozorňuje, že vyšší úroveň úsilí může znamenat větší spotřebu. Levný model tak nemusí být levný v úloze, která ho přiměje dlouho přemýšlet, opakovaně volat nástroje a generovat rozsáhlé mezivýsledky.

Právě tady se láme obvyklá představa o kategorii Flash. Gemini 3.8 Flash není pouze o rychlé krátké odpovědi. Pokud se z něj stává agent, který pracuje déle a důkladněji, mění se i jeho nákladový profil. Výhoda nízké ceny ale stále zůstává obrovská – hlavně pro vývojáře, kteří potřebují škálovat tisíce nebo miliony požadavků a mohou si dovolit hlídat délku výstupu.

Který model dává smysl v praxi?

Pro dlouhé výzkumné úkoly, složitý vývoj a práci, kde je důležitější kvalita celého procesu než cena jednotlivého tokenu, je nejsilnější kandidát Fable 5.1. Ne proto, že by měl nejvyšší číslo v jednom benchmarku, ale protože kombinuje nejvyšší obecné skóre s velmi silným agentním výkonem a úsporami při dlouhém běhu.

Pro programování s nástroji má velmi přesvědčivou pozici GPT-6 Astra. V agentním testu se drží blízko Fable 5.1, přitom díky tokenové efektivitě může mít lepší ekonomiku na dokončený úkol. Jeho slabina je jednoduchá a nepříjemná: pokud efektivitu v konkrétním workflow nepotvrdí, zůstane jen drahým modelem se stejnou cenou za milion tokenů jako Fable.

Gemini 3.8 Flash je nejzajímavější pro velký objem práce, multimodální vstupy a projekty, kde je rozpočet skutečným omezením. Skóre 59 v Intelligence Indexu není ostuda, zvlášť když model stojí zlomek ceny konkurence. Jen je potřeba počítat s tím, že nastavení vyššího úsilí může část cenové výhody postupně sníst.

Vítěz se přesunul z benchmarku do účtu za API

Před několika lety stačilo říct, který model má nejlepší skóre. Dnes je to příliš hrubé zjednodušení. Fable 5.1 vyhrává obecnou kvalitu, Astra ukazuje působivou efektivitu v agentním programování a Gemini 3.8 Flash nabízí cenovou škálu, na kterou se dražší modely nemohou dívat bez nervozity.

Můj verdikt je proto nepohodlný, ale praktický: nejlepší model je Fable 5.1, nejlepší volba pro agentní kódování může být GPT-6 Astra a nejlepší poměr ceny k dostupnému výkonu nabízí Gemini 3.8 Flash. Kdo z toho udělá jedno univerzální pořadí, přehlédne to nejdůležitější – AI model se nekupuje do vitríny, ale nasazuje se do konkrétní práce.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.