Výzkumníci kvantitativně porovnali dva specializované klinické AI nástroje OpenEvidence a UpToDate Expert AI s obecnými modely GPT-5.2, Gemini 3.1 Pro a Claude Opus 4.6. V třífázovém hodnocení na 500 lékařských dotazech MedQA, 500 HealthBench položkách a na reálných klinických dotazech od lékařů obecné LLM ve všech třech kategoriích porazily specializované nástroje. Studie publikovaná v Nature Medicine zdůrazňuje potřebu nezávislého testování AI nástrojů dříve, než vstoupí do klinické praxe.
Obecné LLM překonávají specializované klinické AI nástroje v lékařských testech
Studie v Nature Medicine ukazuje, že obecné LLM jako GPT-5.2 a Claude Opus 4.6 překonávají specializované klinické AI nástroje.