LLM-as-a-Judge je způsob hodnocení, při kterém jazykový model posuzuje výstupy jiného modelu nebo AI aplikace podle předem zadaných kritérií. Může porovnávat více odpovědí, kontrolovat jejich správnost, užitečnost nebo styl a pomáhat při testování ve velkém měřítku. Protože i hodnoticí model může být zaujatý nebo se mýlit, důležitá rozhodnutí se ověřují lidským hodnocením nebo pevnými pravidly.