Nejmodernější audio velké jazykové modely podle nové studie výzkumníků z univerzity USC hůře interpretují informace za hranicí mluvených slov. Často berou řeč příliš doslova a unikají jim tón, emoce, důraz nebo výška hlasu, tedy paralingvistické signály, které tvoří důležitou část lidské komunikace. Tým vedený profesorem Mohammadem Soleymanim zjistil, že audio modely trpí silným jazykovým zkreslením, a vyvinul techniky, které jejich porozumění výrazně zlepšují. Součástí práce je i nový benchmark VoxParadox. Studii přijala konference ICML 2026. Výzkum začal loni v srpnu a navazuje na rostoucí nasazení hlasových asistentů. Audio modely se dnes používají v konverzačních nástrojích, jako jsou ChatGPT nebo Gemini.